DeepSeek最近发的那篇论文里,有一个数据我印象特别深。大概90%的沙盒容器,平均CPU使用量不到申请资源的5%。什么意思呢?就是这些训练环境大部分时间都在“闲着”。但它们不能关,因为AI随时可能回来接着练。所以资源得一直占着。传统的大模型训练,是“喂数据、算结果”,环境是静态的。但AI智能体训练不一样,它要在环境里真的写代码、跑命令、改文件。每一步都会改变环境状态。所以每个AI都需要自己的独立空间。那么,问题就来了。你有几十万个环境同时挂着,大部分在等AI想下一步,CPU闲着但不能放。传统“跑完就扔”的思路根本撑不住。所以DeepSeek要专门做一套东西来解决。怎么让几十万个“活着的环境”同时在线,还得在GPU被抢走的时候把状态存好、等资源回来接着用。以前聊AI训练,大家第一反应是“缺GPU”。但AI要真干活之后,瓶颈可能不在算力,在“怎么让AI有个地方踏实练”。
