DC娱乐网

小米MiMo负责人罗福莉把大模型强化学习的训练过程直接直播了。1568条提示、每条16次尝试、一步烧掉20亿Token,两个模型加起来每小时花3万多美元。页面实时滚动着训练进度、显卡故障、奖励曲线,连报错都挂着。有人说这是透明,我看更像是在告诉还在憋PPT的同行:牌桌上没你的位置了。以前卷预训练数据

小米MiMo负责人罗福莉把大模型强化学习的训练过程直接直播了。1568条提示、每条16次尝试、一步烧掉20亿Token,两个模型加起来每小时花3万多美元。页面实时滚动着训练进度、显卡故障、奖励曲线,连报错都挂着。有人说这是透明,我看更像是在告诉还在憋PPT的同行:牌桌上没你的位置了。以前卷预训练数据,后来卷标注,现在直接卷谁能在复杂环境里让AI自己犯错自己爬。裁判打分烧的算力快追上模型思考了,这哪是算法竞赛,这是工程军备。普通人看个热闹,但有个道理很朴素:敢把失败也摆上台面的人,往往赢面最大。那些连训练日志都不敢晒的团队,拿什么让人信?