我其实挺喜欢字节 Seed 这次“不靠蒸馏别人来追模型能力”的思路。
因为这件事真正重要的,可能根本不是“蒸馏好不好”,而是:**一家想做 Frontier Model 的公司,到底是追答案,还是找规律。**
如果今天 Claude、GPT、Gemini 某个能力突然变强,最简单的办法是什么?
大量采样它的输出,拿回来训练,benchmark 很快就能涨,团队 KPI 也很好看。
但问题是:
**你得到了能力,不代表你理解了能力。**
你知道什么样的答案是对的,却未必知道:
为什么 pre-training 到这里突然出现这种能力?为什么某种数据能提升泛化?为什么 RL 能让 reasoning 突然变强?到底是 architecture、data、reward,还是 scaling 在起作用?
这其实是一种“认知债务”。
老师能考 97 分,你通过模仿老师,也许很快就能从 90 分追到 96 分。
但问题来了:
**97 到 100,怎么走?**
如果你的方法论一直都是“模仿最强的人”,那你大概率只能越来越像他,却很难发现他也没找到的东西。
所以我觉得张一鸣这个思路最有价值的地方,是在改变整个研究团队的激励函数。
没有那么强的短期榜单 KPI 以后,模型能力不够怎么办?
那就只能真的去研究:
数据到底哪里有问题,pre-training 怎么改,RL environment 怎么设计,reward 怎么塑造模型行为,architecture 哪里还能变,inference-time compute 怎么扩展,为什么这个 case 会失败。
**你不得不把机器拆开,真正去理解智能到底是怎么产生的。**
这对一家真正想冲击 AGI 的公司,可能比短期 leaderboard 排名重要得多。
当然,我并不认为“蒸馏”这项技术本身没有价值。
如果未来字节自己训练出了一个巨大的 frontier model,再把自己的能力蒸馏到更小、更便宜的模型里,用来降低推理成本,这完全合理。
所以我更认可的表达其实是:
**核心智能自己发现,部署效率可以自己蒸馏。**
不靠蒸馏别人获得 intelligence,但可以蒸馏自己压缩 intelligence。
这是两件完全不同的事情。
今天中国大模型竞争很容易变成:
Kimi 出一个 → Qwen 跟 → DeepSeek 跟 → 字节跟,大家在 benchmark 上互相追赶。
但 Frontier AI 真正应该问的问题,从来不该只是:
**“怎么做到 Claude 的水平?”**
而应该是:
**“Claude 之后是什么?”**
如果你的训练数据里充满了 Claude 的行为分布,本质上你已经默认 Claude 是正确答案。
但真正伟大的研究组织,必须允许研究员相信:
**Claude 也可能是错的。**
所以我反而越来越觉得,对 Frontier Lab 来说,长期最稀缺的未必只是算力。
还有一种更稀缺的东西:
**允许一群顶尖研究员连续几年不交漂亮 KPI,只为了真正搞清楚模型为什么会变聪明。**
短期看,这条路可能更慢。
但如果大模型今天还有大量底层规律没有被发现,那么最终最有价值的,恰恰可能是这种“慢”。
**不追答案,去找规律。**
我觉得这才是字节这件事真正值得关注的地方。成为TA的V+会员