DC娱乐网

SemiAnalysis:为什么Meta可能超越谷歌,及我的不同观点它的核心依据

SemiAnalysis:为什么Meta可能超越谷歌,及我的不同观点

它的核心依据是,前沿模型竞争已经从单纯比算法,转向数据、人才和算力的系统竞争。Meta虽然起步更晚,却正在把资源高度集中到一个目标上;谷歌的家底更厚,资源却要同时服务搜索、云计算、外部客户和DeepMind。

我并不太认同,我认为 Meta 反超谷歌存在可能性,但是这种可能性比较小

SemiAnalysis认为,Meta的优势并不是数据一定比谷歌多,也不是广告业务比谷歌更强,而是它目前把数据、强化学习环境、广告反馈和内部算力连接得更直接。

这是一种执行效率和资源集中度优势,还不能简单等同于长期技术优势。

一、Meta的数据为什么可能更“值钱”?

很多人会问:谷歌的数据明明不比Meta少,为什么还说Meta拥有数据优势?

这个问题的关键,在于区分两种数据:

第一种是拥有的数据;第二种是能够快速加工成强化学习任务的数据。

谷歌拥有搜索、YouTube、Gmail、Docs、Sheets、Android和Chrome,数据的广度显然强于Meta。尤其是Google Workspace覆盖全球大量企业,横跨金融、制造、零售、医疗和专业服务。在训练通用办公智能体时,谷歌理论上拥有更丰富的行业场景。

所以,如果说Meta的数据整体比谷歌更多、更全面,我并不认同。

SemiAnalysis真正强调的,是Meta正在把内部员工的屏幕、键盘和鼠标操作,系统性地转化为强化学习资源。真实工作录像可以还原一个任务如何开始、调用了什么工具、经过哪些步骤,以及最后达到了什么状态。相比人为编写一道“看似困难”的测试题,这类数据更接近真实经济活动。

Meta的特殊之处在于,它内部拥有庞大的软件工程、广告投放、销售、法务、财务和内容团队,并且组织上愿意承受员工反对和公关压力,直接收集这些工作轨迹。

谷歌理论上也可以做,甚至潜在数据范围更广。但拥有Gmail和Docs的使用数据,不代表谷歌可以随意把全球企业客户的敏感工作流拿来训练模型。隐私、权限、合规和客户信任都会形成约束。

Meta使用自己的内部员工数据,法律关系和组织协调相对简单。

因此,更准确的结论是:

谷歌的数据上限更高,Meta当前把内部数据转化成训练材料的速度可能更快。

Meta训练出的智能体,短期可能特别擅长软件开发、互联网运营和广告业务;谷歌一旦真正打通Workspace数据、企业授权和DeepMind训练体系,通用性仍然可能更强。

二、Meta真正激进的地方,是在内部造出了一家顶级RL(Reinforcement Learning)公司

强化学习可以简单理解为:让AI进入一个工作环境,使用软件和工具完成任务,再根据结果获得奖励。

它不只需要题目,还需要完整环境和验证规则。

例如,让AI制作一份财务模型,真正的难点包括寻找数据、打开表格、处理格式、检查公式、修正错误,以及判断结果是否符合要求。

高质量任务越来越贵。前沿实验室愿意为一个合格的编程任务支付5000美元以上;部分专业工程师年薪超过40万美元,每周却只需要产出一个真正有价值的任务。因为设计一道既真实、又足够困难、还不能被模型钻漏洞的题,本身就是高难度工程。

Meta已经组建约3000人的应用AI工程团队,专门生产强化学习任务和环境,其中包括约70%的新毕业生以及大量资深工程师。

作为对比,Mercor一个季度记录的专家工作量,相当于约4800人全职工作。Meta投入的3000名工程师,已经接近一家头部强化学习数据公司的生产规模,而且它还能从数万名内部员工中持续抽取真实场景。

⽆形之⼿创造了⼀条全新的类数据 / 强化学习环境供应链。三⼤巨头 ——Mercor 、 Surge 和Handshake—— 的年度经常性收⼊ (ARR) 均超过10 亿美元,⽽许多成⽴仅⼀年的新兴公司(例如 Fleet 、Mechanize 和 Afterquery )的 ARR 也已达到 1 亿美元左右。