我有一种预感:第二个震惊硅谷的“梁文峰”,已经出现了!
谁能想到,DeepSeek之后,第二个让华尔街集体冒冷汗的中国人,竟然是一个几个月前还被嘲笑“掉队”的90后。
他叫杨植麟。
7月16日,杨植麟创办的月之暗面突然扔出KimiK3。没有铺天盖地预热,也没有开几十场发布会,直接把模型往桌上一拍:2.8万亿参数,原生多模态,100万token上下文,还要开放模型权重。
硅谷一开始以为,这又是一款中国公司用“参数大”制造噱头的模型。
毕竟过去这些年,“堆参数”几乎成了不少人对国产大模型的刻板印象,海外圈子看多了数字竞赛,自然觉得这次也不过是换个壳的营销套路。甚至有人翻出几个月前的行业讨论,说月之暗面跟着同行后面亦步亦趋,参数追不上、发布节奏慢半拍,妥妥的“第二梯队掉队者”。
结果实测数据一出来,整个海外AI圈的论调直接来了个一百八十度转弯。独立评测机构ArtificialAnalysis给KimiK3的智能指数打了57分,综合排名全球第三,仅落后于两家海外巨头的顶级闭源模型,直接把一众欧美开源模型甩在了身后。
更具冲击力的是编程能力,在ArenaAI的前端代码竞技场上,K3以76%的胜率直接登顶,连一向以代码能力见长的海外旗舰模型都被压了一头。连马斯克都特意跑到相关报道下面留了句“Impressive”,转头就催自己的团队赶紧把2万亿参数的模型拉出来对标。
说起来也挺有意思,几个月前还有人调侃杨植麟“起了个大早赶了个晚集”。这位1993年出生的广东汕头小伙,本科读的是清华计算机系,博士毕业于卡内基梅隆大学,读书时就是自然语言处理领域的青年学者,连苹果公司都抛过高薪招揽的橄榄枝,可他偏要选择回国创业。
2023年他创立月之暗面,靠着超长文本处理能力出圈后,却在去年底开启的万亿参数竞赛里显得“不慌不忙”。别家赶着发新版本、刷参数数字博眼球,他带着团队闷头搞了大半年研发,连个正式预热都没做,冷不丁就扔出个王炸。
很多人只盯着2.8万亿这个数字看热闹,却没看懂这背后最有分量的根本不是堆参数。K3采用的是混合专家架构,总共896个专家模块,每次推理只按需激活16个,相当于把2.8万亿参数的能力储备起来,用的时候精准调用,算力效率比上一代直接提升了2.5倍。
再搭配自研的注意力机制,100万token的上下文不是纸面宣传,是真能一口气读完一整个大型代码库、几十本技术文档还不丢失关键信息。就连多模态能力也是从模型训练之初就原生融入的,不是后期拼凑上去的插件模块。
最让华尔街和硅谷坐不住的,还是“开放模型权重”这步棋。要知道海外最顶尖的大模型全走闭源路线,想用只能花钱调用API,数据安全、定制化需求全捏在别人手里。
而KimiK3计划在7月27日前开放完整权重,全球的开发者和企业都能下载、微调、做本地部署,相当于把近3万亿参数的技术能力直接开放给了全行业。对金融、医疗这些对数据隐私要求极高的行业来说,终于不用再把核心业务数据传到海外服务器;对中小团队和研究者来说,站在万亿级模型的基础上做开发,门槛直接降了一大截。
市场的反应比任何数据都直白。发布才48小时,用户请求量就直接逼近了GPU集群的承载上限,月之暗面不得不紧急暂停C端新用户订阅,优先保障老用户的使用体验。
有行业人士统计,发布当天平台的年度经常性收入直接创下历史最大单日增幅,这哪里是“掉队”,分明是憋足了劲一脚油门完成了超车。
其实从DeepSeek到月之暗面,硅谷之所以一次次被震惊,从来不是因为中国公司能堆出更大的参数数字,而是他们突然意识到,曾经牢牢握在自己手里的AI技术话语权,正以超乎想象的速度被追平。
过去是“美国出核心技术,中国做落地应用”,现在中国公司不仅能做出全球第一梯队的模型,还敢直接开放权重,用开放生态撬动整个行业的格局。
杨植麟之前接受采访时说过,做AI的目标是“探索智能的极限,让AI有用”。没有花哨的发布会排场,没有夸张的营销话术,就带着一群年轻的工程师,闷头把技术做到了全球前沿。
这种不声不响干实事的风格,大概才是最让对手心里发慌的地方。
