DC娱乐网

阿斯麦、台积电、英伟达,该睡不着了。7月13日,上海,一家成立不到三年的公司用1

阿斯麦、台积电、英伟达,该睡不着了。7月13日,上海,一家成立不到三年的公司用14nm工艺造出了一颗520TFLOPS的AI芯片,没用EUV,没用HBM。

这家公司名字叫东方算芯,窝在张江一栋不起眼的写字楼里,带队的是清华教授魏少军,国内芯片圈实打实的老炮儿,当年“核高基”国家科技重大专项的技术总师。

DF1000采用国产14纳米工艺,BF16峰值算力达到520TFLOPS,访存带宽6.4TB/s,芯片间互联带宽900GB/s。

更关键的是,它已经完成流片验证,并实现128卡集群全功能稳定运行。也就是说,这不是停留在论文和PPT里的概念芯片,实物已经跑起来了。

但520TFLOPS到底是什么水平,得把口径说清。英伟达H100的BF16峰值算力,在开启稀疏计算时为1979TFLOPS,不开启稀疏计算大约减半,显存带宽为3.35TB/s。

单看算力,DF1000没有“秒杀H100”;可它的6.4TB/s访存带宽,已经明显高于H100。一个算得更快,一个搬数据更快,不能拿单个数字直接判输赢。

这恰恰说明东方算芯真正下功夫的地方,不是把晶体管继续做小,而是解决数据搬不动的问题。

大模型运算最烧资源的环节,很多时候并不是乘加计算本身,而是参数在存储器和计算单元之间来回搬运。芯片算力堆得再高,数据送不过去,计算单元照样闲着。英伟达采用HBM,就是为了缩短这段距离,可HBM价格高、产能集中,供应链也容易受限制。

东方算芯没有使用传统HBM方案,而是把逻辑晶圆和DRAM通过晶圆级混合键合垂直连接,让存储单元直接靠近计算单元。

说白了,不是不要高速存储,而是自己重新设计了一套近存结构。数据少绕路,14纳米照样能把硬件效率压榨出来。

另一张牌是软件定义芯片。传统GPU内部资源相对固定,面对不同模型和算子,经常出现有的单元忙不过来,有的单元闲着。

DF1000则通过动态重构、空间并行和时分复用,让软件根据任务重新安排硬件资源。芯片工艺落后一截,就在利用率上往回追。

所以阿斯麦真正该注意的,不是中国突然不需要光刻机了。14纳米虽然可以不用EUV,但仍需要成熟光刻设备。真正发生变化的是,EUV不再被视为获得大算力的唯一入口。先进设备的限制依然存在,可限制的效果可能被架构、封装和系统创新一点点抵消。

台积电也不至于马上睡不着。DF1000距离大规模量产、良率爬坡和长期商用,还有不少硬仗要打。

但过去行业普遍认定,高端AI芯片必须绑定最先进制程。现在一家成立于2024年的中国企业,用成熟工艺把芯片、加速卡、服务器和128卡集群都做了出来,这条旧规则已经被撬动。

压力最大的反而可能是英伟达。它的护城河从来不只是一颗GPU,还有CUDA、算子库、通信网络和开发者生态。东方算芯同步推出CAAP软件栈、服务器和集群方案,说明团队也知道,只有芯片参数没有用,客户能不能顺利迁移模型,才决定这颗芯片能不能真正卖出去。

魏少军带队并不令人意外。他长期研究可重构计算,担任过“核高基”国家科技重大专项技术总师。这项技术也不是公司成立两年突然冒出来的,而是清华团队持续积累近二十年的工程化结果。

我更愿意把DF1000看成一次路线突围,而不是一次数字夺冠。它还没有证明自己能够全面替代英伟达,也没有让先进制程失去价值。但它证明了一件更重要的事:别人堵住一条路,中国芯片企业没有站在原地等放行,而是在重新设计道路。真正让三家巨头需要认真翻看技术资料的,正是这一点。