曙光8000在世界人工智能大会上拉满了关注度,首周满载运行,直接抛出五十万作业峰值的硬核数据。
外界几乎都在盯着“十万张算力卡”狂欢,觉得卡多就等于算力强。但拆解完这套系统的技术底牌,事实却并非如此:在这个庞然大物里,算力芯片并不是门槛最高的东西。
十万张卡装进机房,绝不是简单地插上电源。真跑起任务来,那是十万个计算节点在疯狂交换数据。
这中间有两道必须迈过去的难关。
第一道,数据能不能顺畅互通。
十万张卡同时处理信息,通道只要稍微堵塞一瞬间,芯片再强也只能原地干等。曙光8000这次拿出了自研的专属网络架构。它做到的结果是:端到端的数据传输时延,被硬生生压缩到了零点九微秒;单个子网直接撑起十一万卡的互联。庞大的数据流在十万个节点之间穿梭,没有任何停滞。
第二道,机器会不会过热宕机。
十万张卡全负荷运转,散发的热量是极其恐怖的,传统风冷根本压不住。他们直接用上了浸没式相变液冷技术,把电能利用效率死死按在了一点零四。这在业内,是实打实的第一梯队水准。
一个负责让数据跑得通,一个负责让机器不发热。
首周五十万作业峰值跑完,十万张卡没卡死、没宕机,说明这两道关卡被彻底趟平了。
以后再评价那些庞大的算力中心,别光顾着数人家机柜里插了多少张卡。把十万张卡堆在一起并不难,能让这十万张卡同时满载狂奔还不崩盘,才是真正的技术壁垒。
这其实就是在说,看得见的硬件数量只是入场券,看不见的协同运转能力,才是决定生死的底牌。
