AI4S算力曝光!普通智算和传统超算都不够用
东方证券最近放出的一张算力对比表,我看完挺来劲。
它把AI智算集群、传统超算集群和AI4S集群摆在一起,结论很直接:AI4S的算力底座,不能照搬任何一边。
普通AI集群主要处理低精度矩阵计算,追求高吞吐;传统超算更擅长FP64高精度求解和大规模物理仿真。AI4S偏偏要把两种活放在一条科研流程里。
然而,它的“脾气”还不止这些。
任务规模跨度极大,有的计算很快结束,有的要连续运行数天甚至数月;IO既有大文件,也有高频小文件和中间结果;通信同时涉及MPI、CPU与加速器、计算与存储之间的数据流。软件上还得兼容深度学习框架与HPC科学软件生态。
看到这里,我终于理解曙光8000为什么坚持走原生超智融合了。
它没有把超算节点和智算节点简单拼在一起,而是覆盖FP64到INT8全精度计算,再用scaleFabric类IB原生RDMA网络处理混合通信,ParaStor承接复杂科学数据读写,浸没式相变液冷保障长周期运行。
万亿原子模拟中,部分数据采用半精度存储,内存带宽占用减半;系统扩展后,弱扩展效率仍达到86.9%,通信占比只有4.26%。这就是架构对上应用之后的效果。
我觉得这张对比表点破了AI4S最容易被误解的地方:它既不是普通AI任务换个科学名称,也不是传统超算多加一套智能软件。
这是一类新的混合科研负载。曙光8000真正抢先的地方,是已经开始按这套新规则造系统。
中科曙光 AI超集群 曙光8000
