DC娱乐网

满载还能不堵车,曙光8000到底怎么做到的? 上午去WAIC在中科曙光展台听曙光

满载还能不堵车,曙光8000到底怎么做到的?
上午去WAIC在中科曙光展台听曙光8000讲解的时候,展台小哥说了一句曙光8000上线首周就满载,日均15万作业、峰值50万请求。这话一出来,不少人第一反应是:挤不挤?
你想啊,十万张卡同时跑满,百万级用户往里挤,传统集群到这份上基本就是全员排队、谁都别想快。但曙光8000却是高负载不拥堵,多任务不排队。
这就有点意思了。
后来展台小哥说核心秘密在调度。曙光8000有套动态资源管理机制,智能调度引擎加数据亲和性算法再加多元融合调度策略,三样东西搭在一起,系统会自己判断,你这个任务是搞大模型训练的,要连续算力,给你包场;他那堆是零散推理请求,碎片化塞进空闲间隙就行。不同类型的任务走不同通道,互不干扰。
光调度灵光还不够,十万卡跑起来,网络和存储得同步跟上。自研的scaleFabric高速互连撑住稳定通信,ParaStor存储保证海量数据读写不卡壳,调度、网络、存储三条线各司其职。
十万卡集群能不能稳定干活,调度能力可能比算力峰值更关键,曙光8000上线第一周,就已经在实战里把这事儿跑通了。
WAIC 曙光8000