DC娱乐网

千卡集群到万卡集群不是能跑起来就算成功,其中的核心问题只有真正试过才知道。 之

千卡集群到万卡集群不是能跑起来就算成功,其中的核心问题只有真正试过才知道。

之前看过一篇文章,介绍的是摩尔线程的万卡大规模集群的实战,其中就提到,千卡到万卡规模的集群稳定性、效率以及自动化容错是关键!

在正式开始之前我们先看看,为什么要从单卡到多卡,再到集群的千卡万卡。

一个万亿参数(3乘10的24次方)的模型,对于单卡来说训练完成可能要半年(你没看错就是半年),5千卡差不多要40天左右,万卡也需要差不多20多天,这还不说调优模型了,单次训练就能让人崩溃。

而对于一个企业来说,时间就是金钱,能尽快得到最优模型,自然就可以利益最大化。

但集群GPU卡的堆叠远不是简单的把卡堆起来,他需要对训练慢的节点、数据错误、GPU hang、以及异常的Inf/NaN等数据格外小心,紧依靠人工观察是不可长期进行的,而这时的自动化观测,外加可靠的软件栈系统才是解决方案。

而在其中最为关键的莫过于是计算错而不报错,模型正常训练了好几天,结果发现得到的结果是错的,试想一下任何一个人恐怕都会崩溃吧。

多卡集群看似简单的把多张卡堆叠在一起,而实际是不光要堆叠,还要正确堆叠,不光要正确堆叠,还要保证正确堆叠之后,上层软件栈能确保模型跑起来,更重要的是模型能正确的跑起来。

解决这些问题之后,万卡集群乃至十万卡,百万卡集群都可以迎刃而解。