DC娱乐网

DGX VS Pro6000 双 pro6000 是很快,之后呢? 上一条说

DGX VS Pro6000
双 pro6000 是很快,之后呢?

上一条说到我卖了双 pro6000 换4台 DGX,可能有些人不理解,我来说一下为什么。

pro6000带宽高,生成快,但是一个长链条任务,比如一个10分钟左右的Agent任务,其中真正生成大概占55%,剩下的45%都是在处理长上下文、调用工具和来回传结果。所以生成速度不是唯一决定因素,它是个边际递减的事来的,速度达到一定值之后,后面就没有太大收益了,变成了投入巨大。和房贷还款年限一个道理,无限年限之后,每月还款变成了一个固定值。

生成速度从21提到70 t/s,快3.3倍,整个任务从600秒缩到367秒。就算干到300 t/s,也还要289秒。

所以很多测评,只看pro6000单轮对话,200、300 t/s的生成速度,我就想笑,纯属自嗨,没有任何意义。pro6000更加大的作用是图像生成,玩AI,它的显存不大不小,不上不下,太尴尬了。单卡pro6000,基本就只能跑27B,27B是个玩具来的,懂的都懂,不懂也没办法。双6000是适应性更好,但是还是限制太多,可跑模型多不了多少。多卡6000的话就已经超出消费级了,主板内存芯片起步投入35w才有意义。

4台DGX合计512G,对比双pro6000,装得下更大、精度更高的模型,而且可以张量并行。现在热门的模型,优化得好,100 t/s是没有问题的,我实际个人体验,超70t/s,基本可以用于生产了,不会有慢的感觉。pro6000拿啥来比,根本不是一个层级的东西。

硬要说8卡pro6000,那4台dgx才12w,6000拿什么来赢?本地部署一定DGX!前沿模型至少起步200B,精度至少4bit以上,后面趋势一定是这样的,规模就是正义!

4台DGX直接可以运行GLM-5.3 NVFP4,和GLM-5.2同架构,后续可以等HY4的4bit版本。反正我现在玩下来4 dgx比6000可玩性高到不知道哪里去,后续还会继续入4台,做8卡集群。

后面继续详说dgx,还会说到苹果和amd

DGXSpark RTXPRO6000 本地大模型