DC娱乐网

已有的 GPU 卡,还能榨出多少性能?是石科技给出的答案是将近 7 倍。据量子位 9月24日消息,该公司通过补齐算子内核、重构集合通信,让 DeepSeek 模型的推理吞吐相比社区默认部署方案提升近 7 倍,其测试口径是 1.5 台 6000D 跑赢 1 台 B300。问题的根源在于,这类没有高速卡间互联、又不在主流开源框架官方 ​

已有的 GPU 卡,还能榨出多少性能?是石科技给出的答案是将近 7 倍。据量子位 9月24日消息,该公司通过补齐算子内核、重构集合通信,让 DeepSeek 模型的推理吞吐相比社区默认部署方案提升近 7 倍,其测试口径是 1.5 台 6000D 跑赢 1 台 B300。问题的根源在于,这类没有高速卡间互联、又不在主流开源框架官方验证矩阵中的 GPU 卡,直接套用社区默认方案时会遇到算子回退至低效通用实现、集合通信沿用 NVLink 硬件调优参数、显存与并行配置沿用其他硬件默认值等情况,硬件算力被软件适配短板锁住。该公司定位为独立第三方全栈算力运营商,不绑定特定大模型厂商。