已有的 GPU 卡,还能榨出多少性能?是石科技给出的答案是将近 7 倍。据量子位 9月24日消息,该公司通过补齐算子内核、重构集合通信,让 DeepSeek 模型的推理吞吐相比社区默认部署方案提升近 7 倍,其测试口径是 1.5 台 6000D 跑赢 1 台 B300。问题的根源在于,这类没有高速卡间互联、又不在主流开源框架官方
已有的 GPU 卡,还能榨出多少性能?是石科技给出的答案是将近 7 倍。据量子位 9月24日消息,该公司通过补齐算子内核、重构集合通信,让 DeepSeek 模型的推理吞吐相比社区默认部署方案提升近 7 倍,其测试口径是 1.5 台 6000D 跑赢 1 台 B300。问题的根源在于,这类没有高速卡间互联、又不在主流开源框架官方