DC娱乐网

有人按照老黄说的,给 OpenAI 训练成本算账了: Astra 的主要训练运行(100K 个 GPU × 24 小时 × 90–120 天 × $2.50–3.50/GPU-小时)在总计 250MW 计算资源上的粗略估算是否约为 ~$0.5–1.0B OpenAI 据报道在 Stargate 上使用 100K+ 个 GPU 进行预训练。必须假设 OAI 对于大规模、长期承诺有实质性 ​

有人按照老黄说的,给 OpenAI 训练成本算账了:

Astra 的主要训练运行(100K 个 GPU × 24 小时 × 90–120 天 × $2.50–3.50/GPU-小时)在总计 250MW 计算资源上的粗略估算是否约为 ~$0.5–1.0B

OpenAI 据报道在 Stargate 上使用 100K+ 个 GPU 进行预训练。必须假设 OAI 对于大规模、长期承诺有实质性折扣。以 CoreWeave 公开的 GB200 列表价格,同等容量将花费 ~$2.3–3.0B(100K × 24 × 90–120 × $10.50)。

假设使用 GB200 NVL72 硬件:>170 MW 机架功率(100K 个 GPU ÷ 每机架 72 个 × 120 kW),包括 GPU、Grace CPU 和机架内组件。>175–185 MW 总 IT 负载,假设外部网络、存储和支持服务器额外占 5–10%。>190–220 MW 设施负载(~175–185 MW IT × 1.1–1.2 PUE),包括冷却和设施电气损耗。=因此建模集群为 200-250MW。实际平均消耗取决于工作负载和利用率。先前实验、数据、员工和额外训练将增加总开发成本。