当大模型参数突破万亿级、生成式 AI 从文本走向视频,行业目光大多聚焦在 GPU 算力竞赛上。但在 2026 世界人工智能大会(WAIC)上,西部数据提出了一个关键判断:AI 不只是计算系统,更是数据系统 —— 计算周期可以重复调度,而数据只会持续累积。随着训练与推理往复循环,每一次 AI 交互都产生新的数据,且可能被留存反哺,存储需求正指数级增长,对传统存储架构提出了全新挑战。

AI 时代,存储选型成了新难题
对于 AI 企业和大模型团队而言,存储早已不是 "买几块硬盘" 的简单问题,而是一套系统性的基础设施命题。

传统冷热两层存储架构,在 AI 工作负载面前捉襟见肘:模型权重需要高速访问、KV 缓存要求极低延迟、向量数据库与 RAG 检索强调随机读取、海量训练数据集又依赖大容量冷存储。不同层级数据特性天差地别,如何搭建分层合理的存储架构,是 AI 团队的第一道门槛。
成本与功耗的平衡同样棘手。AI 数据只会持续扩张,全用闪存 TCO 高得难以承受;将所有数据放在 HDD 上,可能又难以满足性能敏感型工作负载得需求。同时数据中心功耗压力日益严峻,如何在容量、性能、功耗间找到最优解,是每个 AI 基础设施团队的现实问题。加上 AI 训练数据、模型权重都是核心资产,数据安全与长期留存也需要系统性考量。
从两层到四层:西数给出 AI 存储新架构
7 月 19 日,西部数据在 WAIC 举办 "面向 AI 时代的数据存储架构创新" 分论坛,开发工程高级副总裁 Tim Rausch 发表了 "面向规模化 AI 的存储革新" 主题演讲。拥有 26 年 HDD 技术深耕经验、曾主导希捷 HAMR 技术研究并在 AWS 负责全栈 HDD 项目的 Tim Rausch,从一线工程视角拆解了 AI 存储的核心矛盾。

他分享了 AI 如何推动云存储架构从传统 2 层向专业 4 层演进,从而用智能数据分层应对 AI 时代的复杂需求。这四层分别对应:模型权重与 GPU 显存溢出(HBM/DRAM)、KV 缓存(DRAM/SSD)、向量与 RAG 检索(通常运行在 SSD)、HDD 大容量存储(持久化数据层)。"在规模化发展中,经济性决定架构。"Tim Rausch 指出,闪存处理性能敏感型读取,HDD 承载持续累积的写入流,这种分层架构让 AI 基础设施更务实、更经济。他以生成式视频为例:生成一个不到 4MB 的视频,需要 46.5GB 的读写并留下 506MB 持久数据,假使这些输出反哺训练形成闭环,将带来更加庞大的数据存储需求,而这正是 HDD 发挥价值的重要场景。
技术路线上,西部数据采取 ePMR 与 HAMR 并行策略,目标 2029 年实现单盘 100TB 以上容量。高带宽硬盘与双枢轴技术提升性能表现,功耗优化型 HDD 则为长期留存数据提供经济方案。
全栈产品矩阵,覆盖 AI 存储全场景
WAIC 展台上,西部数据展出了完整产品矩阵。企业级 HDD 方面,40TB/34TB Ultrastar DC HC6100 数据中心UltraSMR硬盘、30TB/28TB Ultrastar DC HC5090 数据中心CMR 硬盘构成主力阵容;采用 HAMR 技术的 40TB Ultrastar DC HCS100 代表下一代技术方向。其中 40TB UltraSMR ePMR 硬盘已进入客户认证,计划 2026 年下半年量产。

存储平台层面,Ultrastar Data60 3000 混合存储平台、OpenFlex Data24 4200 存储平台及 RapidFlex C2000 适配器,组成灵活可扩展的解决方案。西部数据还联合群联、大普微、深信服、同有等生态伙伴联合展示,呈现存储与 AI 技术栈协同的完整图景。

当行业还在比拼 GPU 数量与模型规模时,西部数据把目光投向了 AI 基础设施的 "地基"—— 存储。没有稳定高效的数据底座,再强的算力也难以持续运转。从四层存储架构的提出,到覆盖容量、性能、功耗的全栈布局,西部数据正在证明:AI 时代的竞争最终会下沉到数据基础设施的比拼,而存储正是 AI 规模化发展不可或缺的坚实基底。