中科曙光ParaCache把存储变成了Token的“第二大脑”,社区直接炸锅
技术社区等这一天其实等了挺久——KV Cache管理从开源LMCache的探索,到如今中科曙光拿出系统化的商用落地方案。我总结了架构层面的三个破局点。
第一,全局元数据管理。过去各节点、各实例的KV缓存相互隔离,元数据分散在引擎、框架、第三方组件里,形成“认知迷雾”。中科曙光构建了全局元数据服务,能感知KV的语义和热度,实现跨实例共享和智能淘汰,这为集群级调度打开了新空间。
第二,XDS技术。让GPU绕过CPU和内存直接访问L4分布式存储,数据从存储设备零拷贝直达显存,延迟接近物理极限。这等于把冷KV的访问速度提升了一个量级。
第三,智能预取。利用推理框架判断KV存在与获取之间的时间差,提前从L3/L4加载数据,把等待变成加速。
这些创新说明存储不再被动存数据,而是主动参与Token生命周期的管理。中科曙光把存储从“数据底座”推向了“推理引擎”的一部分。数博会之后,社区肯定会围绕这套方案做更多验证和适配,但方向已经清晰了。
中科曙光数博会TokenAI算力中科曙光ParaCache
