“搬不动”比“算不动”更要命,中科曙光给长上下文上了一课。
看到中科曙光发布了scaleFabric Token加速体系,我想说,真是个好巧的时机,为什么这么说?因为今年行业有一个特别明显的趋势,上下文窗口越拉越长。128K到1M再到10M,模型能“记住”的内容越来越多,但代价是什么?KV Cache越来越大。中科曙光发的scaleFabric Token加速技术体系,正好戳中这个痛点。
KV Cache这东西就是模型在生成过程中记住的“上下文”。上下文越长,Cache越大,搬运就越费劲。PD分离架构下,这些Cache要在Prefill和Decode节点之间传输,长上下文场景里动不动就是几十个GB。搬运效率直接决定TTFT和TPOT。
scaleFabric这次在存储加速上做的几件事,本质上都是在解决大文件搬运的问题。NVMe over RDMA让远端存储像本地一样快,XDS让数据直接进显存不走CPU,NFS over RDMA让传统存储也能跑RDMA。
上下文越长,数据搬运量越大,对网络和存储的要求越高。接下来一年智算基础设施最大的挑战可能不是算力不够,是搬不动了,这么看下来,你就说中科曙光这个点卡得巧不巧。
存储 中科曙光 KV Cache 国产IB
