存储也能给词元加速?中科曙光ParaCache真有点东西。
数博会走到下午,脑子已经有点糊了。展馆里到处是"词元""大模型""AI算力"的标语,看多了真的会审美疲劳。
走到中科曙光展台的时候,本来想随便瞟一眼就走。结果听到说他们刚发布了叫ParaCache的词元加速方案,主要就是用存储来给大模型推理提速的,我就挪不动步了。
和现场的工作人员进一步了解到,这个方案的核心就是"把KV Cache当资产管"——热数据放显存、温数据放内存、冷数据放SSD和分布式存储,不用啥都塞昂贵的HBM。思路挺野的:用存力换显存,把GPU的效能充分发挥出来。
前两天还刷到赛迪报告刚出的数据,中科曙光分布式存储在AI、教育、具身智能、自动驾驶四个行业都是第一。据说这个新方案已经在曙光8000十万卡节点上稳定跑了,我在那看了大概二十分钟,旁边有人一直有人在找工作人员咨询了解。这种好的东西,行业都会盯着看。
数博会现场 AI算力 存储芯片 中科曙光ParaCache
