DC娱乐网

中科曙光重大发布!词元经济换挡 昨天还在和朋友聊大模型算力浪费的问题,尤其是长上

中科曙光重大发布!词元经济换挡
昨天还在和朋友聊大模型算力浪费的问题,尤其是长上下文多轮对话和Agent高并发调用这两个场景,没想到今天数博会中科曙光就发布了新一代词元加速方案,直接给出解决方案了。
做AI大模型的朋友应该都有体会,多轮对话越聊越慢。原因是每次生成新字,模型都要把前面所有对话的Key和Value向量重新算一遍。斯坦福研究团队统计过,AI Agent每一次调用里,62%的内容都是重复发送的。系统提示没变,工具定义没变,知识库文档也没变,模型却得每次从头再算一遍。
中科曙光发布的ParaCache高效管理方案,简单理解就是帮大模型把算过的东西存下来,下次直接复用,别再重复劳动。多轮对话不用每轮都从头算,词元开销和响应时间都能降下来;高并发场景下跨GPU、跨节点共享缓存,避免大家各自算各自的,算力浪费能省一大截。
最关键的一点,已经在曙光8000稳定跑了一年多。不是实验室炫技,是真刀真枪干出来的生产级方案!
2026数博会中科曙光中科曙光ParaCache