DC娱乐网

Token 调用量狂飙 1400 倍,海光扛住了最关键的一环 大模型推理成本降

Token 调用量狂飙 1400 倍,海光扛住了最关键的一环

大模型推理成本降了280倍,Token价格一路往下掉,但日均调用量从1000亿飙到140万亿——Token越便宜,消耗量反而越大。这不就是“杰文斯悖论”在AI身上的翻版吗?
 
正因为Token正在变成一种“海量、低价、标准化”的商品,每一次调用的稳定性和准确性反而变得比价格更重要,毕竟业务系统不会因为Token便宜就容忍它算错。
 
今天在词元经济生态大会上,海光信息总裁助理兼智能计算产品部总经理杜夏威提了一个观点:词元经济走向规模化,底层算力不能只满足于“供得上”,还要解决模型适配、运行效率和稳定服务的问题。海光要做的,就是依托双芯架构优势,为词元生产提供稳定的计算支撑。
 
海光在现场展示的“CPU+DCU”双芯方案,给我的感觉就是往“稳”字上使劲。深算三号DCU已经量产,覆盖AI训练、推理、科学计算,还支持FP8这些AI精度格式。适配能力也是亮点,400多个主流模型全覆盖,不是靠嘴说的,是真实跑通的。
 
Token价格可以卷,但算力底座的可靠性没得卷。140万亿调用量的另一面,是对“每一次都算对”的刚性要求——这个活儿,谁来干都绕不开底层芯片。

Token 算力 海光信息