DC娱乐网

[IR]《Tokens are All You Need: Dual-purpo

[IR]《Tokens are All You Need: Dual-purpose Semantic IDs for Achieving LLM-Level I/O Efficiency in recommendation systems》B Li, Y Yuan, Y Zheng, L Yin… [YouTube] (2026)

在超大规模推荐领域,高维稠密向量的传输与存储是制约性能的“内存墙”难题。过去的方法受困于海量 Embedding 表带来的 I/O 带宽瓶颈,本质原因是系统必须在每一层计算中实时加载沉重的浮点数向量,导致长序列建模的资源成本极高。

本文的核心洞见是:借鉴视觉压缩思路,将连续的高维内容向量量化为离散的语义 ID 序列。由此,语义 ID 兼具了协同过滤的标识符与内容重构的索引双重身份,通过轻量级解码器在模型内部即时还原语义信息,彻底取代了昂贵的原始向量读取操作。

这项工作证明了“Token 是一切”在推荐架构中的可行性。它为万级超长序列建模打开了低功耗大门,实现了计算效率与预测精度的双重提升,但尚未跨过的门槛是应对内容动态漂移时,编码空间如何在无需全量重训的情况下实现平滑更新。

arxiv.org/abs/2607.24865 机器学习 人工智能 论文 AI创造营