小头决定大头的llm
1️⃣ 小头:轻量小草稿模型(跑得快)
低成本、小参数模型,算力消耗几乎可以忽略
主动投机预判,一次性快速生成4-8个候选token
相当于:学渣快速打草稿,先把大概率正确的答案提前写出来
2️⃣ 大头:精准大目标模型(判得准)
不用逐字生成!只做一次性批量核验
批量检查小模型预判的所有token
✅ 猜对的:直接全盘保留,白嫖生成速度
❌ 猜错的:截断错误部分,大模型微调补全
核心本质:小模型跑流程、大模型做兜底
让廉价的小头承担绝大多数生成工作
昂贵的大头只做校验修正,彻底砍掉重复算力消耗
人间辩论小会 科研 科研学习 计算机视觉 大模型 人工智能发展 算法 程序员的出路 机器学习
