技术博文:为什么你在本地运行的LLM感觉比实际情况要差?网页链接作者通过真实的约 10 万 token 网络自动化工作流,论证本地 LLM 的能力不仅取决于模型,还取决于整套推理实现。
“我们大概都在论坛、聊天群、Reddit、Discord 或 YouTube 上听人说过:“某某模型简直强得离谱!”等真正下载下来,或者更可能是下载了它的某种量化版本之后,却发现:“呃……这也太差了。”
这篇文章将通过一系列偏技术性的实验,展示具体推理实现中存在的风险会造成什么影响。文中所说的“参考实现”,指发布该模型、提供官方托管服务并公布原始基准成绩的实验室。他们使用的硬件和软件都可能与你的环境非常不同。”

