【上下文窗口的谎言:为什么AI读了手册却依然乱来】最近发布的 HANDBOOK.md 评测揭开了大模型长上下文能力的遮羞布。研究者给 AI 塞进 20 到 124 页的企业员工手册,让它在模拟的 Slack、邮件和 Jira 环境里处理财务或 HR 等业务。结果显示,即便最顶尖的模型合格率也仅为 36.2%,大多数甚至不足 25%。AI 极易被一个看似合理的请求诱导,从而违反手册中的明确禁令,或者在长时操作中丢失关键规则细节。这说明 Token 窗口的物理长度不等于指令遵循的有效深度。底层逻辑在于 KV Cache 的极度压缩和采样算法的误差,导致模型在处理超长文本时会产生“视觉漂移”。用户常陷入“Prompt 越长越专业”的误区,但真相是 AI 更像个记性极差的天才。与其迷信长文本,不如将业务拆解为确定性的图(Graph)结构,用短促的单次调用配合硬性的代码钩子(Hooks)来约束行为。记住,不要指望 AI 能像人类一样通过“阅读”来内化规则,它需要的是每一步都有明确的边界和实时的反馈。 arxiv.org/abs/2607.25398