最近一个开源 Skill 火了,叫Leader点skill,作者前前后后烧掉约 20 亿 Token 。它是干啥的呢?
Agent 跑长任务(几小时级、多文件、多步骤)时最烦人的,不是模型笨,而是目标漂移(goal drift):
- 用户给一句模糊需求,它跑两小时,最后回来一个看起来完成了,但其实南辕北辙的东西;
- 为了达标走捷径——删测试、放宽断言、
"|| true" 糊弄 CI;
- 中途遇岔路自己猜优先级,猜错就整体翻车;
- 上下文一长,开头说的"为什么要干"被自己忘干净。
Leader点skill 的思路不是中途纠偏,而是开工前把目标焊死:用七个问题把模糊意图编译成一份机器可直接执行的「目标任务书」(Goal Brief),再交给执行型模型去跑。
目标七问——
1. Why(目的)——到底要达成什么业务结果,为什么非干不可。不写清,中途每个岔路 Agent 都得猜。
2. Done(完成态)——船靠岸时甲板上必须有哪几样东西。要具体到"回港那一刻就能判定",而不是"做一份分析报告"这种虚词。
3. Proof(证据)——凭什么信你做完了。要贴真实命令输出、测试通过截图、数据源链接,不是 Agent 自述"已完成"。
4. Anti(反作弊)——哪些捷径绝对不许走:禁删测试、禁放宽断言、禁伪造数据、禁
"|| true" 强行绿。把偷懒路径一条条列出来堵死。
5. Bounds(边界)——能改哪些文件、能调哪些工具、时间/范围/语种/地域限制、到第几天必须回头。
6. Trade(取舍)——冲突时保什么:保货还是保船、保测试覆盖率还是保交付时间、保主流程还是保边缘 case。
7. Unknown(未知)——遇到海图空白区怎么办:记下来绕行继续跑,别硬闯也别抛锚;连续失败三次换方向,结果变差就回滚。
这七问产出的不是步骤清单,而是目标函数 + 护栏:Agent 长程执行时拿它当锚,每步对照,偏了就知道偏了。
项目适用边界
- ✅ 多步骤、有清晰验收、Token 成本敏感、人暂时不在场的长任务(代码改造、调研报告、竞品分析、仓库级重构)
- ❌ 三步以内的短任务( overhead 比收益大)、纯探索对话、完全没有终点的开放创作
- ⚠️ 原始需求本身稀烂时,七问也救不了——Garbage in, garbage out;会话丢了"暗卷"验收设计也可能丢,重要任务记得把任务书落盘。
项目地址:github点com/KKKKhazix/khazix-skills/tree/main/leader
