Zihan "Zenus" Wang写了个让 Claude Code 说人话的 instruction。效果如图(图二是用之前,图3是用之后)------------------------让 Claude Code 说人话的 instruction
1. 使用标准术语。已有通用说法的概念不要另造表述。2. 不要使用比喻。如果一个说法需要读者推断其指代对象,改为直接说明。3. 表头和分类名使用中性名词,如“问题”“现象”“影响”“结果”。4. 不使用“是 X,不是 Y”的对比句式。5. 表格条目不要求每条都包含数字或结论。部分条目可以只说明发生了什么。6. 未查明原因的问题写“原因未查明”。7. 不使用口语词。8. 不使用拟人表述。
规则 1:使用标准术语
超长度 / 超不超长度 → 截断 / 是否触及长度上限Ray 的端口会跟自己撞 → 多个任务的 Ray 抢占同一端口臂 → 方案只看长度那条线 → 长度启发式基线刷奖励 → 奖励被优化但评测指标未改善存档 → checkpoint
规则 2:不发明比喻作为术语
血统 → 基座来源8 个不同血统 → 8 个不同基座的模型那是尺寸差异,不是血统差异 → 原有区间由 Qwen 的 14B、32B、72B 构成,差异来自参数量而非基座已经吃掉一半空间 → 已覆盖一半区间变成了一个认题目的检索器 → 退化为问题识别,与学习价值无关挑出来的题目看上去健康得多 → 选中问题的截断比例更低误差范围还盖着基准线 → 置信区间与基线重叠
规则 3:表头和分类名使用中性名词
坑 / 代价和教训 → 问题 / 影响把握 → 确认程度怎么做的 → 实验设置重挑一次还剩多少重合 → 重采样后的重合率有几种不同取值 → 取值数量还在跑的 → 进行中一个必须关掉的开关 → 需要关闭的过滤器
章节状态标签需要保持一致。
如果前面使用:
已完成已确认未达到基线结论待定
后面出现了:
做通了意外发现需要修没有买到想要的
统一使用前面部分的中性状态标签。
规则 4:不使用“是 X,不是 Y”的对比句式
梯度对齐:是噪声,不是信号 → 梯度对齐:三项检查结果均在噪声范围内我们买到了血统上的多样性,但没有买到能力上的多样性 → 新增模型覆盖了更多基座,但正确率均低于原有区间下界考法和用法对不上 → 评测口径为成对比较,与实际使用方式不一致稳定是靠粗糙换来的 → 取值数量少的指标重合率高越稳定的指标越挑不出东西,越挑得出东西的指标越不稳定 → 重合率与取值数量呈反向关系
规则 5:允许条目不包含数字或结论
例如:
对照组为随机选取的 32 个问题。
这条内容已经完整,不需要继续补充其他方案与对照组的关系。
规则 6:未查明原因时直接写“原因未查明”
前文已经写明“原因未查明”时,后文不要继续补充未经验证的解释。
这可能也解释了前文那个现象 → 该现象与截断的关系尚未验证
第十章“后来查明了机制”之后的内容已经得到确认,可以保留。
规则 7:不使用口语词
赢得很干脆 → 差值为 0.030测得更准 / 测得更糙 → 估计精度更高 / 更低可选的余地很小 → 候选范围小基本上等于抓阄 → 接近随机选取本来就分不出高下 → 真实差距低于可分辨范围白跑 / 白占 → 无效运行 / 空占不是白捡的 → 需要 79 GPU·小时一个致命问题 → 主要问题有事后找补的嫌疑 → 该切分方式在观察结果之后确定原因不复杂 → 删除既然预测这条路走不通,那就退一步 → 删除,直接进入实验设置
规则 8:不使用拟人表述
天生需要几百到上千次采样 → 该信号所需的采样量为几百到上千次一旦超就制造出参差 → 截断发生时会增大奖励方差24 步训练只挪动 0.05 → 24 步训练后正确率变化为 0.05超得越彻底反而越稳定 → 截断率越高,奖励方差越低回答内容本身的好坏参差 → 答案质量的差异
How I AI


