DC娱乐网

Seed面试:怎么去控制?

阿东分享一道seed面试题,跟业务落地贴的很近,汇总了下解决方案。

大家最近都在疯狂使用codex, GPT-5.6 那六档强度(Light/Medium/High/Max/Ultra),还有5.6sol等模型是怎么实现的?

其实每个强度档位背后,都有训练阶段配好的长度惩罚和上下文窗口(根据gpt oss推测)。

[一R]DeepSeek V4
- 三个推理专家:Non-think / Think High / Think Max
- 每个专家用不同上下文窗口和长度惩罚分别训练
- 通过在线蒸馏合并成统一检查点
- Think Max 特殊系统指令:"Reasoning Effort: Absolute maximum"

[二R]Nemotron 3 Ultra (NVIDIA)
- 三种模式:reasoning-off / regular / medium-effort
- 教师生成的 SFT 数据 + 随机预算截断训练
- RLVR 中约 2.5% 样本使用 medium-effort
- 支持推理时硬性预算限制

[三R]Kimi K2.5 (Moonshot)
- Toggle 方法:交替进行有预算和无约束 RL 阶段
- Token 减少 25-30%,性能几乎不变
- 根据正确 rollout 长度百分位数估算预算
- 准确率超阈值后才激活预算约束

[五R]GLM-5 (智谱)
- 轮次级思考:每个对话请求单独启用/禁用推理
- 交错思考:每次回复和工具调用前插入推理块
- 保留思考:跨轮次保留推理块供复用
- 通过多任务 SFT + 序列化 RL 实现

[五R]Qwen3 (阿里)
- 思考模式融合:SFT 混合 /think 和 /no_think 样本
- 硬性思考预算:推理时可截断推理跨度
- 部分推理行为在训练后自然涌现
- 通用 RL 强化格式遵循

[六R]Inkling (Thinking Machine Labs)
- 连续强度值:0.0-1.0 之间的数值(不是离散档位)
- 强度写入系统消息
- RL 阶段按强度调整 token 长度惩罚
- 超过 3000 万次异步 RL rollout

共同规律:
推理强度 = 训练阶段学会不同策略 + 模板/系统消息选择模式 + 推理预算约束计算量。

所有细节看看提到的tech report。