DC娱乐网

DeepSeek让Harness进度条,进入乐高时段Harness是agent江

DeepSeek让Harness进度条,进入乐高时段Harness是agent江湖顶尖高手的山头,DeepSeek此番也要来领略。专门发一个Harness框架,还开源,不意外。官方说,一切皆插件。做的就是把Harness的每个能力都做成可自由替换、重组的插件;组件化的思路,显而易见。这会估计半个中国的agent工程师都在翻他们源码吧。哈哈。

当下AI圈最主流的做法是,Harness产生轨迹,再用轨迹来做后训练RL,进而让模型变强。也就说,"用agent跑出来的数据训练模型"是被公认为通往更强AI的主路。也就是说,Harness不只是"一个框架",而是"RL 训练数据的生产线"。或者说,Harness是后训练RL的上游。于是,任何Harness的变化,自然考虑它对下游RL的影响。确实是有影响的。插件可以自由替换、重组,环境变得高度动态。今天用这套插件组合,明天换一套,agent面对的"环境"一直在变。这样,组合空间爆炸,奖励信号极度稀疏。在一个可任意组合的巨大空间里,"哪个组合好"的信号,少得可怜,得从海量组合里挖出一点有效信号。这些都令RL越来越难。绕这一圈,把Harness的江湖地位说清楚了,但是思考Harness,不能被RL限制住。别认为后面RL有坑,前面就不香了,其实真香。

因为这是Harness构建方式和理念的大变化。梁圣再次引领潮流,彰显风采卓然。Harness的核心痛点是什么?开发慢、各组件割裂,改一点要动一大片,还要可观测。我之前写的几篇Harness文章分析下来,都是工程的活又难又多,而且变化迅猛,创业者难以下手。我身边很多朋友都在抱怨。然而,DeepSeek Harness 上来直接治这个。开发者无需改源码,就能独立替换、扩展任一能力。第一,每个插件是明确定义的、可组合的;第二,对抗"不可观测","仅追加的会话日志 + Trajectory视图";第三,按场景切换四种预设模式。第四,底层插件系统(Cordis),只负责插件的加载、卸载和依赖关系,其余全交给插件自己。