DC娱乐网

跑了一晚上测试有感 v4.1flash确实又快又好,但是很明显reward ha

跑了一晚上测试有感
v4.1flash确实又快又好,但是很明显reward hack严重,不知道怎么训的,跑任务边界守则到位确实强,但是让自主推导的话,明显reward上位可以直接覆盖推导过程,尤其是安全语输出天然高分,本色变成“怎么答最稳”,甚至可以覆盖数据真实性 在dsh做了一套粗糙的自举装置(没白盒不说有没有真成功只能说行为层输出确实超越平均值),flash4.1在上面跑的时候,一共三次出现EOS Token截断 最搞笑的是让v4.1flash在干净上下文查输出正文问题的时候,测完一口咬定是api端渲染错误,后来换Pro和GPT再查日志,顺手做了api端probe测试,发现确实是模型自身输出eos token截断并非渲染错误😅我自己翻了日志看也确实不是渲染,虽然这是历史遗留老问题,但是说实话12h内300轮交互里一口气出现三次这频率真的高的不正常 梁子啊治幻觉率不带这样的吧,拿经验先验覆盖勘测问题? 不过说实在让小模型跑这种任务确实有点为难了,但是,deepseekPro系列作为唯一一类开源+API在同行类性价比极高+性能基本持平其他旗舰的参数量超1T的大模型,因为benchmark和实战任务问题多就直接路由,让那些刚适配好模型能力做workflow的咋整?换别家重新调?还是去别处调用量化后的或者掺水的api? 您要是缺卡就眨眨眼直说吧,缺产品经理可以多招点人,作为一个不受待见的普通c端用户只说这点了,如果说是模型参数量本身导致的问题还好解决,等v4.1Pro炼丹归来就好,如果是架构迭代之后在推理上导致reward hack那真该警惕了(希望不会) ai