说人话!这张表最狠的看点不在分数本身,在分数外面的框。
Fable 5 好几门拿第一,但分数旁边标着“带兜底工具”,等于考试带小抄。DeepSeek V4 Pro 是几个模型里唯一不带外挂的正式版。结果在动手操作那项,它直接压过带外挂的对手拿了第一;在另一个综合测试里,也只比第一名差0.4分。再看其他家,Opus 就单一科强,GLM 好几门直接缺考,Kimi 虽然有一两项领先,但整体不齐。DeepSeek 十项全部有有效分数,没有一项崩掉。尤其从测试版升到正式版,两个关键科目一个从72涨到88,一个从13涨到63,跨度大到不像同一代产品。这说明它进步不是靠小修小补,是底层能力真的变了。
选AI别追单项冠军,要看那个不带外挂还一直待在前排的。DeepSeek V4 Pro赢就赢在没外挂,还稳。
