DC娱乐网

“如果高端产品反而更差,为什么整体性能会更好?”   AI编程社区创始人Wes Winder公开质疑GPT-6 Sol的实际表现,直指其在关键测试中低于前代。OpenAI产品负责人Tibo回应称Sol是“各方面都更好的模型”。这场争论撕开了AI行业一个残酷真相:参数在涨,体验未必在涨。   Wes

“如果高端产品反而更差,为什么整体性能会更好?”
 
AI编程社区创始人Wes Winder公开质疑GPT-6 Sol的实际表现,直指其在关键测试中低于前代。OpenAI产品负责人Tibo回应称Sol是“各方面都更好的模型”。这场争论撕开了AI行业一个残酷真相:参数在涨,体验未必在涨。
 
Wes Winder这个名字,在开发者圈子里并不陌生。2024年底他高调宣布裁掉全部开发团队、用AI替代,几天后就在LinkedIn上紧急招人。

一个曾经对AI能力深信不疑的创业者,如今却成了质疑最尖锐的那个人。这种反转恰恰说明问题:越是深度使用这些工具的人,越能感受到宣传和现实之间的鸿沟。
 
Tibo的回应很官方,但社区用户的反馈完全是另一个画风。有用户直言GPT-6 Sol需要开到Max档,思考深度才勉强和前代的Medium到High持平。这意味着用户花更多的钱、等更长的时间,换来的只是和过去差不多的体验。我觉得这不是进步,这是在原地踏步还顺便涨了价。
 
GPT-5.6 Sol那次“一夜变笨”的事件更值得回味。社区用户翻出了一个OpenAI从未公开过的内部参数“juice value”,发现Max档的推理算力预算从960被砍到了128,缩水将近87%。Tibo当时在X上坚称“没有降智,只有好事”。但用户的体感不会撒谎,一个日本团队反馈模型推理质量从12分骤降到8分。
 
这种操作模式暴露了一个行业潜规则:模型能力不是固定的,它可以被后台悄悄调节。用户买到的不是一个确定的产品,而是一个随时可能被“优化”的服务。我认为这才是最令人不安的地方,你花钱买的是承诺,拿到手的是盲盒。
 
开源AI编程工具OpenCode联合创始人Dax Raad就公开表示,团队中已有部分人换回了GPT-5.6 Sol。按照他们的实际使用情况,Astra的支出翻了一倍,但一些缺点让这笔钱花得不太值。连最核心的开发者群体都在用脚投票,这个信号比任何跑分都真实。
 
那问题来了,为什么行业还在疯狂推新版本?答案藏在竞争节奏里。Anthropic发布了Claude Fable 5.1,Meta推出Muse Spark 1.3,谷歌上线Gemini 3.8 Flash,OpenAI紧接着甩出GPT-6 Astra。每家都宣称自己是“最强”,但咨询机构Gartner预测2026年AI领域支出将达到2.59万亿美元,比2025年增长47%。这场竞赛的驱动力不是用户需求,是资本叙事。
 
真正值得警惕的不是某一次“降智”,而是整个行业把“发布”本身当成了产品。模型更新的速度越来越快,但用户拿到手里的实际体验却没有同步提升。

OpenAI在发布Astra时宣布“AGI可能已经到来”,同时却暂停了两周前沿模型的强化学习训练。一边说能力已经封顶,一边承认安全系统跟不上,这种自相矛盾的表态本身就说明了很多问题。
 
更讽刺的是,就在普通用户抱怨模型“越用越笨”的时候,硅谷大佬们却在高喊AI可能毁灭人类。Anthropic CEO阿莫迪呼吁放缓开发,OpenAI的奥尔特曼也表示支持减速。

这种“恐惧叙事”和用户日常体验之间的巨大落差,本身就是一种营销策略。用末日论制造紧迫感,再用“最强大”的新模型来回应这种紧迫感,这个循环已经被玩得炉火纯青。
 
财联社的报道指出,AI模型和服务的快速迭代给用户带来了复杂性和混乱,企业IT管理人员不得不投入大量时间和资源对不同产品进行比较。当选择成本比使用成本还高的时候,这个行业的价值主张就开始动摇了。
 
一个模型好不好,不应该由跑分和发布会来定义,而应该由那些每天用它写代码、做分析、处理工作的人来评判。当开发者开始怀念旧版本、当用户发现花更多钱买到更差体验的时候,所谓的“整体性能更好”就只是一句空洞的公关话术。参数在涨,体验未必在涨,这个矛盾不解决,再多的高端产品也只会让用户越来越疲惫。