Gemini 4 出来了,代号 Argon
9 月 30 号美国那边官宣了。但先泼盆冷水:你现在大概率用不上。
首批只给了可信的网络防御团队,走 Fairwind 计划;之后才轮到付费 API 和 AI Ultra 用户,日期压根没定。
Google 自曝了一张 19 项对比表,对手是 GPT-6 Astra 和 Claude Opus 5.5。
挑三项看:
知识工作 Vals Index——68.9 / 63.1 / 67.0
多步金融研究——65.4 / 53.5 / 58.6
长视频理解 LVBench——91.7 / 87.5 / 83.7
三项全赢,金融那块领先 12 个点,不是小数点游戏。
编程这块就翻车了。DeepSWE v1.1(长周期真实工程)77.9,还行,比 Opus 5.5 高 3.7 个点。可一到 FrontierSWE v2,55.0,被 Astra 拉开 10 个点,垫底;Terminal-Bench 4.0 又垫底,57.4 对 Opus 66.4。
Arena 盲投也作证:Text Arena 榜首 1525 分,Code Arena WebDev 第 8。说白了——会写,不太会盖楼。
两个真新鲜的数。 一个是输出上限,从 6.4 万 token 拉到 100 万。一次回答能吐约 70 万个汉字,长文、大改代码不至于中途断气。
另一个是幻觉率 15%。Artificial Analysis 测的,智能指数 45 分以上的模型里最低,Astra 是 51%。它更愿意说"我不知道",而不是硬编。不过准确率 50%,Astra 63%,也不算白捡的便宜。
价格倒是实在。首发 $2 进 / $10 出,缓存命中 95% 折,$0.1。Astra 和 Fable 5.1 都是 $10 / $50,正好五分之一。优惠期结束翻倍到 $4 / $20,跟 GPT-6.1 Sol 一个价。
我感觉 Gemini 4 不是来抢写代码的,是来讲人话的。
但跑分全是 Google 自己跑的,对手数据一大半各家自报;LVBench 里 Gemini 用 1 帧/秒,Astra 用 800 帧,喂的饭压根不一样。
ai AI工具 大模型 Google




