9 月 30 日(美国当地时间),谷歌发布了 Gemini 4 这一代的首款模型,型号名 Argon。它最实在的三个变化是:一次能输出 100 万个 token、每百万 tokens 的输入价定在 2 美元、以及专门为了“连续干几小时的活”而优化。最容易被忽略的一个事实是:你现在还用不上它。第一批拿到访问权的不是普通用户,也不是开发者,而是一批做网络安全防御的机构。
这篇不吹不黑,只做三件事:把谷歌这份发布稿里的数字翻译成人话;告诉你它到底哪里变强、哪里没赢;最后给你三个现在就能做的动作——而不是让你熬夜等解锁。
先给结论:登场的是谁,你现在能不能用
先把最容易讲错的三件事说清楚。
第一,登场的是“Gemini 4 的第一款”,不是“Gemini 4 的全部”。 多家媒体都用了“首款旗舰模型”这个说法,也就是说 Argon 是这一代里最先出场的最高端那一款,后续还会有便宜档、快速档。谷歌没有公布后面几款的时间。所以如果你在网上看到“Gemini 4 全线上线”,那是把话说大了。
第二,它是一次换代,不是挤牙膏。 谷歌上一条真正的旗舰线是 2025 年 11 月 18 日的 Gemini 3 Pro,这次是 2026 年 9 月 30 日,中间隔了 10 个多月。这期间谷歌发了三四个带小数点的版本(下面第二节会讲),但那些是小改款。
第三,普通人拿不到。 目前的开放顺序是:先给“Fairwind 计划”里的可信网络安全机构和部分政府预发布项目;然后是付费调用 API 的开发者和 Google AI Ultra(谷歌最高档的订阅)用户;普通订阅档要往后排。谷歌没有公布面向公众开放的时间,只表示会“尽可能迅速、同时以安全的方式扩大开放”。这句话的重点在后半句。
为什么隔了 10 个多月:小数点和换代是两回事
要理解这次发布为什么被这么多人在意,得先看这一年半谷歌的节奏。把公开报道里的日期排成一条线,事情就清楚了:
| 时间 | 谷歌做了什么 |
|---|---|
| 2025-11-18 | Gemini 3 Pro 发布,这一代的旗舰 |
| 2026-02-19 | Gemini 3.1 Pro,小改款 |
| 2026-05-19 | Google I/O 上承诺“3.5 Pro 下个月发” |
| 2026-07-16 | 彭博报道延期,原因是编程能力不达标 |
| 2026-07-22 | CEO 皮查伊承认推迟,改口“Gemini 4 年底发” |
| 2026-07-21 至 09-02 | 连发 3.6 / 3.7 / 3.8 三款 Flash(快速档) |
| 2026-09-30 | Gemini 4 首款旗舰 Argon 发布 |
这条线上有两个细节值得记住。
一个是 3.5 Pro 根本没发出来。承诺“下个月发”之后 60 多天没有动静,媒体给出的原因是编程能力没达标。对普通用户来说,这意味着一件事:当你看到某个模型版本号从 3.1 跳到 3.6,别以为它变强了 5 倍——那更可能是同一代产品在做修补和降价,而不是换代。
另一个是 这次比承诺的“年底”提前了。皮查伊 7 月说的是年底,实际 9 月底就端出来了。业界普遍把它解读为竞争压力:这一年对手的日子都不好过——同一时间线上,OpenAI 和 Anthropic 各自都有新款旗舰在前面跑,谷歌被甩在了后面。
顺带解释一个词。旗舰(frontier model,直译“前沿模型”)指的是各家最贵、最强、最近更新的那一款;它下面还有“快速档”“迷你档”这些便宜但弱的兄弟型号。你平时在 App 里默认用到的,往往不是旗舰。
这次真正改的三件事
改动一:单次输出上限提到 100 万 token。
这是 Argon 最硬的参数变化,也是媒体标题里的常客。先解释一下这两个词:
- token:模型眼里的“字”。它不是一个汉字也不是一个英文单词,而是被切成的小片段,中文大约 1 个字合 1~1.5 个 token,英文大约 1 个词合 1.3 个 token。
- 输入 / 输出:你发给它的内容算输入,它回给你的算输出。两者分开计价,输出通常贵 4~5 倍。
“输出 100 万 token”意味着它一口气能写完大约七八十万字的内容。听起来夸张,但它的真实用途不是写长文,而是让模型有地方“思考”:现在的模型在解复杂问题时会先生成一大段中间推理,再给结论。推理过程越长,能力越强,也越吃输出额度。把输出上限拉高,本质是给思考腾地方。
这跟你有什么关系?如果你只让它写周报、润色邮件,100 万输出对你毫无意义。它只对一类场景有价值:把一整件事交给它——比如改一个大型代码库、把几十份文档读完再写结论、连续调用工具跑几十步。这类“长流程任务”才是这代模型真正的目标。
改动二:价格是冲着“便宜”去的。
早期定价是每百万 tokens 输入 2 美元、输出 10 美元,命中缓存的输入只要 0.1 美元。有报道按“完成一个任务”来算成本,给出约 1.99 美元一个任务、比对手低四成左右;也有媒体按 token 单价算出“只有对手的几分之一”。
这里有个坑必须提醒你:单价便宜不等于总花费便宜。 输出上限从原来的几万拉到 100 万,意味着模型一次可能写回你几十倍的内容,而输出单价是输入的 5 倍。如果你不做任何限制,账单完全可能不降反升。想把自己的调用成本算清楚,可以先看这篇每百万 tokens 到底是多少字:三步算清一次 AI 调用要花多少钱,里面按汉字给你换算过了。
顺便提一句价格战这个大背景:9 月下旬刚刚出现过凌晨 90 分钟的价格战:Claude Opus 5.5 刚发布,OpenAI 反手把 API 永久砍半。Argon 这次的定价,本质上是被这条战线逼出来的。
改动三:主打“长流程”,但这也暴露了它的偏好。
谷歌公布的成绩单里,最能打的是长链条任务:编程类第三方评测 DeepSWE v1.1 拿了 77.9%,自动化任务 AutomationBench 51.3%,金融代理任务 65.4%。而在需要模型从零搭一个项目、或者在真实终端里一步步操作时,它反而落后。
跑分怎么读:它赢了什么,又没赢什么
这是本篇最想教你的部分,因为同一个发布,你看到的数字可能全不一样。
关于“赢了几项”,媒体至少给出了三种说法:18 项评测里领先 12 项、19 项里 13 项第一、14 项基准第一。这不是有人在编数据,而是因为:谷歌那张对照表里有些项是第三方机构跑的、有些项自己并列第一、有些项要不要算进去各家判断不同。
所以第一条经验是:“屠榜”这种词没有信息量,你要问的是“哪几项、多少分、谁测的”。 这套读法我在怎么读一份大模型发布稿:六个数分三组看,三个地方最容易讲错里拆过六步,这次正好拿来用。
第二件事更反直觉:Argon 并没有全面领先。 按谷歌自己那张表,它至少在这两项上排在对手后面——从零构建项目(FrontierSWE v2,55.0%,对手 65.5%)和在 Linux 终端里完成操作(Terminal-Bench 4.0,57.4%,对手 66.4%)。落后大约 10 个百分点。 也就是说,越像“给它一个全新烂摊子让它自己收拾”的任务,它越吃亏;越像“给它一份清晰材料让它推到底”的任务,它越占便宜。
第三件事,也是我最想让你记住的一组数字,来自独立评测机构 Artificial Analysis(不做厂商宣传、自己重跑所有模型的一家第三方)。它给 Argon 的公开数据是:
| 指标 | Argon 的数字 | 这个数在说什么 |
|---|---|---|
| 智能指数 | 53 | 综合难度的横向排名分,不是百分制 |
| 知识类答对率 | 0.499(约 49.9%) | 有标准答案的题,它对了一半 |
| 幻觉率 | 0.151(约 15.1%) | 越低越好;答错里“硬答”的比例 |
| 上下文窗口 | 100 万 token | 一次能读进去多少 |
这组数怎么读?15.1% 的幻觉率是真的进步——同一份榜单上,GPT-6 Astra 这项是 51.3%,Claude Sonnet 5 是 39.4%。相比它们,Argon 少胡说了一大截,这个下降幅度值得单独夸。
但同一份评测的另一栏在提醒你:它的答对率只有约 49.9%。也就是说在那些有标准答案的知识题上,它差不多是两次对一次。而且幻觉率最低的位置并不属于它,榜单上还有另一款模型以 14.2% 略低一点。
把这两个数字放在一起看,你才真正读懂了这次发布:它变得更不愿意瞎说了,但它并没有变得更全知。 这正是“AI 一本正经胡说八道”这件事的一个关键性质——所谓幻觉,不是模型在撒谎,而是它没有“我不知道”这个正常出口。想搞明白它为什么认不出自己的错,看这篇AI 为什么会一本正经地胡说八道:它认得出自己的错,却不会主动说。
为什么第一批不是给普通人用的
Argon 把“网络安全防御”放在了开放顺序最前面,这个决定本身就值得解释一次,因为它关系到你以后每次用新模型的体验。
理由是这类能力有反面。谷歌在发布材料里强调 Argon 擅长“长链条任务”——而把长链条能力放到代码和安全场景里,同一个本事既能用来找出自家系统的漏洞,也能用来找出别人的漏洞。厂商担心的正是后者。所以这一代的做法是:先给防守方(企业安全团队、部分政府机构),观察一段时间再往外放。
更值得注意的是另一条:据媒体报道,谷歌同时表示还计划推出一个不带护栏限制的版本。护栏就是模型内置的那些“这类问题我不答”的限制。这句话的意思是,厂商打算把“要不要拆掉限制”做成一个单独的产品档位,而不是全员放开。这类信息目前只在少数报道里出现,谷歌没有公布时间,你要留意的是别把它当成已经发生的事。
同一时间还有一条容易让人误会传播的消息:有 DeepMind 研究员在社交媒体上说,Gemini 4 已经做到了 RSI——递归自我改进(Recursive Self-Improvement,指模型参与改进模型自身,理论上会越滚越快),原话大意是“模型已经超过我,我教不动了”。这是研究员的个人说法,谷歌没有确认实现,只承认有早期迹象。 你在转发时应注意“员工说”和“公司说”完全是两件事——这也是读 AI 新闻最容易踩的一个坑,具体怎么分辨,可以参考让 AI 替你办事的安全清单:授权怎么给、钱怎么管、出事怎么办里关于“信息源分级”的思路。
普通人的三个动作
说了这么多,落到你身上其实只有三件事可做。
动作一:别为了它换订阅、改配置。
判断标准很简单:没有公布公众开放时间的模型,不值得你为它花钱。 现在就有两个常见的坑:一是有人趁机卖“内测资格”“镜像站”,二是各种“接入教程”其实接的是旧模型换了个名字。真想第一时间知道开放,只盯两个官方渠道就够:谷歌云的产品更新页,和你自己订阅档位的功能变更邮件。除此之外,短视频里的“已经能用了”一律先当成假的。
动作二:先把长任务跑顺,而不是先换模型。
这次 Argon 提升最大的是长流程任务。而长流程任务做不好的原因,八成不在模型,在你的任务描述。一个简单的对照:
| 现象 | 真正的原因 | 你现在就能做的 |
|---|---|---|
| 干到一半开始跑偏 | 条件边聊边补,它只保留了最近一轮 | 把目标、限制、验收标准一次写全 |
| 中间结果全对,最后合不上 | 输出太长,早期要求被挤掉了 | 每完成一段就让它复述一遍当前约定 |
| 说它忘了刚才的话 | 上下文有上限,旧内容会被压缩 | 关键约定单独贴回来,别指望它记着 |
这三条是同一件事的三个面:模型没有“记住”这个动作,只有“这次递进去多少”。 具体怎么把要求写成它不会漏的格式,看这篇AI 为什么聊着聊着就忘了你说的话:它没有“记住”这一步,只有“这次递进去多少”;能直接抄的说法在12 个真正好用的提示词:把要求写成验收标准里。
如果你手上是编程类的长任务,还可以直接参考这篇工程侧的做法:打造高效可靠的 AI 编程工作流:从单轮提示到工程级上下文闭环。
动作三:算清自己这一档值不值得等。
新旗舰对你划不划算,取决于两件事:你现在用什么、你干的活有多长。国内用户还有一层现实:Gemini 系列本身就不是能直接用的产品,账号、网络、支付都有门槛。换新模型不会解决这些,反而会增加折腾。 与其等 Argon,不如先把手上的模型用满——海外几条路线怎么搭配、什么活给谁干,这篇讲得比较全:海外大模型横评:GPT、Claude、Gemini、Llama 路线怎么配才划算。真想省钱,这篇的实测思路更直接:AI 账单砍到 10%:把 DeepSeek 和本地小模型接进你的工作流。
如果最终你要走 API 这条路,长上下文的经济账还得单独算一次:输出上限从几万涨到 100 万之后,“一次能写多少”和“一次要花多少”这两件事的关系完全变了,可以看上下文缓存与长上下文的经济学。
一句话版本
Gemini 4 的首款旗舰 Argon 在 9 月 30 日发布,隔了上一代 10 个多月;它把单次输出提到 100 万 token、把输入价压到每百万 tokens 2 美元、专门优化长流程任务;它在第三方幻觉率评测上从对手的 40%~50% 降到 15.1%,但同一份评测里它的知识答对率只有约 49.9%,从零建项目和终端操作两项还落后对手 10 个百分点;它现在只向网络安全防御机构开放,公众什么时候能用,谷歌没有说。
你现在最该做的,不是找渠道去用一场还没开始的发布会,而是把手上的模型用到位。