AgentHubAgentHub
Back to Blog

Gemini 4 登场了:输出 100 万 token、幻觉率降到 15.1%,但你现在还用不上

AgentHub 编辑部··13 min read·21 views
Gemini 4 登场了:输出 100 万 token、幻觉率降到 15.1%,但你现在还用不上

9 月 30 日(美国当地时间),谷歌发布了 Gemini 4 这一代的首款模型,型号名 Argon。它最实在的三个变化是:一次能输出 100 万个 token、每百万 tokens 的输入价定在 2 美元、以及专门为了“连续干几小时的活”而优化。最容易被忽略的一个事实是:你现在还用不上它。第一批拿到访问权的不是普通用户,也不是开发者,而是一批做网络安全防御的机构。

这篇不吹不黑,只做三件事:把谷歌这份发布稿里的数字翻译成人话;告诉你它到底哪里变强、哪里没赢;最后给你三个现在就能做的动作——而不是让你熬夜等解锁。

先给结论:登场的是谁,你现在能不能用

先把最容易讲错的三件事说清楚。

第一,登场的是“Gemini 4 的第一款”,不是“Gemini 4 的全部”。 多家媒体都用了“首款旗舰模型”这个说法,也就是说 Argon 是这一代里最先出场的最高端那一款,后续还会有便宜档、快速档。谷歌没有公布后面几款的时间。所以如果你在网上看到“Gemini 4 全线上线”,那是把话说大了。

第二,它是一次换代,不是挤牙膏。 谷歌上一条真正的旗舰线是 2025 年 11 月 18 日的 Gemini 3 Pro,这次是 2026 年 9 月 30 日,中间隔了 10 个多月。这期间谷歌发了三四个带小数点的版本(下面第二节会讲),但那些是小改款。

第三,普通人拿不到。 目前的开放顺序是:先给“Fairwind 计划”里的可信网络安全机构和部分政府预发布项目;然后是付费调用 API 的开发者和 Google AI Ultra(谷歌最高档的订阅)用户;普通订阅档要往后排。谷歌没有公布面向公众开放的时间,只表示会“尽可能迅速、同时以安全的方式扩大开放”。这句话的重点在后半句。

为什么隔了 10 个多月:小数点和换代是两回事

要理解这次发布为什么被这么多人在意,得先看这一年半谷歌的节奏。把公开报道里的日期排成一条线,事情就清楚了:

时间谷歌做了什么
2025-11-18Gemini 3 Pro 发布,这一代的旗舰
2026-02-19Gemini 3.1 Pro,小改款
2026-05-19Google I/O 上承诺“3.5 Pro 下个月发”
2026-07-16彭博报道延期,原因是编程能力不达标
2026-07-22CEO 皮查伊承认推迟,改口“Gemini 4 年底发”
2026-07-21 至 09-02连发 3.6 / 3.7 / 3.8 三款 Flash(快速档)
2026-09-30Gemini 4 首款旗舰 Argon 发布

这条线上有两个细节值得记住。

一个是 3.5 Pro 根本没发出来。承诺“下个月发”之后 60 多天没有动静,媒体给出的原因是编程能力没达标。对普通用户来说,这意味着一件事:当你看到某个模型版本号从 3.1 跳到 3.6,别以为它变强了 5 倍——那更可能是同一代产品在做修补和降价,而不是换代。

另一个是 这次比承诺的“年底”提前了。皮查伊 7 月说的是年底,实际 9 月底就端出来了。业界普遍把它解读为竞争压力:这一年对手的日子都不好过——同一时间线上,OpenAI 和 Anthropic 各自都有新款旗舰在前面跑,谷歌被甩在了后面。

顺带解释一个词。旗舰(frontier model,直译“前沿模型”)指的是各家最贵、最强、最近更新的那一款;它下面还有“快速档”“迷你档”这些便宜但弱的兄弟型号。你平时在 App 里默认用到的,往往不是旗舰。

这次真正改的三件事

改动一:单次输出上限提到 100 万 token。

这是 Argon 最硬的参数变化,也是媒体标题里的常客。先解释一下这两个词:

  • token:模型眼里的“字”。它不是一个汉字也不是一个英文单词,而是被切成的小片段,中文大约 1 个字合 1~1.5 个 token,英文大约 1 个词合 1.3 个 token。
  • 输入 / 输出:你发给它的内容算输入,它回给你的算输出。两者分开计价,输出通常贵 4~5 倍。

“输出 100 万 token”意味着它一口气能写完大约七八十万字的内容。听起来夸张,但它的真实用途不是写长文,而是让模型有地方“思考”:现在的模型在解复杂问题时会先生成一大段中间推理,再给结论。推理过程越长,能力越强,也越吃输出额度。把输出上限拉高,本质是给思考腾地方。

这跟你有什么关系?如果你只让它写周报、润色邮件,100 万输出对你毫无意义。它只对一类场景有价值:把一整件事交给它——比如改一个大型代码库、把几十份文档读完再写结论、连续调用工具跑几十步。这类“长流程任务”才是这代模型真正的目标。

改动二:价格是冲着“便宜”去的。

早期定价是每百万 tokens 输入 2 美元、输出 10 美元,命中缓存的输入只要 0.1 美元。有报道按“完成一个任务”来算成本,给出约 1.99 美元一个任务、比对手低四成左右;也有媒体按 token 单价算出“只有对手的几分之一”。

这里有个坑必须提醒你:单价便宜不等于总花费便宜。 输出上限从原来的几万拉到 100 万,意味着模型一次可能写回你几十倍的内容,而输出单价是输入的 5 倍。如果你不做任何限制,账单完全可能不降反升。想把自己的调用成本算清楚,可以先看这篇每百万 tokens 到底是多少字:三步算清一次 AI 调用要花多少钱,里面按汉字给你换算过了。

顺便提一句价格战这个大背景:9 月下旬刚刚出现过凌晨 90 分钟的价格战:Claude Opus 5.5 刚发布,OpenAI 反手把 API 永久砍半。Argon 这次的定价,本质上是被这条战线逼出来的。

改动三:主打“长流程”,但这也暴露了它的偏好。

谷歌公布的成绩单里,最能打的是长链条任务:编程类第三方评测 DeepSWE v1.1 拿了 77.9%,自动化任务 AutomationBench 51.3%,金融代理任务 65.4%。而在需要模型从零搭一个项目、或者在真实终端里一步步操作时,它反而落后。

跑分怎么读:它赢了什么,又没赢什么

这是本篇最想教你的部分,因为同一个发布,你看到的数字可能全不一样。

关于“赢了几项”,媒体至少给出了三种说法:18 项评测里领先 12 项、19 项里 13 项第一、14 项基准第一。这不是有人在编数据,而是因为:谷歌那张对照表里有些项是第三方机构跑的、有些项自己并列第一、有些项要不要算进去各家判断不同。

所以第一条经验是:“屠榜”这种词没有信息量,你要问的是“哪几项、多少分、谁测的”。 这套读法我在怎么读一份大模型发布稿:六个数分三组看,三个地方最容易讲错里拆过六步,这次正好拿来用。

第二件事更反直觉:Argon 并没有全面领先。 按谷歌自己那张表,它至少在这两项上排在对手后面——从零构建项目(FrontierSWE v2,55.0%,对手 65.5%)和在 Linux 终端里完成操作(Terminal-Bench 4.0,57.4%,对手 66.4%)。落后大约 10 个百分点。 也就是说,越像“给它一个全新烂摊子让它自己收拾”的任务,它越吃亏;越像“给它一份清晰材料让它推到底”的任务,它越占便宜。

第三件事,也是我最想让你记住的一组数字,来自独立评测机构 Artificial Analysis(不做厂商宣传、自己重跑所有模型的一家第三方)。它给 Argon 的公开数据是:

指标Argon 的数字这个数在说什么
智能指数53综合难度的横向排名分,不是百分制
知识类答对率0.499(约 49.9%)有标准答案的题,它对了一半
幻觉率0.151(约 15.1%)越低越好;答错里“硬答”的比例
上下文窗口100 万 token一次能读进去多少

这组数怎么读?15.1% 的幻觉率是真的进步——同一份榜单上,GPT-6 Astra 这项是 51.3%,Claude Sonnet 5 是 39.4%。相比它们,Argon 少胡说了一大截,这个下降幅度值得单独夸。

但同一份评测的另一栏在提醒你:它的答对率只有约 49.9%。也就是说在那些有标准答案的知识题上,它差不多是两次对一次。而且幻觉率最低的位置并不属于它,榜单上还有另一款模型以 14.2% 略低一点。

把这两个数字放在一起看,你才真正读懂了这次发布:它变得更不愿意瞎说了,但它并没有变得更全知。 这正是“AI 一本正经胡说八道”这件事的一个关键性质——所谓幻觉,不是模型在撒谎,而是它没有“我不知道”这个正常出口。想搞明白它为什么认不出自己的错,看这篇AI 为什么会一本正经地胡说八道:它认得出自己的错,却不会主动说。

图 1|两个数要一起看:幻觉率降到 15.1%,但答对率只有 49.9%
图 1|两个数要一起看:幻觉率降到 15.1%,但答对率只有 49.9%

为什么第一批不是给普通人用的

Argon 把“网络安全防御”放在了开放顺序最前面,这个决定本身就值得解释一次,因为它关系到你以后每次用新模型的体验。

理由是这类能力有反面。谷歌在发布材料里强调 Argon 擅长“长链条任务”——而把长链条能力放到代码和安全场景里,同一个本事既能用来找出自家系统的漏洞,也能用来找出别人的漏洞。厂商担心的正是后者。所以这一代的做法是:先给防守方(企业安全团队、部分政府机构),观察一段时间再往外放。

更值得注意的是另一条:据媒体报道,谷歌同时表示还计划推出一个不带护栏限制的版本。护栏就是模型内置的那些“这类问题我不答”的限制。这句话的意思是,厂商打算把“要不要拆掉限制”做成一个单独的产品档位,而不是全员放开。这类信息目前只在少数报道里出现,谷歌没有公布时间,你要留意的是别把它当成已经发生的事。

同一时间还有一条容易让人误会传播的消息:有 DeepMind 研究员在社交媒体上说,Gemini 4 已经做到了 RSI——递归自我改进(Recursive Self-Improvement,指模型参与改进模型自身,理论上会越滚越快),原话大意是“模型已经超过我,我教不动了”。这是研究员的个人说法,谷歌没有确认实现,只承认有早期迹象。 你在转发时应注意“员工说”和“公司说”完全是两件事——这也是读 AI 新闻最容易踩的一个坑,具体怎么分辨,可以参考让 AI 替你办事的安全清单:授权怎么给、钱怎么管、出事怎么办里关于“信息源分级”的思路。

普通人的三个动作

说了这么多,落到你身上其实只有三件事可做。

动作一:别为了它换订阅、改配置。

判断标准很简单:没有公布公众开放时间的模型,不值得你为它花钱。 现在就有两个常见的坑:一是有人趁机卖“内测资格”“镜像站”,二是各种“接入教程”其实接的是旧模型换了个名字。真想第一时间知道开放,只盯两个官方渠道就够:谷歌云的产品更新页,和你自己订阅档位的功能变更邮件。除此之外,短视频里的“已经能用了”一律先当成假的。

动作二:先把长任务跑顺,而不是先换模型。

这次 Argon 提升最大的是长流程任务。而长流程任务做不好的原因,八成不在模型,在你的任务描述。一个简单的对照:

现象真正的原因你现在就能做的
干到一半开始跑偏条件边聊边补,它只保留了最近一轮把目标、限制、验收标准一次写全
中间结果全对,最后合不上输出太长,早期要求被挤掉了每完成一段就让它复述一遍当前约定
说它忘了刚才的话上下文有上限,旧内容会被压缩关键约定单独贴回来,别指望它记着

这三条是同一件事的三个面:模型没有“记住”这个动作,只有“这次递进去多少”。 具体怎么把要求写成它不会漏的格式,看这篇AI 为什么聊着聊着就忘了你说的话:它没有“记住”这一步,只有“这次递进去多少”;能直接抄的说法在12 个真正好用的提示词:把要求写成验收标准里。

如果你手上是编程类的长任务,还可以直接参考这篇工程侧的做法:打造高效可靠的 AI 编程工作流:从单轮提示到工程级上下文闭环。

动作三:算清自己这一档值不值得等。

新旗舰对你划不划算,取决于两件事:你现在用什么、你干的活有多长。国内用户还有一层现实:Gemini 系列本身就不是能直接用的产品,账号、网络、支付都有门槛。换新模型不会解决这些,反而会增加折腾。 与其等 Argon,不如先把手上的模型用满——海外几条路线怎么搭配、什么活给谁干,这篇讲得比较全:海外大模型横评:GPT、Claude、Gemini、Llama 路线怎么配才划算。真想省钱,这篇的实测思路更直接:AI 账单砍到 10%:把 DeepSeek 和本地小模型接进你的工作流。

如果最终你要走 API 这条路,长上下文的经济账还得单独算一次:输出上限从几万涨到 100 万之后,“一次能写多少”和“一次要花多少”这两件事的关系完全变了,可以看上下文缓存与长上下文的经济学。

一句话版本

Gemini 4 的首款旗舰 Argon 在 9 月 30 日发布,隔了上一代 10 个多月;它把单次输出提到 100 万 token、把输入价压到每百万 tokens 2 美元、专门优化长流程任务;它在第三方幻觉率评测上从对手的 40%~50% 降到 15.1%,但同一份评测里它的知识答对率只有约 49.9%,从零建项目和终端操作两项还落后对手 10 个百分点;它现在只向网络安全防御机构开放,公众什么时候能用,谷歌没有说。

你现在最该做的,不是找渠道去用一场还没开始的发布会,而是把手上的模型用到位。

Related Articles

Trends & News

MCP 简史:675 天换过五版规范,从 6 个示例服务器到 247 家机构

2024 年 11 月 25 日,Anthropic 用六个示例服务器和一个桌面客户端发布 MCP;到今天 675 天,它换过五版规范、SDK 累计下载破 10 亿、协议本身交给 247 家机构参与的中立基金会。这篇按版本把每一步改了什么、为什么改、竞品何时进场、鉴权与安全怎么补课一次讲清,并给出五条能直接用在选型上的判断。

Trends & News

中国大模型三年:从 8 款备案到 1112 款,从发布会竞赛到港交所敲钟

2023 到 2026,中国大模型走了三条线:备案数从 8 涨到 1112,API 价格从"没人报价"打到永久砍半,开源许可从自定义条款走到 MIT 与 Apache 2.0,最后智谱和 MiniMax 在 2026 年 1 月前后脚上市。这篇按四年时间顺序,只写能查到公开出处的节点。

Trends & News

从图灵到智能体:人工智能 76 年兴衰史,为什么爆发恰好是现在?

1956 年达特茅斯的狂想、两次经费寒冬、专家系统的崩塌、深蓝的暴力美学、2012 年深度学习春天、ChatGPT 时刻,直到 2026 年智能体全面爆发——复盘 AI 七十六年兴衰曲线会发现:每次引爆都不是“更聪明”,而是算法、算力、数据、执行、成本这块木桶恰好补齐了新板子。看懂这条规律,也就看懂了今天的 Muse、Jev 与 API 价格战。

Trends & News

凌晨 90 分钟的价格战:Claude Opus 5.5 刚发布,OpenAI 反手把 API 永久砍半

9 月 22 日深夜(北京时间 23 日凌晨),Anthropic 发布 Claude Opus 5.5 并将缓存读取价大降 60%;约 90 分钟后 OpenAI 连发 GPT-6 Sol($2/$10,较上代腰斩)与 GPT-6 Luna($0.10/$0.50),官宣永久降价 50%。一夜三款模型,AI 竞争正式从刷跑分转向拼每任务成本。本文给出完整价格表、三款模型分工、降价背后的三股推力,以及开发者按每任务成本省钱的实操建议。

Explore AI Ecosystem

Ready to take action? Explore AI tools & MCPs

Discover ChatGPT 6, Claude 3.7, Devin and 3000+ open-source MCP tools with 1-click config.

Gemini 4 Argon 发布解读:什么时候能用、跑分怎么读、价格划不划算 - AgentHub