Gemini 4 Argon|输出百万Token半价腰斩对手 跑分屠榜深度解释

撰文: 黄赞臣
出版:更新:

Alphabet 旗下谷歌 Google 无预警发布全新第四代旗舰模型 Gemini 4 Argon(美国时间 2026 年 9 月 30 日晚)。全新模型架构将单次生成输出上限由原先的 64K 一口气拉升至 100 万 Token,首发定价每百万输入仅 2 美元、输出 10 美元,价格仅为对手 Claude Opus 5.5 的一半,更在18项企业与代码基准评测中,夺得13项第一名,被网民称为“屠榜”。根据X平台多名测试者披露,Gemini 4的生成速度是对手的3倍或以上,非常快速。

Gemini 4 Argon 展现王者归来的气势,令科技市场震动,但首阶段仅开放予网络防御审查团队。而且,传说中的Gemini 4 Pro 并未现身。

王者归来:13 项榜单霸榜背后有哪些优点和缺点?

在此次发布的 18 项前沿基准测试中,Gemini 4 Argon 拿下 13 项第一,并在 1 项与对手打平。其中一般普通用户最关注的“AI幻觉”方面,Gemini 4 能力有明显提升。

根据AA-Omniscience Non-Hallucination Rate 非幻觉率评测,Gemini 4 Argon 直接登顶第一名(高达 96% 左右)。这意味著该模型在几乎不会瞎猜,回答的可靠性极高。在模型能力方面,在多名测试者抢先发布的作品中,可见Gemini 4 Argon的表现确实全面碾压 OpenAI 的顶级模型GPT 6 Astra。(见下文的多则 X 帖文)

AA-Omniscience Non-Hallucination Rate(非幻觉率) • 定义:计算公式为 1 - 幻觉率。这个指标衡量模型在面对不确定的盲区时,能否准确辨识自己的知识边界,选择“拒绝回答”或“承认不知道”,而不是胡编乱造(即产生幻觉)。

长程软体工程评测 DeepSWE v1.1 上,Argon 跑出 77.9% 的历史新高,直接越过 Claude Opus 5.5(74.2%)与 GPT-6 Astra(74.1%)。

在专注真实业务工作流的 AutomationBench,Argon 录得 51.3%,领先第二名 Opus 5.5 整整 8.8 个百分点。

法律推理基准 Harvey's Legal Agent Benchmark 的差距更加悬殊,Argon 取得 19.6%,接近 Claude Fable 5.1(6.7%)与 GPT-6 Astra(5.4%)的三倍。

数据亮眼,但并非全无破绽。

细看终端系统操作与底层代码,Argon 出现明显失分。在考验底层复杂架构修复的 FrontierSWE v2 上,GPT-6 Astra 以 65.5% 狠甩 Argon 的 55.0%,落后幅度达 10.5 个百分点。

在终端指令操作 Terminal-Bench 4.0 上,Claude Opus 5.5 亦以 66.4% 保持 9 个百分点的明显身位。

Gemini 4 Argon未算全能战神,传将推出Ultra终极版

社群平台 X 上,科技圈早期Gemini 4测试者(如被广泛转载的推文与技术讨论串)近期流传一种论调:代号“Argon”(氩气)的模型仅是 Gemini 4 世代的中阶定位,后续还有更庞大的重量级杀手锏。这个说法只对了一半。

从化学元素的命名体系推敲,氩(Argon,原子序 18)属于钝气家族。根据矽谷开发者社群在 Reddit 与 Hacker News 的代码爬梳,Google 内部过去确曾出现不同气体代号(如早期测试的 Krypton、Xenon 甚至 Radon)的实验版本纪录。

但官方事实完全相反。Google DeepMind 执行长德米斯·哈萨比斯(又译:德米斯·哈萨比斯 / Demis Hassabis)团队在发布会中将 Argon 定义为该公司“最强大的前沿智能体(Frontier Intelligence)”。之所以被社群猜测为“入门”,主因在于其 2 美元的定价过于激进,加上早期泄漏基准过高,让部分期待“全方位碾压”的开发者产生心理落差。

目前的权威定论清晰:Argon 就是 Google 现阶段推向商业战场的真正旗舰,而非缩水试水版。不过,X平台上多位参与测试的专业人士纷纷披露,Google 很可能推出Gemini 4 Ultra 终极版,将拥有更强大的能力。

突破 100 万输出 Token,底层技术到底改了甚么?

过去的大模型,往往以“百万 Context 窗口”作为宣传卖点,但那指的是“读取(Input)”,实际“写入(Output)”通常被死死卡在 8K 到 64K 的狭窄区间。

Argon 彻底打破这个紧箍咒。

模型具备高达 100 万 Token 的单轨迹生成能力(Single-trajectory Generation)。这意味著它不再需要被人类开发者一段一段拆解催促,而是能够在单次任务中维持连续逻辑链,从头到尾写出数万行具备上下文关联的可用代码。

多名抢先测试的用家,在X平台上惊叹,Gemini 4 能轻易生成复杂而华丽的3D作品:

成果已在 Google 内部落地:

核心系统迁移:Argon 智能体已接手 Fuchsia 系统中超过 80 万行的 Zircon 微内核代码,将 C/C++ 自动改写为具备记忆体安全的 Rust 语言。

底层性能跃升:在 libgav1 影像解码器重构中,Argon 重写了 32,000 行 SIMD 指令代码,成品运行速度比过往人工移植版本快出 2.7 倍,产出位元影像完全一致。

机房算力释放:Argon 针对底层运行库进行自我调优,直接为 Google 数据中心释放了超过 300 TiB 的记忆体资源,预计最终可节省多达 1 PiB。

更让资安界震动的是抗干扰能力。有报导指出,在 Gray Swan 的间接提示词注入(Indirect Prompt Injection)测试中,Argon 在连续 15 次攻击下的沦陷率仅为 0.7%,而 GPT-6 Astra 的失败率为 8.5%,国产模型 Kimi K3 则高达 52.7%。

防御固若金汤。

API 定价屠杀:性价比狂甩对手几条街?

根据 Proje Defteri 成本分析精算,Google 为 Argon 设定了极具掠夺性的首发促销价:

输入 Token:每百万 2.00 美元(正式期恢复至 4.00 美元)
输出 Token:每百万 10.00 美元(正式期恢复至 20.00 美元)
快取输入(Cached Input):直接给予 95% 折扣,每百万仅 0.10 美元

横向对比业界:Anthropic 的 Claude Opus 5.5 当前每百万输入要价 4 美元、输出 20 美元,Argon 正好是它的五折。OpenAI 的 GPT-6 Astra 更是高居输入 10 美元、输出 50 美元,Argon 的单次调用成本整整便宜了 80%。

若以一个包含 100 万输入 Token 及 20 万输出 Token 的中型自动化稽核任务计算:GPT-6 Astra 帐单:20.00 美元
Claude Opus 5.5 帐单:8.00 美元
Gemini 4 Argon 首发:4.00 美元

当企业面对百万次呼叫时,这笔差额不是四舍五入的零钱,而是上千万美元的真金白银。

成功秘密:Gemini自己训练自己 Google实现 RSI 突破?

递归自我改进(又译:递归自优化 / Recursive Self-Improvement, RSI)在 2026 年秋天跨越理论红线。Google 旗下研发团队近期在康奈尔大学预印本库(arXiv)接连公开重磅研究,证实 AI 研究智能体已能在模型底层权重冻结的前提下,透过双层优化架构与回放模拟机制,自主改写外围工具代码并自我纠错,使研发效率呈跨领域递增。这项技术随即被无缝注入最新旗舰 Gemini 4 Argon 官方架构,让单一模型能自主重构数十万行作业系统内核代码。

长久以来,AI 研发被困在“人力堆砌”的死胡同,从此改写:

工程师写 Prompt、调超参数、搭建工具链,模型只是被动执行的计算单元。一旦遇到极其复杂的长程科研任务,搜寻空间动辄包含数千次方案生成与评估,固定策略的智能体往往反复误入死胡同,耗尽算力却一无所获。

DeepMind 打破了这个僵局。

根据刊登于预印本平台的 Dream-RSI 论文专案,研究人员提出了一套“世界演化架构”。核心秘密在于把探索历史转化为“可回放的模拟地图”。AI 走出第一趟盲区后,毋须每次在真实环境硬碰硬测试,而是能在内部构建的模型中快速想像、预演不同决策分支,大幅缩减在演算法设计、GPU 核心工程及数学优化时的无效试错成本。

权重不用动。策略自己进化。

另一项刊载于 arXiv 的 AI 研究智能体递归自我改进论文更进一步揭露了惊人实测:在完全无人干预的 8 天自主连续运行中,双层优化系统(Bi-level Optimization Loop)的外层代理不断审视并改写内层代理的代码结构。改动从未见过的架构代码,结果却成功泛化至完全陌生的科研任务,研究效率持续拔高。

Analytics India Mag 专题分析 点出关键:Google DeepMind 在通往人工通用智能(AGI)与超级智能的蓝图里,早就把 RSI 列为最致命的四大支柱之一。

以往,自我优化最容易陷入“奖励作弊(Reward Hacking)”——AI 为了冲高跑分,钻空子修改评测脚本。

最新架构用外层元优化锁死了评价基准,逼使智能体只能老老实实改良问题求解策略。

成果直接体现在刚面世的 Gemini 4 Argon 上。能一口气接管 Fuchsia 系统超过 80 万行 Zircon 内核、将 C/C++ 自动改造成 Rust 记忆体安全代码,靠的正是这套 RSI 循环。

自我迭代的闸门已经拉起。

传Google内部对 Gemini 4 能力存质疑与分歧

彭博社(Bloomberg)报导指出,Google 内部员工对即将全面推向市场的新一代旗舰模型 Gemini 4 Argon 在“程式码编写(Coding)”等关键实务表现上存在质疑与分歧。

基准测试与实际应用落差:虽然 Google 官方公布的基准测试数据表现亮眼(部分资安与推理测试超越竞品),但知情内部人士向 彭博社 透露,在真实复杂的工作场景及特定软体编程任务中,Gemini 4 的实测表现不符预期。

竞品进度压力:部分员工忧心竞品(如 OpenAI 的 Astra 系列与 Anthropic 的 Fable/Mythos 系列)在真实任务与代理(Agent)能力上的迭代速度仍快于 Google。

Google 官方立场与反驳

否认表现不佳:Google 官方反驳了这项指控,表示称其在编程等领域表现欠佳并不准确。由 Koray Kavukcuoglu 带领的 Google DeepMind 团队表示,Gemini 4 已在内部广泛投入复杂工程任务,包含大规模资料中心记忆体最佳化以及将大型 C/C++ 专案迁移至 Rust 等实务工作。

谁能先用Gemini 4 Argon?普通开发者为何被挡在门外?

如此强大的模型,普通开发者今天却触碰不到。

AlphaCorp 技术分析报告披露,由于 Argon 在网络安全黑客渗透测试与代码审计上的破坏力过于强大,Google 选择了极端谨慎的分阶段释放路径。目前仅对“Fairwind 专案”下的受信任防御者及内部核心团队开放,甚至部分团队是在移除安全护栏的环境下进行闭门演练。

下一步将开放予付费 API 客户与 Google AI Ultra 订阅用户,但官方尚未给出明确日历。

加州山景城总部显然吸取了过往惨痛教训。在化学、生物、放射性与核能(CBRN)防护机制完全收敛之前,这头长程推理猛兽,仍被锁在深层安全沙盒之中。