Google突发Gemini 3.8 Flash!平价高算力 写Code性能媲美Opus 5

撰文: 机器之心
出版:更新:

Google已正式推出Gemini 3.8。这是Google在短短六周内推出的第三款Flash系列模型。据介绍,Gemini 3.8 Flash在保持与Gemini 3.7 Flash相同速度和成本优势的基础上,进一步提升了推理与程式码能力,重点强化软件工程、Agent任务以及复杂多步骤推理场景。

Gemini 3.8包含两个版本:

Gemini 3.8 Flash:高智能通用工作模型(workhorse model)。相比Gemini 3.7 Flash,它在软件工程、Agent任务以及专业领域中的关键多步推理能力方面实现了显著提升。

Google正式推出Gemini 3.8。这是Google在短短几周内推出的第三款Flash系列模型。(X@google)

该模型采用与Gemini 3.7 Flash相同的首发价格:输入Token:每百万Token 0.75美元;输出Token:每百万Token 3.75美元。

与此同时,Google还推出了面向网络安全领域的专用模型Gemini 3.8 Flash Cyber。该模型被定位为Google目前能力最强的网络安全模型之一,重点提升漏洞发现和自动化补丁修复能力,并将通过Google推出的Fairwind Program向经过认证的安全防御人员开放。

Google表示,两个版本虽然面向不同部署环境,但均基于同一套底层模型能力,并通过长期运行的Agent循环机制进一步增强模型表现。Google DeepMind核心成员姚顺宇表示:对模型而言,这只是迈出了一小步;但对于RSI(递归自我改进,Recursive Self-Improvement)来说,却是一次巨大的飞跃。

聚焦长周期工程与Agent任务:Gemini 3.8突破复杂推理瓶颈

Aigora.ai CEO John Ennis将Gemini 3.8 Flash与Anthropic的模型进行了比较,称其具备:Opus 5级别的程式码质量,但成本只需一小部分,而且速度非常快。Gemini 3.8 Flash相比Gemini 3.7 Flash实现了显著提升,在许多任务中,其性能已经接近成本更高的前沿旗舰模型。

+1

在DeepSWE v1.1(长周期软件工程任务)测试中,Gemini 3.8 Flash能够自主完成复杂工程问题的端到端解决,在性能上超过了大多数参数规模更大的前沿模型,同时成本仅为后者的一小部分。此外,Gemini 3.8 Flash在专业知识领域中也展现出了支撑关键企业级自主任务所需的可靠性。

在需要高级分析和报告能力的定量分析、专业领域任务中,Gemini 3.8 Flash在Vals Finance Agent V2和Harvey法律Agent Benchmark等测试中均超过了Gemini 3.7 Flash以及其他前沿模型。

同时,Gemini 3.8 Flash在HLE-Verified测试中取得了54.9%的成绩,展现出其处理跨越STEM(科学、技术、工程、数学)、人文学科以及专业领域的多步骤复杂推理任务的能力。

【延伸阅读】中企推AI激光灭蚊器 雷达追踪精准射杀 App竟设全球打蚊排行榜(点击连结看原文)

+3

推理强度灵活可调:切换计算深度实现效能与成本平衡

这些性能提升源于一个核心设计选择:Gemini 3.8 Flash会投入更多计算量来完成任务。

在处理复杂任务时,该模型展现出更高的执行深度。(Google)

在处理复杂任务时,该模型展现出更高的执行深度——它会执行更多推理步骤,并反复调用工具完成任务。有时,为了最大化性能,尤其是在更高推理强度(higher effort levels)设置下,模型可能会消耗更多Token。

对于计算效率是首要限制因素的应用场景,开发者可以选择较低的推理强度级别,以减少Token消耗;或者继续使用Gemini 3.7 Flash。后者仍将持续获得支持,适用于更强调效率优先的工作负载。

Fairwind计划赋能防御方:Gemini 3.8 Flash Cyber重新定义资安防护

通过Fairwind Program向一批可信安全防御人员开放的Gemini 3.8 Flash Cyber,针对当前日益复杂的网络安全环境提供了关键优势,同时保持Flash系列模型的速度和成本优势,使安全团队能够快速迭代。

自主漏洞发现:在用于漏洞发现的行业标准基准测试CyberGym 中,Gemini 3.8 Flash Cyber展现出了前沿水平的自主漏洞发现能力。

该模型不仅超过了Gemini 3.5 Flash Cyber,同时也击败了参数规模明显更大的前沿模型。为了更贴近现实世界中的安全防御需求 —— 现实场景并不局限于CyberGym中的C/C++程式码库,Google还使用一个更全面的内部基准测试对Gemini 3.8 Flash Cyber进行了评估。

在该测试中,模型需要在覆盖20种编程语言、包含复杂程式码库的环境中,发现各种类型的漏洞。测试结果显示,Gemini 3.8 Flash Cyber相比此前模型实现了显著跃升,漏洞发现成功率超过70%。

自动化补丁修复:在Gemini 3.8 Flash Cyber的研发过程中,Google重点关注如何赋予安全防御人员专家级能力,使他们能够在与攻击者的对抗中获得优势。因此,从一开始,团队就投入资源用于漏洞修复能力建设,并优先提升修复能力,而非漏洞利用等攻击性能力。

由Collinear运行的CWE-Bench是一个用于评估补丁修复能力的高难度外部基准测试。在该测试中,Gemini 3.8 Flash Cyber位于性能与成本权衡的Pareto前沿:其Pass@1成功率达到47.2%,与领先的前沿模型47.8%的成绩接近,但成本显著更低。

商业化落地现状:内部程式码库实证与多端产品生态接入

真实世界影响:保护Google程式码安全

Google已经开始使用Gemini 3.8 Flash Cyber来保护公司内部程式码安全。例如:

- Chrome安全团队发现,与规模更大的商业模型相比,Gemini 3.8 Flash Cyber为Chrome漏洞生成的正确修复补丁数量提升了2.6倍。
- Wiz发现,在其内部渗透测试基准中,相比其他领先的前沿模型,Gemini 3.8 Flash Cyber的漏洞发现召回率(recall)提升了7.5%~9.7%,同时成本降低了2.3~5.2倍。
- Google云漏洞研究团队利用Gemini 3.8 Flash Cyber,在不到2小时内发现了一个关键基础漏洞。而此前,这类漏洞的研究和发现通常需要数月时间。

目前,Gemini 3.8 Flash已面向开发者、企业和消费者开放。开发者可以通过Google AI Studio、Android Studio等平台调用模型,企业用户可通过Gemini Enterprise使用相关能力;而Gemini AI Pro和Ultra用户则可以在Gemini App、Google搜寻AI Mode以及Google Sheets中体验该模型。

对于网络安全领域,Google通过Fairwind Program向可信政府机构、关键基础设施运营商和软件维护人员提供Gemini 3.8 Flash Cyber的优先访问权限。

【本文转自“机器之心”,微信公众号:almosthuman2014】