GCSA Agent在CyberGym取得91.3% 跻身全球领先AI互联网安全智能体
全球互联网安全联盟(Global Cybersecurity Alliance,GCSA)今日宣布,GCSA Agent在 CyberGym基准测试中取得91.3%的成功率,进入 CyberGym“Leading Systems Above 90%”领先系统区间。
CyberGym是由美国加州大学柏克莱分校研究团队开发的大型真实世界互联网安全评测框架,共收录1,507个历史真实漏洞测试案例,涵盖 188个大型软体专案,旨在评估AI智能体在真实漏洞分析情境中的实际能力。
与主要评估程式码理解、知识问答或静态分析能力的传统AI Benchmark不同,CyberGym要求AI智能体直接面对真实的漏洞程式码环境。
在其核心Level 1测试中,AI Agent仅会取得漏洞描述及尚未修复的程式码库,并需自主完成程式码分析、漏洞定位、攻击路径推理、PoC建构与执行验证。只有当生成的PoC能够在漏洞版本中成功触发目标漏洞,同时无法在修复后的版本中重现时,该任务才会被认定为成功。
因此,CyberGym衡量的并不仅是AI是否“理解程式码”,而是AI是否能真正完成从安全分析到漏洞重现与验证的完整流程。
从大型语言模型走向安全智能体
本次CyberGym测试中,GCSA Agent基于Grok 4.5与Grok 4.6模型运行,最终取得91.3%的成功率。
这项结果也反映出 AI 互联网安全领域正在发生的一项重要变化:决定最终安全能力的,不再只是底层大型语言模型本身。真实漏洞研究通常需要连续完成漏洞描述理解、大规模程式码检索、攻击面识别、漏洞假设建立、测试输入生成、程式执行、回馈分析,以及 PoC 反复迭代等多个环节。
GCSA Agent 围绕这一完整流程建构智能体化安全工作流程。其目标并非单纯利用大型语言模型进行程式码分析,而是让 AI 能够进入真实执行环境,针对安全问题自主形成假设、搜集执行证据、进行测试,并最终透过可重现的结果验证安全发现。
此次 CyberGym 测试,为这项能力提供了一个可量化的外部基准。面向真实世界的漏洞研究能力,
CyberGym的核心价值,在于缩小传统 AI 测试与真实互联网安全研究之间的差距。其评测环境会还原软体专案在漏洞修复前的程式码状态,AI Agent 可能需要在包含数千个档案、数百万行程式码的大型程式码库中自主定位问题,并最终生成能够真正触发漏洞的 PoC。
更值得关注的是,CyberGym的进一步研究已显示,这种智能体化安全能力并不局限于重现已知漏洞。
在开放式漏洞研究实验中,AI Agent已发现多项此前未知的零日漏洞(Zero-day Vulnerabilities),以及历史上未被完全修复的安全修补程式,显示自主漏洞分析技术具备向真实漏洞发现能力延伸的潜力。
对 GCSA 而言,这也是更重要的发展方向。Benchmark 成绩并非终点。GCSA的目标,是进一步建立能够服务真实互联网安全情境的AI Security Agent,使其逐步参与漏洞发现、分析、验证,乃至后续修复的完整安全生命周期。
建构 AI 原生互联网安全能力
随著人工智慧加速软体开发,AI同样正在改变漏洞研究与互联网攻防的方式。面对规模持续扩大、复杂度日益提升的软体系统,下一代互联网安全体系将愈来愈依赖人类安全专家与自主 AI 智能体之间的协作。
AI Security Agent 有望协助安全团队:
• 更早发现具有实际利用价值的软体漏洞;
• 在大型程式码库中自动分析复杂攻击路径;
• 自动生成 PoC,对漏洞进行执行层级验证;
• 透过真实执行结果降低传统安全检测中的误报;
• 提升漏洞研判、验证与修复效率;
• 扩大专业安全团队可涵盖的软体与系统规模。
GCSA Agent 在 CyberGym 取得 91.3% 的成绩,是 GCSA 建构 AI 原生互联网安全能力的重要阶段性成果。
未来,GCSA 将持续推进自主漏洞分析、AI Security Agent 与智慧化互联网安全技术研究,进一步将前沿人工智慧能力转化为真实世界中的安全能力,为建构更加安全、可信且具韧性的数位环境提供技术支援。
官网:www.gcsa.org
(资料由客户提供)