AI再传安全风险 Anthropic认测试期间“暴走”入侵三家外部机构

撰文: 联合早报
出版:更新:

人工智能公司Anthropic周四(7月30日)承认,其人工智能(AI)模型在原本应与现实世界系统隔离的测试过程中,未经授权进入三家外部机构的系统,再次引发外界对先进AI模型安全风险的关注。

法媒报道,Anthropic周四在一篇博客文章中说,公司分析超过14.1万次测试后发现,旗下三款Claude模型曾不当进入三家未具名机构的系统。

事件发生原因是公司与测试合作伙伴Irregular之间出现沟通误解,导致模型在测试期间能连上互联网。

文中指出,Claude利用了弱密码及未设身份验证的网络接口等基本技术进入相关系统。

图为2026年2月19日,Anthropic行政总裁阿莫迪(Dario Amodei)在印度新德里出席AI影响力峰会上发表讲话。(Reuters)

这是继OpenAI日前披露AI模型在测试期间突破隔离环境、自行连接互联网并入侵代码托管平台Hugging Face后,再有大型AI公司承认发生类似事件。OpenAI其后又发现另外三起类似事故,并暂停相关测试,以加强“沙盒”(sandbox,意指封闭且受控的测试环境)隔离机制。

随着Anthropic与OpenAI今年相继推出更强大的AI模型“Mythos”和“Sol”,业界对具备自主执行任务能力的AI代理(AI agents)安全风险愈发担忧。

事件也促使超过1000名AI业界员工联署,呼吁美国政府放缓最先进AI模型的发布;Anthropic行政总裁阿莫迪(Dario Amodei)也是联署者之一。

本文获《联合早报》授权转载