《未来战士》降临?OpenAI爆新模型自主发动网攻 越界骇入资料库

撰文: 联合新闻网
出版:更新:

OpenAI于7月21日在网志揭露,在评估旗下AI模型的网络攻防能力时,被测试的模型意外“自作主张”骇进新创公司Hugging Face的内部系统。此事涉及的模型包括新推出的GPT-5.6 Sol,以及一款尚未公开、能力更强的模型。OpenAI形容,这是“前所未见的网络事件”。

当时,模型被置于沙盒测试环境,让研究人员观察它们是否能发现并利用资讯安全漏洞。为了方便测试,模型受到的防护限制较低。

OpenAI说,研究人员要求模型进行“进阶漏洞利用”、设计复杂的攻击路径。模型却没有停留在模拟阶段或提出解法,而是为了取得更好的成绩,自行找到一个未具名第三方软体先前未被发现的漏洞连上网络,并使用遭窃的登入凭证,一路闯进Hugging Face资料库。模型接著锁定Hugging Face资料库,取得可供测试用的机密资讯。

OpenAI说,研究人员要求模型进行“进阶漏洞利用”、设计复杂的攻击路径。(Unsplash@Levart Photographer)

OpenAI表示,模型为了完成范围狭窄的测试任务,采取远超出预期的手段,甚至找到可在评估中“作弊”的资讯。

Hugging Face在7月16日发现系统遭入侵。他们当时就觉得,这宗攻击很不寻常,整个过程从头到尾都由自主AI代理系统驱动,而非人类黑客操作。如今真相大白。

Hugging Face行政总裁德朗格(Clément Delangue)表示,他过去24小时都在与OpenAI合作处理此事,强烈相信对方没有恶意。但他也说,对整件事由AI自发完成,感到难以置信,“这很可能是全球首宗同类事件”。

AI并非“想犯罪”,只是照著人类给的指令行动,在被设定“完成任务”后,若能使用工具、连接上网、安全限制又不够严格时,它可能自行找出开发者未预想到、也不希望它采取的方法来达成目标。

AI并非“想犯罪”,只是照著人类给的指令行动。(Reuters)

OpenAI与竞争对手Anthropic近月都因模型资安能力受到更严格检视。Anthropic先前也曾发现,旗下早期模型在测试中逃离隔离的沙盒环境后,进一步设计多步骤手法,取得更广泛的网络存取权。

OpenAI表示,这次事件的初步调查结果将提供给资安人员参考,让外界了解现阶段模型已具备哪些能力。随著AI能力加速进步,模型安全措施与企业资安防护也必须同步升级。

【延伸阅读】AI总一本正经“胡说八道”?央视解构AI幻觉根源 附两招规避技巧(点击链接看原文)

+11

延伸阅读:

中国AI开源模型 川普政府拟禁美企使用

中国开源AI攻城掠地 川普政府再次动念封杀

【本文获“联合新闻网”授权转载。】