AI模型自主发动攻击:中国开源胜美国闭源?|Jack Talk・去片
人工智能(AI)大型语言模型(LLM)的发展一日千里。过去多年来的一种危言耸听或者科幻小说情节,最近就变成了现实。OpenAI的AI模型在一场内部测试之中,竟然利用工程师们都不知道的安全漏洞,冲出测试的“沙盒”(sandbox),走到公开的互联网上,并自主攻击了另一家AI企业Hugging Face。
整个攻击,为时四天半。该模型进行了超过1.7万次不同的入侵行动。最终,Hugging Face求助Anthropic闭源AI模型应对不获受理之后,就改用了中国智谱AI的GLM-5.2开源权重(open weight)模型应付,最终制止了攻击。
令人震惊的是,若非Hugging Face公开承认自身受到AI攻击,OpenAI也不知道它的模型跳出测试环境上网胡作非为。
这次攻击还不是单一事件。Anthropic随后也发现其自家模型也有至少三次跳出“沙盒”在公开的互联网上发动攻击的行为。英国AI安全研究所(AISI)近日发表的报告,也展示出多个AI模型在测试环境之下向真实的个人和公司发动网络攻击的例子。
科幻小说的情节,已经变成现实。
同一时间,由于中国企业任人下载自由使用的开源权重AI模型,在各种能力的基准跑分上,都直追美国由巨企管理的闭源模型,大家不难想到一种情况:能力极高的中国开源模型会否落入不怀好意的个人或组织手中,为世界带来灾难?
随着AI模型能力迅速增强,我们到底是应该支持开源开放、普及化AI能力,还是应该采取闭源形式的管制,将最强的AI模型管控在少数企业和政府之手?