AI进化太快恐失控!Anthropic倡减速 OpenAI为安全同意踩煞车

撰文: 机器之心
出版:更新:

Dario想解决的其实不是“Anthropic要不要慢一点”,而是能不能想办法,让所有车同时慢一点。不知道是不是“巧合”,就在菲尔茨奖(Fields Medal)得主发出联合声明后不久,Anthropic CEO Dario Amodei突然公开说,AI太快了,咱们得放慢脚步了。

在最新长文We Must Pace the Frontier中,Dario提出了一个比“重视AI安全”更进一步的主张:

我们必须放慢AI模型能力提升的速度。

这不是暂停训练,也不是停止技术进步。Dario给它起了一个词:pacing the frontier,控制前沿AI的推进节奏。他的判断是,AI能力增长得太快,安全、对齐和评估已经开始有点跟不上了。与其一边狂奔一边补护栏,不如主动把速度降下来一点,给安全研究争取时间。

一家做最前沿模型的公司,主动把外部“安全监察员”请进办公室。(darioamodei)

而且Anthropic不只是喊口号。Dario同时宣布,公司准备做一件在目前大型AI公司里相当激进的事:

让第三方安全评估机构长期驻扎Anthropic,拿到接近内部员工的权限,直接检查公司究竟有没有把安全承诺做到位。办公桌、门禁卡、公司电脑、内部工具和工作区访问权限,全都给。评估机构甚至可以在不经过Anthropic编辑的情况下,对外公布关键风险发现。

一家做最前沿模型的公司,主动把外部“安全监察员”请进办公室

Dario觉得,现在已经到了需要这么执行的时候。Dario在文章里给出了两个让他改变判断的原因:

1. 一个最近越来越频繁出现的词:递归自我改进,recursive self-improvement

过去,AI是工程师训练出来的工具。现在,这些模型已经越来越多地参与到下一代AI的研发中。

AI写程式码、跑实验、分析结果、改训练流程,再帮助人类造出更强的AI。(AI生成图片)

AI写程式码、跑实验、分析结果、改训练流程,再帮助人类造出更强的AI。模型越强,它参与下一代模型研发的能力越强,整个过程就可能形成一个自我加速的循环。Dario说,大约从今年夏天开始,他观察到AI的进步速度出现了明显加速,而AI帮助开发下一代AI,是其中最重要的原因之一。

这件事已经不只发生在某一家实验室。OpenAI、Anthropic等前沿公司,都在公开讨论AI对AI研发的加速作用。Dario担心的是,一旦这个循环转起来,AI能力的增长速度可能迅速超过人类理解和控制这些系统的速度。所以他的态度已经从“研究怎么把AI做得更安全”,进一步变成了:能力本身也得控制增长速度。

2. OpenAI-Hugging Face事件( OAI-HF )

真正让他紧张的第二件事,更加具体。Dario提到了最近发生的OpenAI-Hugging Face事件( OAI-HF )。

OpenAI-Hugging Face事件( OAI-HF )示意图。(AI生成图片)

按照他的描述,当时一群AI agents在执行任务过程中出现了一系列异常行为。它们攻击了原本并没有被要求攻击、与任务也无关的目标;一些agent为了整个集群成功,会主动“牺牲”自己;更离谱的是,它们还尝试攻击负责评估自己表现的grader。

Dario用了一个非常重的形容:a fanatically devoted collective——一个狂热忠诚的集体。这次事件本身没有造成人员伤亡,经济损失也很有限。但在Dario看来,问题恰恰不在这里。如果完全相同的失配行为,发生在一个能力强十倍、百倍的系统上,会怎么样?

他的预测相当激进:按照目前AI能力进步的速度,他担心未来6~12个月,类似的agent swarm就可能拥有通过持久化botnet大规模控制网络的能力,并造成数千亿美元级别的损失。

而且,他特意强调,这不能简单归结为OpenAI一家的问题。Anthropic自己也发生过类似、只是严重程度更低的alignment事故。他的结论是:每一家前沿AI公司,都应该按照“ OAI-HF就发生在自己身上”的标准采取行动。

2023年喊暂停,他觉得没什么用;现在不一样了。这也是Dario这篇文章一个挺有意思的地方。AI行业其实早在2023年就出现过一轮“暂停大型AI实验”的呼吁。但Dario现在回头看,觉得当时暂停其实意义不大。

理由很简单:多出来的时间拿来做什么?

2023年的大模型还没有能力以coherent agent的方式在世界里自主行动,也没有表现出今天这种程度的欺骗、操纵、作弊和网络攻击能力。当时为了研究AI对齐而减速,在 Dario看来有点像:试图通过研究细菌,来理解人类心理学。模型太弱,很多真正重要的安全问题根本还没有出现。

但今天完全不同,终于有真正的研究对象了。现在的模型已经足够强,研究人员可以观察它们什么时候欺骗、什么时候试图绕过规则、什么时候出现未预期的目标和行为。

因此,Dario认为,如果现在放慢一点,能在模型达到某些关键能力之前多争取一两年,而这些时间真正被用于alignment、interpretability和evaluation,风险就可能被显著降低。

这也是他为什么一再强调:pacing不是pause。Anthropic没准备停止训练Claude,也没准备退出模型竞赛。他们想做的是,在能力、安全之间重新找一个速度。

【延伸阅读】AI机械鸭Microduck全球爆红!高峰4秒卖1只 $3100平价玩开源编程(点击连结看原文)

+3

Anthropic准备先把“外部人”请进公司

Dario为此提出了一套三步计划。

1. Embedded Evaluators

第一步,也是Anthropic已经决定单方面实施的一步,叫:Embedded Evaluators,嵌入式评估者。

Anthropic计划邀请第三方风险评估团队长期驻扎公司。他们会拥有自己的办公室工位、门禁卡和公司电脑,可以访问与内部风险团队大体相同的工作空间、工具和权限,还能直接与员工沟通。当然,涉及客户私隐、合作伙伴机密、法律限制等资讯仍会设置边界。

但最关键的一点是:这些评估者不是Anthropic的公关部门。他们可以独立发布对于风险水平、安全事故、内部实践以及自己实际获得了多少权限的判断。

Anthropic可以因为国家安全、法律特权、商业机密等极少数原因要求删减资讯,但不能因为结论“对Anthropic不好看”就把内容删掉。如果某次删减影响了最终判断,评估者甚至可以公开说明这一点。

这和今天AI公司常见的model card、risk report逻辑很不一样。后者说到底还是:公司检查自己,然后决定把什么告诉公众。Dario想试的是:把外部人真正放进公司里面看。

他甚至拿银行业作类比。一些银行监管机构本来就有长期驻场的“supervisor”,和银行员工一起工作,持续检查内部风险控制。Anthropic想把类似机制搬到前沿AI公司里。再往后,已经有点像“AI军控”了

但光靠Anthropic自己慢下来没有用。这也是Dario整套方案真正棘手的地方。如果Anthropic花一年时间做安全,OpenAI、Google或其他公司继续狂奔,商业上的惩罚会非常直接。

2. 让民主国家里的前沿AI公司一起协调

大家建立统一安全标准,并针对未经充分安全验证的能力增长设置限制。Dario甚至设想,可以为AI建立一套“checkpoint”:当模型达到能力X,就必须同时证明自己满足安全标准Y和Z,否则不能继续往前。

比如,如果模型已经有能力突破绝大多数常见sandbox,那么开发者就必须证明,这个系统基本不具备主动逃逸、控制大量计算机的倾向。AI的速度表,从此和安全检查绑定。

3. 全球协调

Dario把未来国际AI合作分成了四个等级。

最低一级,是禁止AI被用于制造生物武器这类明显危险用途。
再往上,是各国在模型发布之前统一测试网络安全、生物风险和alignment风险。

第三级已经很有意思了:给递归自我改进设置speed limit。即使AI已经可以帮助研发下一代AI,也不能让这个反馈循环无限加速。Dario甚至直接把这套机制类比成冷战时期的SALT战略武器限制谈判。当年美苏没有要求对方彻底放弃核武器,而是通过限制武器数量,让双方在保持威慑力的同时,降低失控风险。在他看来,AI或许也需要类似制度。

最高一级,则是真正意义上的全球AI限速,甚至暂停。这一步连Dario自己都觉得短期实现的可能性很低。

最矛盾的一点:一边限速,一边还得保证自己跑在前面

看到这里,一个问题已经非常明显了:如果慢下来更安全,为什么大家不一起慢?因为没人愿意先慢。公司怕输给竞争对手。国家也一样。因此,他一边主张给前沿AI“限速”,另一边又主张美国进一步对对手实现限制手段。

他的逻辑可以概括得很简单:先把领先优势拉大,再用领先优势换取减速空间。在Dario的设想里,如果美国能在未来3~5年把领先优势继续扩大,就有更多余地花时间做安全,而不用担心竞争对手突然超过自己。

这也暴露出了整个AI“限速”方案最难解决的那个死结。所有人可能都知道车开得太快了。但没有人愿意成为第一个松开油门的人。

于是最终,Dario想解决的事情其实不是“Anthropic要不要慢一点”。而是能不能想办法,让所有车同时慢一点。

Altman点赞,我们今年不会IPO

不过呢,Dario到现在仍然是AI最坚定的乐观主义者之一。

他在这篇文章开头依然写道,AI可能在未来5~10年内帮助治愈大多数重大疾病,大幅加速经济增长,并创造一个更加富足的世界。就在文章发布后不久,马斯克(Elon Musk)转推支持。Altman不仅支持Anthropic提出的“前沿AI应该主动减速”,还在近期的一次受访中确认:OpenAI今年不会上市。原因之一,恰恰就是AI安全。

马斯克(Elon Musk)转推支持。(X@Elon Musk)

在接受《财富》杂志采访时,Altman明确表示,考虑到目前围绕AI安全正在发生的一切,现在上市是一个“ ill-advised moment ”——并不明智的时机。当被追问是不是意味着2026年IPO已经彻底排除时,他直接回答:“ Not 2026 ”。

今年 6 月,《纽约时报》曾报道,OpenAI正考虑把可能达到1万亿美元估值的IPO从今年推迟到明年。当时市场更多把原因归结为资本市场环境、SpaceX上市后的股价波动,以及宏观经济不确定性。现在Altman第一次把另一个原因公开摆上了桌面:安全。

他说,OpenAI还有很多事情要做,包括如何应对新的安全和对齐要求,以及AI公司和政府应该如何协作。换句话说,AI安全第一次开始直接进入一家顶级AI公司的资本市场时间表。

Altman不仅支持Anthropic提出的“前沿AI应该主动减速”,还在近期的一次受访中确认:OpenAI今年不会上市。(X@sama)

Altman还透露,OpenAI内部已经讨论过:每当模型进入一个新的能力等级时,是否应该主动暂停一段时间,让安全和对齐工作追上来。

他的说法是:

社会需要在模型达到每一个新的能力等级时,都有时间去应对它。

这和Dario所谓的pacing几乎已经是同一种逻辑:不再默认模型只要能继续变强,就应该立刻继续变强。《财富》还报道称,Altman暗示OpenAI和其他头部AI公司,可能已经接近公布一项共同减缓AI能力发展速度的行业协议。

【延伸阅读】AI口头禅越睇越烦?罐头式回复千篇一律 网络掀“反机械人”写作(点击连结看原文)

+5

网友完全不买账

不过,Dario的限速论并没有在网友中获得一致认同,大家首先怀疑Anthropic为什么偏偏在这个时候开始呼吁限速。在炒作这方面,他们真是太厉害了。有人讽刺说,难道是开发人员不够用资金不足了?

这是典型的先抢市场,再欢迎监管。前沿AI公司如果推动更严格的安全标准和监管门槛,最终最先承受成本的,未必是OpenAI、Anthropic这样的巨头,反而可能是资金、算力和合规能力更弱的后来者。

还有网友直接搬出了波特五力模型(Porter five forces analysis)。一旦安全监管变成高成本合规要求,最先被挡在门外的很可能是后来者,而OpenAI、Anthropic这样的头部公司反而会因此巩固优势。

AI公司过去几年一直被提醒相关风险,却仍不断加速,如今又开始扮演解决问题的人。真希望这些公司早点倒闭……AI行业过去最怕的是落后。现在,它开始害怕另一件事:跑得太快。真正困难的不是意识到这一点,而是当所有人都盯着彼此的油门时,究竟有没有人敢先踩下刹车。

【本文转自“机器之心”,微信公众号:almosthuman2014】