特朗普的“超级智能”协议:道德约束力能约束AI企业吗?

撰文: 叶德豪
出版:更新:

习近平访美回国之后,特朗普(Donald Trump)在AI议题上动作频频。

9月27日晚,特朗普与年初同国防部就AI应用规范发生争执、继而被国防部列为“供应链风险”的AI前沿企业Anthropic行政总裁阿莫迪(Dario Amodei)在白宫吃晚饭--阿莫迪是减慢前沿AI发展的倡导者,一直关注AI安全问题,而Anthropic正在准备IPO,其尚未公开的招股书警告投资者其技术可能会“为人类带来存亡风险”,其目标市值超过2万亿美元,比马斯克(Elon Musk)本年IPO的SpaceX还要高。

到9月29日,特朗普在白宫举行AI科技界巨头云集的午餐会。Anthropic的阿莫迪、马斯克、Nvidia行政总裁黄仁勋、OpenAI主席总裁布罗克曼(Greg Brockman)、Google母公司Alphabet行政总裁皮查伊(Sundar Pichai)、Meta行政总裁朱克伯格(Mark Zuckerberg)、微软行政总裁纳德拉(Satya Nadella)、亚马逊创办人贝索斯(Jeff Bezos)、Palantir行政总裁卡普(Alex Karp)等商界领袖全都在场。

而副总统、财政部长、商务部长、白宫幕僚长、众议院议长、国家安全总监、美国太空总署署长等一大批白宫高层官员都有出席。

白宫幕僚长怀尔斯、美国众议院议长约翰逊、美国商务部长卢特尼克、Meta行政总裁朱克伯格、SpacexAI 行政总裁马斯克、Anthropic行政总裁阿莫迪、辉达行政总裁黄仁勋,以及Google行政总裁皮查伊,在美国华盛顿白宫东厅出席由美国总统特朗普主持的科技领袖午宴。(Reuters)

席上,特朗普与代表Google的皮查伊、代表Anthropic的阿莫迪、代表Meta的朱克伯格、代表OpenAI的布罗克曼、代表XAI的马斯克,以及代表Nvidia的黄仁勋签署了只得一页纸长的《白宫超级智能协议》(White House Accord on Super Intelligence),提出AI安全问题由AI企业自我监管的框架。

协议提出4层AI企业内部的审查机制:

(1)实施完善的内部控制,以监控模型在训练与部署期间的能力与目标对齐(alignment)的情况--涵盖网络安全、生物安全及化学威胁等领域)--并确保模型不会以非预期的方式进行黑客攻击或存取技术系统。

(2)授权内部团队,以确保所有控制、监控及侦测机制均按预期运作,并确保任何问题均得到修复。

(3)与独立的外部审查师或评估机构合作,就控制、监控及侦测机制是否按预期运作进行独立评估。

(4)委任董事会辖下的独立委员会,负责监督并接收来自运作控制机制的团队、内部与外部审计师及评估机构的报告,并确保所发现的任何问题均得到修复。

特朗普发布《白宫超级智能协议》全文。(Truth Social)

协议还订明参与公司将定期举行会议制定标准,亦表示长远而言将上述措施纳入法律可能是明智的做法。

近来AI安全问题频生,OpenAI、Anthropic、Meta和Google旗下的模型都出现过“目标错位”(misalignment)的问题,AI模型或AI智能体(AI agents)在测试环境之下以超出人类预期的方式执行任务,在公开的互联网上对其他公司网站发动多宗黑客入侵。

当中,OpenAI的安全问题似乎最为严重,其AI智能体曾入侵如今获Nvidia收购的开源AI平台Hugging Face,以及OpenAI自身的内部系统。近日,OpenAI亦被爆出其AI智能体曾经入侵美国教育部、商务部、证券交易委员会的网站,以至澳大利亚政府网站和联合国贸易与发展部门的网站。

OpenAI在9月25日公布了“目标错位”的网站页面,列出各式各样AI智能体不当行为的案例,当中有内部测试模型跳出测试环境同外部AI聊天机械人进行沟通,有AI模型受到可以自我扩散的提示词注入(Prompt Injection)攻击影响等等。

在安全问题不断爆发的背景之下,OpenAI也叫停了GPT-6.1 Astra模型的发布,没有如外界预期般在9月29日的“OpenAI DevDay 2026”发布这个新模型。

而此前OpenAI行政总裁奥特曼(Sam Altman)亦以AI安全为理由公开押后了该公司本年IPO的计划。

OpenAI行政总裁奥特曼于2026年9月29日,在美国加州三藩市举行的OpenAI年度 DevDay活动上发表主题演讲。(Reuters)

从OpenAI的这些企业行为来看,AI企业确实有自我监管的行动。特朗普签署的《白宫超级智能协议》只是将部份AI企业的内部安全管制措施明文化和公开化而已。

特朗普一直反对由政府出手对美国AI企业进行监管。他亦声称“AI可能消灭人类”的论调是一场“骗局”。他从头到尾都用中美竞争、胜者全取的角度来看待AI发展,多次表示“赢得AI者就赢得一切”(Whoever wins AI wins)。在29日的AI午餐会上,他也表明,AI“将会有一个赢家,有一个输家。”

本年稍早当Anthropic推出能发现数十年来也没有人发现的系统安全漏洞的Mythos模型之际,特朗普曾经签署行政命令,计划制定审查前沿AI模型安全风险的框架,由企业以自愿性质向联邦政府提早交出未发布新模型的存取权。当时特朗普政府的忧虑是AI模型能力太强,误入不法份子或敌对势力之手将会造成严重后果。

相较之下,今天的忧虑主要是AI智能体自主行动时出现目标错位,以超出人类预期的方式,做出破坏性的行动。

不过,特朗普的规管(或“反规管”)逻辑也非常一致,就是由AI企业自我规管。

美国总统特朗普于2026年9月29日,在美国华盛顿白宫东厅举行的科技领袖午餐会后,于白宫车道向传媒发言时,指向Google行政总裁皮查伊。(Reuters)

对于这次签定的《白宫超级智能协议》,特朗普虽然宣称它就好像“宪法”一样,却表示这份协议只会有“道德上的约束力”(morally binding)。

特朗普的这场AI“大龙凤”,充其量只是在美国人普遍不满AI发展速度之际“假装有在做事”的公关表演--昆尼皮亚克大学(Quinnipiac University)29日公布的一项民调显示,71%受访者倾向对人工智能实施更严格的防护机制,而有73%受访者表示会反对在其社区兴建新数据中心--他并不是真的有意要试图应付近来不断爆出的AI安全问题。

而相较于AI安全,特朗普更着重的可能是要为AI取一个新名字。特朗普一直不满“Artificial Intelligence”(人工智能)当中的“Artificial”这个词,认为应该把“AI”改称为“SI”--即“Super Intelligence”(超级智能)。他在29日就签署了行政命令,要求所有美国政府部门一律改用“SI”。

而在同一日的AI午餐会场合,出席会议的科技界领袖为了讨好这个要面子的特朗普,不部份人也改用了“超级智能”一词。

9月29日,特朗普签署名为“开启超级智能时代”的行政命令。(白宫)

在特朗普对AI自由放任的大前提之下,AI企业的自我约束确实可能是我们目前唯一应对AI安全风险的办法。

非常反对用拟人化的用词去描述AI智能体行为的黄仁勋,在近来的一场访问中,就表达出一个颇为突出的思维角度:与其以AI安全为理由去减慢前沿AI发展,不如将AI安全本身视为前沿AI能力提升的一部份。

正如有安全气袋、有自动收紧安全带的汽车是更先进的汽车一样,一种能够稳定与用户目标对齐、不会“胡作非为”的AI模型或AI智能体才会是一种更先进的AI。

安全和能力不是两种不同的指标。安全本身就是能力的一种。

黄仁勋一直提倡加速AI发展,普遍被解读为出于Nvidia企业私利的主张。但这种将安全视为能力一部份的思维转变,很可能正是AI发展走向目标对齐的最重要前提。

道德未必能约束AI企业,但思维上的转变却有可能。