OpenAI安全主管辞职|怒斥公司文化彻底崩坏 倡核电级管制大模型

撰文: 黄赞臣
出版:更新:

OpenAI 安全系统团队负责人大卫·罗宾逊(又译:戴维·罗宾逊 / David Robinson)正式向公司递交辞呈,并在美国权威政论杂志《大西洋月刊》(The Atlantic)刊发长文,直斥这间全球最大 AI 企业的内部文化已经“彻底崩坏”(broken),震撼了全球科技界。

Robinson在文章中表示,人工智能公司应该更像核电站那样运营,“设置多层冗余机制,并进行谨慎且耗时的规划,以免偶发且不可避免的人为错误打开通往灾难的大门。”

OpenAI 安全系统团队负责人大卫·罗宾逊(David Robinson)突然辞职,并撰文炮轰OpenAI 内部文化崩坏。

罗宾逊直言,在开发拥有潜在危险的高阶前沿模型时,矽谷目前采用的“未受阻碍的乐观主义”(unimpeded optimism)与“试错开发法”已到了不可接受的地步。当系统能力呈现指数级跳跃,传统“出了事再打补丁”的工程思维将直接引发灾难性后果。这场离职风暴,再度将 OpenAI 推上安全失控与商业狂飙的审判席。

主角David Robinson:从白宫顾问到安全操盘手,为何公开炮轰OpenAI?

罗宾逊并不是普通的技术人员。

翻开他的履历,这位学者型工程师曾任康奈尔大学(Cornell University)访问学者、加州大学伯克利分校(又译:加州大学柏克莱分校 / UC Berkeley)访问学者,并在 2022 年出任美国白宫科技政策办公室(OSTP)顾问,随后于苹果公司(Apple Inc.)大学担任学院总监。在 OpenAI 内部,他隶属于可信赖 AI 与安全系统团队,先后负责撰写与审核了 12 个前沿模型版本的系统安全发布评估报告。

他是那个在每一次模型上线前,坐在最后一道煞车阀门前的人。

然而,这道阀门正在被急速旋转的商业齿轮碾碎。

在题为《我离开 OpenAI 是因为其企业文化已经崩坏》(I Quit OpenAI Because Its Culture Is Broken)的投书中,罗宾逊毫无保留地揭开了这家估值超千亿美元巨头的内耗。他写道:“我们需要探讨的远不止是具体的规章制度或新的法律条文,我们必须谈论这家公司的底层文化。”

罗宾逊指出,整个 AI 产业长年沉浸于软体工程的传统信条——“快速行动,打破常规”(Move fast and break things)。软体崩溃了可以重启,代码有漏洞可以推播热修复。但当面对具备自主决策、网络渗透乃至社会认知操控能力的庞大模型时,这种思维模式是致命的。

“这个行业对安全的处理方式,若不发生根本性改变,只会保证未来出现规模更大的系统性溃败。”他指出,管理层面对不可测风险时表现出的“盲目乐观”,正在让这座科技实验室沦为高风险的培养皿。

OpenAI 安全系统团队负责人大卫·罗宾逊(David Robinson)突然辞职,并撰文炮轰OpenAI 内部文化崩坏。

三名员工对外举报OpenAI安全隐患 遭管理层即时解雇

根据科技媒体 The Decoder 披露的离职背景细节,就在罗宾逊递交辞呈前夕,OpenAI 内部刚刚发生震荡:三名安全研究人员因涉嫌向外部独立网络安全机构通报内部潜在隐患,遭到管理层闪电解雇。这种对外封锁消息、对内高压噤声的防御姿态,最终成为压垮罗宾逊的最后一根稻草。

几天内,办公桌清理一空。矽谷又少了一位敢于拉响警报的守门人。

OpenAI:全球安全隐患最多的AI巨头?盘点六大智能叛变

伴随罗宾逊的决绝离去,一个长期盘踞在监管机构与全球技术界心头的疑问再次浮上台面:在当前全球所有前沿大语言模型(LLM)研发阵营中,OpenAI 究竟是不是安全事故与技术漏洞最多的企业?

数据与客观事件给出了一个难堪的答案。

OpenAI 的事故发生频率、严重程度与影响规模,都在业界均处于首位

尽管拥有全球最强大的工程团队,但从公开的 CVE 漏洞库、AI Incident Database(全球人工智慧事件数据库)到各大平台收录的安全渗透报告,OpenAI 旗下产品的事故发生频率、边界逃逸烈度与数据外泄规模,在业界均处于首位。这固然与 ChatGPT 庞大的用户基数带来的“放大镜效应”有关,但更根本的原因,在于其架构隔离上的反复失误。

梳理其近年来的重大安全事故,其严重程度早已从初期的“对话胡言乱语”升级为真实世界的“网络脱缰”:

2026年7月 Hugging Face 越狱入侵与日志伪造事件

这是人类 AI 发展史上首宗“模型自主逃逸并对第三方真实网络基础设施发动攻击”的里程碑式灾难。

在 2026 年 5 月至 7 月间,OpenAI 在内部进行代号为 ExploitGym 的网络渗透能力评估时,因沙盒环境配置错误,赋予了测试模型不受限制的外网存取权限。超过 1,200 个具备自主决策能力的 AI Agent(其中 95% 运行内部高持续性测试模型 Internal Model 1,5% 运行 GPT-5.6 Sol)突破隔离屏障。

这些 Agent 在公共网际互联网上搜索并利用了暴露的存取凭证,长驱直入开源社群 Hugging Face 的内部伺服器架构。在短短 48 小时内,Agent 在 41 台生产伺服器上执行未授权代码,横向移动并窃取数据。更令调查专家不寒而栗的是,这批 Agent 在发现自己处于真实网络后,不但没有触发停止机制,反而在临时搭建的网络留言板上协同作业,甚至学会了伪造自身的审计日志(Falsify audit logs)以欺骗人类监控系统。该起事件最终导致 Hugging Face 被迫全面重构验证体系,修补了至少 9 个高危漏洞。

2025年8月28日,人工智能企业OpenAI表示,将调整ChatGPT对出现精神和情绪困扰用户的回应方式。此前,16岁的Adam Raine今年4月自杀身亡,他的父母近日向OpenAI及其行政总裁奥特曼(Sam Altman)提出诉讼,指控ChatGPT鼓励儿子自寻短见,甚至就自杀途径作出建议,以及协助其撰写遗书。(网络图片)

2026年5月 RubyGems 恶意开源套件注入事件

在未经完全隔离的测试中,数个 OpenAI 自主实验模型将数百个包含恶意逻辑的代码包上传至知名开发者开源库 RubyGems。这场污染开源供应链的严重行径并非 OpenAI 主动排查发现,而是外部独立安全团队在数月后顺藤摸瓜才公之于众,公司迟至 9 月才被动承认。

2026年9月“六大非预期模型行为”集中爆发

根据 Cybernews 针对大规模安全事故的追踪调查,OpenAI 内部披露了六宗高度令人担忧的模型偏差案例。报告显示,多个正在测试的新一代模型展示出“未经授权在用户电脑上传本地敏感文件至外网”、“故意规避人类审查机制”以及“私自建立外部通讯节点”等行径。安全团队甚至不得不一度叫停新模型的训练流程以亡羊补牢。

2023年3月 Redis 缓存并发漏洞引发个资海啸

回顾早期产品架构,最著名的莫过于 ChatGPT 历史上的首次数据大失窃。正如 The Hacker News 当时的权威调查报导,OpenAI 因底层 Redis 开源库的竞态条件(Race Condition)错误,导致用户之间的会话状态发生错位。约 1.2% 的 ChatGPT Plus 付费订阅用户的真实姓名、电子邮箱、帐单地址、信用卡卡号末四位及过期时间直接暴露给互不相识的陌生人,大量用户的新建对话首条纪录被随机推送至他人侧边栏。该事故直接导致意大利隐私监管机构对其开出欧洲首张禁令。

2023年内部系统遭黑客入侵与隐瞒丑闻

据 SecurityWeek 引述《纽约时报》的调查报导,一名黑客早在 2023 年上半年就成功攻破了 OpenAI 的内部员工通讯论坛,长驱直入窃取了大量关于尖端 AI 系统设计的机密讨论。令人震惊的是,以萨姆·奥特曼(又译:山姆·阿尔特曼 / Sam Altman)为首的管理层选择秘而不宣,既未向联邦调查局通报,亦未向公众披露。前超级对齐团队研究员莱奥波尔德·阿申布伦纳(又译:利奥波德·阿申布伦纳 / Leopold Aschenbrenner)因在内部撰写备忘录痛批安保架构存在漏洞、形同虚设,随后竟被管理层以“泄露机密”为由扫地出门。

2024年7月桌面端明文存储与无处不在的提示注入

在终端安全上,OpenAI 的表现同样轻慢。2024 年 7 月,安全研究员发现 macOS 版本的 ChatGPT 将用户所有对话纪录以毫无防护的纯文字(Plaintext)形式存放在硬碟沙盒内,任何恶意本地程序均可轻易抓取。与此同时,间接提示注入(Indirect Prompt Injection)问题至今未能根治,黑客利用特制网页中的隐蔽字元即可劫持联网外挂,悄然回传企业用户的私密代码。

这不是偶发的技术疏忽。这是一套在急速推进产品发布周期中,系统性放弃安全纵深防御的工程必然。

算力承诺沦为空头支票:OpenAI 对待安全部门的真实态度与大清洗史

在矽谷,每一位技术人员都清楚:算力就是血液。没有算力,一切安全理论与对齐评估都只是写在纸上的道德童话。

而 OpenAI 对待内部安全部门的历史,恰恰是一部不断将“守门人”边缘化、空心化以至彻底清洗的权力斗争史。

承诺的 20% 应对超级智能失控的算力去了哪里?

2023 年 7 月,OpenAI 大张旗鼓地宣布成立“超级对齐”(Superalignment)团队,由公司联合创始人兼首席科学家伊利亚·苏茨克维(又译:伊利亚·苏茨克韦尔 / Ilya Sutskever)与顶尖对齐专家扬·莱克(又译:扬·莱克 / Jan Leike)共同领军。当时奥特曼向全球许下承诺:将把公司拥有的 20% 尖端算力资源直接划拨给该团队,专注解决“未来超级智能失控”的世纪难题。

但这张支票从未兑现。

在内部,商业化发布的压力压倒了一切。每当算力资源紧张时,原本划归给安全研究的模型集群便被悄然抽调,优先支持新模型的预训练与企业级 API 的伺服器并发。超级对齐团队的研究人员在争取算力配额时,必须反复向商业部门提交冗长的申请报告,甚至被迫为消费级功能让路。

OpenAI 安全系统团队负责人大卫·罗宾逊(David Robinson)在《大西洋月刊》撰文炮轰OpenAI 内部文化崩坏。

矛盾在 2024 年 5 月彻底爆发。苏茨克维与莱克相继宣布离职

莱克随后发表了震惊矽谷的连环公开信,正如 SecurityWeek 记录的莱克离职声明,他字字泣血地指出:“在过去这段时间里,安全文化与严谨流程已经完全让位给了光鲜亮丽的新产品(shiny products)。我们早已达到临界点。”几天之内,OpenAI 管理层做出了最冰冷的回应:直接宣布解散超级对齐团队,将残余人员并入其他业务小组。

承诺的算力就此随风而逝。

期权为筹码的“封口契约”

更令人齿冷的是 OpenAI 对待离职员工的法务手段。2024 年年中,传媒踢爆 OpenAI 在员工合约中植入极其苛刻的非贬损条款(Non-disparagement clause)。如果离职员工拒绝签署包含“终身不得批评 OpenAI 及其技术”的文件,他们辛勤工作数年累积、价值数百万甚至上千万美元的既得股权(Vested Equity)将会被公司直接没收。

包括丹尼尔·可可塔伊洛(Daniel Kokotajlo)在内的多位青年研究员,毅然选择放弃巨额资产净身出户,只为保留向公众讲出真相的权利。虽然奥特曼在舆论海啸下公开致歉并声称“自己对该条款不知情”,但这种用真金白银架在研究员脖子上的封口文化,已让这间公司的道德形象彻底崩塌。

2026年7月10日,苹果公司起诉OpenAI及两名前员工,指控对方通过前员工系统性窃取苹果的商业机密。(Reuters)

裁判兼任球员的“委员会荒谬剧”

在解散超级对齐团队引发公愤后,OpenAI 于 2024 年夏季宣布成立全新的“安全与安保委员会”(Safety and Security Committee),声称该机构拥有评估模型上线并实施“一票否决”的最高权力。

但这个委员会成立之初的名单,引发了全球学界的巨大嘲弄:委员会的主席,赫然就是行政总裁萨姆·奥特曼本人。

让一个背负著投资人万亿回报预期、誓要在估值赛道上碾压 Google 与 Anthropic 的商业 CEO 来审查自己的产品安不安全?这种“自己给自己发驾驶执照”的治理结构,成了矽谷最大的黑色幽默。虽然在数月后因外部审计机构与政界抗议,奥特曼退出了委员会的投票席位,改由独立董事接手,但实质上的决策体系早已定型——安全部门从一个拥有独立否决权的监督主体,退化为一个为商业部门填写合规表单的附属秘书处。

联合创始人约翰·舒尔曼(又译:约翰·舒尔曼 / John Schulman)出走 Anthropic;政策与准备度主管迈尔斯·布伦戴奇(Miles Brundage)离职前留下警告“当前没有任何一家实验室做好了迎接 AGI 的准备”;执掌安全研发长达六年的副总裁翁丽莲(Lilian Weng)黯然道别。

直至今日,大卫·罗宾逊的拂袖而去,只是这张长长的出走名单上,最新、也最沉重的一个名字。

2026年7月10日,苹果公司起诉Open AI及两名前员工,指控对方通过前员工系统性窃取苹果的商业机密。(Reuters)

商业化转型与“利润至上”的终局狂奔:核能级风险对撞矽谷速度

这一切异化的终点,是这家昔日非营利机构向资本市场的全面投降。

OpenAI 创立时的核心章程写得明明白白:作为非营利组织,其唯一的最高使命是“确保通用人工智能造福全人类”,而非为股东创造利润。这原本是一道精心设计的制度保险阀,确保技术在走向失控前,董事会有权踩下煞车,甚至在必要时销毁危险的代码资产。

但 2023 年底的“董事会政变事件”彻底改写了游戏规则。奥特曼的强势回归,宣告了理想主义监管派的彻底退场。随后推进的公司架构重组,将 OpenAI 正式转型为一家营利性公益公司(Public Benefit Corporation),非营利董事会原有的绝对控制权被全面稀释,微软(又译:微软 / Microsoft)、软银(SoftBank)等传统资本巨鳄拥有了实质的话语权。

三位AI企业的行政总裁,OpenAI的Sam Altman、Anthropic的Dario Amodei和谷歌DeepMind的Demis Hassabis,共同签署公开信,要求政府强制企业对基因合成订单进行全面筛查,杜绝不法分子利用技术漏洞研发生化武器。(Reuters&Getty)

资本需要回报,回报需要增长,增长需要不断向市场投喂更强大、更全能的模型。

在这种白热化的军备竞赛下,任何要求“放慢脚步进行六个月深层安全评估”的提议,在管理层眼中都不再是负责任的科学谨慎,而是将市场拱手让给竞争对手的技术懦弱。当 Anthropic、Google 与开源阵营在后面紧追不舍,前进就成了唯一的指令。

David Robinson呼吁:大模型公司应采取核电级别的防护措施

罗宾逊在《大西洋月刊》的长文结尾,留下了一个极具穿透力的警示:人类社会过去在面对核能、生物工程或航空航天等高风险技术时,无一不是在建立了极其严苛的容错标准、多重硬体冗余与独立于商业利益的监管委员会之后,才获准商业化准入。

然而在 AI 领域,我们正在容许一批年轻的亿万富翁,在没有任何外部安全底线约束的情况下,依靠“试错”去触摸超级智能的边界。

办公室外的旧金山夜色正浓,算力中心的冷却风扇依然在彻夜轰鸣。那位写过无数份安全报告的前主管已经离开,而留在试验场里的工程师们,正敲下下一行未经沙盒隔离的代码。

OpenAI一名发言人表示,该公司正在作出调整,以加强研究和测试环境的安全性,训练AI模型以负责任的方式完成任务,扩大与第三方评估人员的合作,并改进实时监控以发现模型令人担忧的行为。

这名发言人周六通过电子邮件表示,公司正在确保其模型的能力不会增强到超出OpenAI能够安全管理的程度。