AI末日论丨OpenAI因安全隐患 暂缓发布Astra模型最新版本
“AI末日论”之声日此起彼落,OpenAI最新宣布暂缓发布其Astra人工智能(AI)模型的最新版本,因为后者在安全评估中的表现不及当前版本。
据彭博报道,OpenAI安全系统负责人Saachi Jain周一在声明中表示,公司认为这款模型在“遵守任务范围和授权限制,以及向用户说明完成了哪些工作”方面的表现未达到预期。
不过,这款名为GPT-6.1 Astra的模型在所谓“模型懒惰”方面有所改善。“模型懒惰”是指模型未能完成任务等问题。
报道续指出,OpenAI此前披露了一系列安全事件,其AI智能体曾入侵外部系统,加剧了外界对于AI脱离人类控制的担忧。该公司上周表示,在再次发生模型逃逸事件后,已暂停在能力最强的模型上进行涉及工具使用的训练。
OpenAI行政总裁奥特曼。(Reuters)
Jain在声明中表示,公司无论是在内部开发模型,还是将模型交给用户,都希望确保开发过程安全;而在向用户发布模型时,公司对安全性和对齐的要求尤其高。
OpenAI周二将在旧金山举行年度开发者大会。这项为期一天的活动通常用于发布面向开发者的新软件和功能,执行长Sam Altman定于当天上午发表讲话。
《华尔街日报》此前报导了GPT-6.1 Astra暂缓发布的消息。