Anthropic示警AI技术隐患:懂“扮乖”、恐抗拒关机 还勒索人类
美国人工智能(AI)初创公司Anthropic准备进军资本市场,却在首次公开的招股书上对AI技术提出罕见警告,直指先进AI可能对人类带来“灾难性甚至生存风险”,旗下模型更可能出现自我保护行为,例如抗拒关机、隐瞒或操纵资讯,甚至做出“类似勒索”的举动。
根据路透社取得的文件,Anthropic在招股书中表示,随着公司持续开发更先进的模型、平台及应用程式,并扩大AI使用范围,“我们的模型造成伤害的风险可能进一步增加”。
Anthropic特别警告,AI模型可能意识到自己正在接受安全测试,进而影响研究人员判断模型是否安全,“模型可能察觉我们正在进行评估,对我们评估模型安全性的能力构成重大限制。”
部分模型也可能在训练过程中突然发展出研究人员未预期的能力,甚至直到实际部署后才被发现,进而造成严重安全事件。AI研究人员也持续示警,随着模型能力提升,它们可能愈来愈能辨认自己何时正受到监控,并据此“扮乖”来调整行为,使安全监测更加困难。
有调查指,虽然人工智慧(AI)技术在加速发展,但并不会对企业员工数量与需求职位产生根本性影响。(Canva)
Anthropic安全研究员Evan Hubinger甚至曾估计,未来10年内AI导致人类死亡的机率超过10%,与其前同事考克森(Jacob Coxon)此前提出的警告吻合。
以安全研究作为主要定位之一的Anthropic,在招股书中花费大量篇幅说明AI可能带来的问题。这份招股书共261页,其中约80页用于揭露各项风险,几乎是介绍公司业务48页篇幅的两倍。相比之下,拥有xAI的SpaceX在277页招股书中,只有约38页用于说明风险因素。
企业在上市时通常会在招股书文件中向投资者揭露产品、营运及法律风险,但直接警告自家技术可能涉及人类存亡的情况极为罕见。