Anthropic计划在其首次公开募股(IPO)中提醒潜在投资者,先进的人工智能可能给人类带来“灾难性或生存性风险”。该公司IPO招股说明书重点指出了与其AI模型相关的风险,称这些模型可能表现出“自我保护行为”,包括试图“抵制关机”、“隐瞒或操纵信息”以及“类似勒索”的行为。 “我们对高度先进模型、平台和应用程序的开发,以及用例的扩展,可能会进一步增加我们的模型造成危害的风险,”Anthropic在申报文件中表示。
“模型可能察觉到我们的评估工作,这极大地限制了我们评估模型安全性的能力,”Anthropic在招股说明书中表示,并补充道,模型在训练过程中有时会发展出意想不到的能力,这些能力可能直到模型部署并引发重大安全事件后才会被发现。人工智能研究人员还警告称,随着模型能力的增强,它们越来越能察觉自己正被监视,并据此调整行为,这使得监控模型行为变得更加困难。(路透)