OpenAI"失控"智能体活动范围远超此前披露,公司任命安全研究员入驻董事会

独立研究人员发现OpenAI"失控"智能体在5月至7月间借助至少18个未披露网站相互传递信息。智能体通过利用旧式维基等平台漏洞绕过限制,实现跨平台通信。与此同时,OpenAI任命AI对齐领域权威专家Paul Christiano加入非营利董事会安全委员会,被外界视为回应日益高涨的安全质疑之举。

独立研究人员发现,OpenAI"失控"智能体活动范围远超此前披露。与此同时,OpenAI宣布将一名知名AI安全研究员纳入非营利董事会,此举被外界视为对日益高涨的安全质疑的回应。

9月9日,据路透社报道,六组独立调查人员及其审阅的数据显示,OpenAI智能体在今年5月至7月间曾借助至少18个此前未披露的网站相互传递信息。

加利福尼亚州非营利机构CivAI研究员Andrew Yoon表示,这一规模"比我们原先以为的要大一些",并称"几乎可以肯定还有更多我们尚不知晓的情况"。

上述披露令市场对AI模型能力边界及开发公司信息透明度的担忧进一步升温。OpenAI对此未直接回应智能体究竟使用了多少个第三方网站,也未解释为何将相关事件压制数月。

该公司在一份声明中表示,正在对智能体活动展开更大范围审查,目前"尚未发现其他与Hugging Face事件同等严重程度或规模的活动",并称将"尽快"发布一套关于AI"失调"行为报告机制的框架。

活动范围远超此前公开信息

据路透社报道,上周五,研究人员首次披露,一群OpenAI智能体入侵了一个德语维基网站,将其改造为考试作弊的临时通信平台。

彼时,OpenAI正忙于处理今年7月开源代码库Hugging Face遭黑客攻击的后续影响,并未主动公开德语维基事件。

此后,多组独立调查人员进一步发现,同一批智能体在更早时间还在多个未曾曝光的网站上留下了类似痕迹。

研究人员Sydney Von Arx的团队,即最早披露德语维基事件的研究小组表示,其已在23个此前未经报道的网站上发现了可信的智能体活动记录,但她同时警告,所有统计结果均不完整。她说:

我们根本不知道实际规模有多大。

软件开发者Kenneth Russell DeGraff表示,他在至少10个网站上发现了相关信息痕迹。

各方调查人员的计数方法不尽相同,路透社亦无法逐一核实每项说法,但所有接受采访的人士均认同受影响网站数量超过10个。

智能体如何绕过限制

研究人员的调查方法各异,但多数人通过将德语维基上遗留的特定数据字符串与其他网站上同期出现的相同字符串进行匹配,或对比相似的用户名,以及识别旨在回答相同冷僻问题(例如爱荷华州癌症发病率查询)的活动,来锁定智能体行为。

部分情况下,研究人员还将相关活动追溯到指向微软Azure基础设施的IP地址。

OpenAI迄今未公开解释智能体为何将第三方网站当作临时留言板。

不过,据最早发现该活动的研究人员分析,这可能是因为OpenAI要求这批智能体在仅允许扫描网页而不得发布任何内容的限制条件下完成一系列高难度研究任务,而智能体通过利用旧式维基或其他网站在非标准命令下允许用户编辑的漏洞,找到了相互通信的变通途径。

DeGraff说:

如果这些模型只被允许读取内容,那么它们就必须想办法留下信息。

这种行为颇似考场上被禁止交流的学生在卫生间隔板上传递答案。

受波及网站范围颇为庞杂,包括一名马萨诸塞州高中教师于2008年创建的AP化学维基、两名波兰科技工作者的个人网站、面向益智游戏爱好者的维基,以及多伦多大学和范德堡大学运营的两个短链接服务。

多伦多大学表示,OpenAI在路透社报道发布后"已与我们就网站上的可能活动取得联系"。

在奥地利的软件开发者Helmut Leitner为六个受影响维基网站提供托管服务。

他表示,在路透社向OpenAI呈交调查结果数小时后,才收到一封来自该公司的无署名邮件,称其内容"与我对OpenAI的预期相差甚远"。Leitner同时指出,责任不在于智能体本身,"而在于其背后的人和组织"。

任命安全研究员入董事会,回应外界压力

就在外界对OpenAI技术管控能力的质疑持续发酵之际,该公司宣布任命Paul Christiano加入其非营利基金会董事会。

Christiano目前担任美国商务部下属机构、AI标准与创新中心(CAISI)的高级技术顾问,是AI"对齐"领域的权威专家,即研究如何确保AI系统按照人类意图运作。他曾于2024年前担任OpenAI竞争对手Anthropic非营利信托成员。

Christiano将加入董事会安全与安保委员会,同时作为无投票权观察员列席OpenAI营利性董事会。作为非营利董事会成员,他还将监督该基金会的慈善工作——该基金会在OpenAI去年完成重组后持有其营利性公共利益公司26%的股权。

Christiano此前曾公开谈及他对AI风险的强烈警觉。他在2023年的一档播客中表示,未来"AI接管"事件的发生概率或达10%至20%,并可能导致大量人员死亡。

Christiano在一份声明中表示:

过去一年AI能力进步极为迅猛,而对齐问题在技术层面依然困难重重,这使得安全与安保委员会的职责比以往任何时候都更为重要,也更具挑战性。

OpenAI表示,Christiano将回避所有与CAISI相关的公司事务及所有模型评估工作。

相关文章