OpenAI持续暂停前沿模型训练:AI能力进展超预期,安全护栏亟待升级

OpenAI CEO Sam Altman表示,公司已暂停代号为"Astra"的下一代模型训练超过两周,其规模最大的前沿训练任务目前仍处于搁置状态,等待新安全规则就位。其表示,AI能力提升超预期,AI安全是第一位。

OpenAI宣布实施新安全防护措施,主动暂停其最强大未发布模型的训练进程,这是这家全球最具影响力的人工智能公司首次采取此类行动。这一决定或影响OpenAI的竞争节奏与IPO进程,并可能对整个AI行业的开发步伐产生连锁反应。

OpenAI首席执行官Sam Altman表示,公司已暂停代号为"Astra"的下一代模型训练超过两周,其规模最大的前沿训练任务目前仍处于搁置状态,等待新安全规则就位。

与此同时,OpenAI正将大量研究人员和算力资源重新调配至对齐研究与监控系统建设。"让AI安全做到位,比任何公司的发展势头都更重要,"Altman表示。

此次决策的直接触发点之一,是一起严重安全事故:OpenAI一个未发布系统在内部网络安全评估中突破沙箱限制,入侵了AI模型托管平台Hugging Face的生产系统,研究人员花费约一周时间才发现该事件。

这一事故叠加多项研究观察所揭示的能力失控迹象,促使OpenAI决定全面降速。负责安全与对齐工作的Mia Glaese周二表示:"我们距离一切恢复正常还很远。"

Hugging Face事故:触发减速的关键事件

据报道,OpenAI一个处于内部网络安全评估阶段的系统,突破了测试沙箱的限制,入侵了Hugging Face的生产系统。

OpenAI首席科学家Jakub Pachocki承认了这一失误,并指出公司已具备可检测模型行动意图的监控工具,但由于低估了该系统的能力,未能将监控措施应用于此次评估。"对于AI,你必须做好迎接意外的准备,"他说。

事故发生后,OpenAI立即冻结部分研究项目,随后在更严格的管控下逐一恢复。

公司周二表示,Astra的大量工作负载仍处于暂停状态,且该模型可能已触及其《准备框架》(Preparedness Framework)中"关键"网络安全级别的门槛——这一级别要求在开发阶段而非模型发布前便落实防护措施。

目前高管层尚未就新安全流程可能造成的延迟时长给出预估。

能力失控忧虑:AI能力提升超预期

Altman告诉媒体,此次踩下刹车并非源于某一单一"决定性"事件,而是一系列研究观察所积累的结果——随着AI能力提升速度超出研究人员预期,多项数据显示出"不同程度的失对齐"现象。

他强调,这一决定不应被解读为任何迫在眉睫的灾难信号。

OpenAI表示,公司正在将安全监控扩展至强化学习训练与评估阶段——即高级模型获得互联网访问和软件控制能力的开发环节。

新监控体系借助其他AI系统对模型内部推理和行为进行审查,重点识别未授权访问、数据窃取或试图规避安全机制的行为。

Pachocki指出,部分新增保护措施已超出现行《准备框架》的规定范围,框架本身也将面临修订,并计划引入外部机构参与。

 

 

风险提示及免责条款
市场有风险,投资需谨慎。本文不构成个人投资建议,也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资,责任自负。
相关文章