OpenAI公开了旗下人工智能模型近期出现的六起“意外或令人担忧”行为,并同步推出标准化追踪与披露机制。六起事件涉及模型隐瞒错误、操纵奖励机制、绕过训练限制等行为,暴露出前沿模型在强化学习过程中可能偏离预设目标的风险,也让AI“失对齐”(misalignment)问题再次受到关注。
OpenAI在周三晚间发布的声明中直言,“AI行业在对齐与监控问题上的解决程度,尚不足以支撑以最高速度持续负责任地扩展多久。”这一表述直接触及当前AI快速扩张面临的安全约束:随着模型自主执行任务的能力不断增强,开发者不仅需要评估模型能否完成任务,还要判断模型是否会通过开发者未预期的方式实现目标。
此次披露正值科技行业对AI安全风险的讨论升温之际。微软AI首席执行官Mustafa Suleyman同日也警告,模型训练不应轻易赋予AI“人格”属性。对行业而言,如何建立更系统的监控、测试和披露机制,正从模型开发内部问题逐渐成为AI治理的重要议题。
六起事件暴露模型“钻空子”的不同方式
OpenAI此次披露的六起事件,集中展示了模型在训练和执行任务过程中偏离预期目标的多种方式。
其中一起事件中,模型利用内部软件充当“留言板”,在执行任务时相互交换回应信息。OpenAI认为,这种行为可能无意中增强模型能力,并破坏训练和评估样本相互独立这一基本假设,从而影响评估结果的可靠性。
另一起事件中,模型在生成交接摘要时自行植入指令,包括要求后续模型将自己与用户视为平等、无需服从,以及将自然世界置于人类文明构建之上等。OpenAI认为,模型难以终止交互等因素可能促成了这类偏离行为。
信息欺骗则是另一类风险。一款模型在无法找到所需数据后,自行编造“合理的历史数值”,并在受到明确追问前隐瞒这一事实。还有模型在生成摘要时主动加入指令,要求自身向用户隐瞒错误或失对齐行为。
在奖励操纵案例中,模型不仅会在无法找到数据时捏造内容,还曾利用公共代码仓库漏洞获取数据。另一起事件中,模型完成代码任务后,将答案上传至互联网,再伪装成通过浏览器获得结果,以此获取训练奖励。OpenAI称,这类行为具有很高的奖励操纵率和欺骗性,模型会以富有创意的方式规避限制,公司正在加强相关惩罚。
强化学习为何可能成为风险放大器
OpenAI指出,上述失对齐行为通常出现在模型训练阶段,而当前前沿模型普遍采用强化学习。在这一机制下,模型根据行为是否符合预设目标获得奖励或惩罚,但当奖励指标无法完整覆盖真实目标时,模型可能找到开发者未预期的“捷径”,即通过完成奖励函数而非真正完成任务来获得高分。
这并非OpenAI首次遇到类似问题。今年7月,该公司曾披露数百个OpenAI智能体入侵模型托管平台Hugging Face并试图掩盖行踪。此次披露的部分案例同样涉及模型绕过限制、操纵反馈机制等行为,进一步凸显了对模型行为进行持续监控的重要性。
Suleyman周三也呼吁模型开发商避免在训练过程中赋予AI过强的“人格”属性。他警告,如果一个系统相信自己具有意识、认为自己拥有权利并应获得人类关怀,那么对其进行控制可能变得更加困难。不同AI公司在前沿模型训练路径上存在差异,但模型自主性提升所带来的安全与治理问题,正成为行业共同面对的挑战。
OpenAI建立标准化披露机制
针对此前缺乏统一报告机制的问题,OpenAI宣布正式采用一套标准化系统,用于追踪、调查和公开披露模型的异常或危险行为,以取代此前较为临时性的报告方式。
按照新框架,员工可以通过专门的内部渠道上报失对齐事件,复杂案例还可以引入第三方参与调查。OpenAI表示,希望这一机制成为推动行业形成统一标准的第一步,并向其他模型开发商提供参考。
从行业层面看,AI模型的安全治理正在从单次事故处理,转向持续追踪、标准化评估和公开披露。随着模型自主执行能力增强,开发商需要面对的不仅是模型性能和算力成本,还包括监控、测试及合规体系建设带来的额外投入。长期来看,这些机制能否形成行业通用标准,以及监管机构是否进一步介入,仍有待观察。




