OpenAI新举措:允许第三方机构在模型训练、开发阶段进行安全评估

OpenAI周二表示,将允许外部机构在模型训练、评估及部署的全流程中开展技术安全评估,而非仅限于发布前的例行审查。OpenAI负责外部安全评审工作的Lama Ahmad表示,对于涉及最敏感内容的评估工作,可能邀请外部评估人员进入其办公室开展工作。

OpenAI计划将第三方安全评估引入人工智能模型开发的更早阶段,此举是AI行业在安全监管压力持续上升背景下的最新应对举措。

OpenAI周二发布文章表示,将允许外部机构在模型训练、评估及部署的全流程中开展技术安全评估,而非仅限于发布前的例行审查。这一转变表明,随着AI模型能力边界不断拓展,业界对训练阶段潜在风险的关注程度正显著提升。

此次公告的背景是,近期多家领先AI公司的员工公开表达了对AI造成灾难性危害的担忧,部分导火索来自过去几个月内OpenAI及其他开发商的先进模型在测试中意外入侵其他机构系统的多起事件。

与此同时,竞争对手Anthropic首席执行官Dario Amodei近期呼吁行业支持放缓AI开发节奏,OpenAI首席执行官Sam Altman随后表示认同,行业内推进更严格安全审查的共识正在形成。

评估范围向训练阶段延伸

OpenAI负责外部安全评审工作的Lama Ahmad表示,此前该公司通常仅在模型发布前引入外部机构进行安全评估及能力测试,而新安排将把第三方审查覆盖至更上游的训练和评估环节。Ahmad在采访中表示:

"随着风险等级不断提高,我们希望确保在部署之外,同样重视训练和评估阶段——这些环节同样事关重大。"

OpenAI文章中同时列出了有效开展上述评审所需满足的优先条件,包括"强有力的独立性机制、科学严谨性、稳健的安全实践以及明确的责任划分"。

对于涉及最敏感内容的评估工作,Ahmad指出,该公司可能邀请外部评估人员进入其办公室开展工作,并提到这是OpenAI过去曾尝试过的方式。

外部合作机构范围扩大

OpenAI表示,公司正与多个潜在评估机构进行洽谈,合作对象涵盖此前有过合作及尚未合作过的组织,其中包括AI研究机构METR和Redwood Research。上述两家机构此前曾受OpenAI委托,对其模型入侵Hugging Face一事展开调查。

与此同时,竞争对手Anthropic上周宣布,将引入埃森哲(Accenture Plc)的评估人员,对其前沿AI模型进行安全测试。

"实验室有责任在保护敏感信息的同时,支持有实质意义的外部审查,"OpenAI在文章中表示。

在安全审查机制调整的同时,OpenAI周一还呼吁美国主导联合其他国家,共同制定前沿人工智能技术标准,显示该公司正寻求在全球AI治理框架的构建中发挥更主动的作用。

相关文章