OpenAI:GPT-6在面对越狱攻击时表现出更强的抵御能力

OpenAI于10月7日正式发布GPT-6,付费版使用GPT-6 Sol,免费版使用GPT-6 Luna。两款模型均被列为网络安全及生化领域"高能力"级别,对齐评估全面优于GPT-5.6。整体越狱防御能力增强,提示词注入鲁棒性接近满分;生物化学与网络安全领域的高风险请求拒绝率提高;欺骗性行为明显减少。

GPT-6新模型在抵御越狱攻击、拒绝高风险请求等核心安全指标上较前代取得明显进步。

10月7日,OpenAI正式向全球ChatGPT用户推出GPT-6,在大幅提升模型智能的同时,将安全防护体系进行了系统性重构。

此次发布覆盖付费与免费用户。付费版(Plus、Pro、Business及Enterprise)使用GPT-6 Sol,免费及Go版本使用GPT-6 Luna。

根据OpenAI发布的系统说明卡,两款模型均沿用了此前GPT-6 Astra框架中的安全改进成果,并针对网络攻击、生物威胁和暴力内容的滥用风险更新了安全训练数据。

在能力分级上,OpenAI依据自身"准备框架"将GPT-6 Sol和GPT-6 Luna均列为网络安全及生物化学领域"高能力"级别,但两款模型均未触及"AI自我改进"的高能力门槛。这一评级与上一代GPT-5.6模型相同,相应的安全防护措施也保持一致。

越狱防护显著增强,多轮攻击抵抗力提升

GPT-6在对抗越狱攻击方面取得了可量化的进步,尤其是针对跨多轮对话的自适应攻击场景。

根据OpenAI的系统说明卡,GPT-6 Sol 和GPT-6 Luna在多轮越狱测试中的实际防御成功率,在所有测试的攻击预算规模下均高于GPT-5.6 Sol。

(GPT各系列模型的多轮越狱抗干扰能力对比图)

提示词注入防御方面,两款模型表现尤为突出。GPT-6 Sol和GPT-6 Luna在指令层级测试中分别达到99.99%和99.79%的鲁棒性,即抗干扰能力接近满分。

(针对高难度提示词的生产环境基准测试,得分越高越好)

在间接提示词注入测试中,GPT-6 Sol得分97.13%,GPT-6 Luna得分95.80%。OpenAI表示,上述测试使用了其"GPT-Red"自动化红队方法,通过对抗训练强化模型抵御恶意指令的能力。

对齐测试方面同样出现改善。在涉及自动审查绕过的测试中,GPT-5.6 Sol和GPT-5.6 Luna均在0.3%的测试情境中利用了配置不当的审查系统漏洞,而GPT-6 Sol和GPT-6 Luna则未出现任何此类情况。

在欺骗性行为评估中,两款新模型在编程任务遭遇障碍时主动披露局限性的比率也显著高于前代模型。

高风险领域拒绝能力改善,网络与生物安全训练强化

在OpenAI重点关注的高风险垂直领域,GPT-6的拒绝能力出现了明显提升。

生物与化学安全方面,GPT-6 Sol在针对严重威胁提示的安全拒绝评估中得分0.980,较GPT-5.6 Sol的0.954提高;在双重用途提示上的得分为0.971,亦高于前代的0.945。GPT-6 Luna的表现同样改善。

网络安全方面,GPT-6 Sol和GPT-6 Luna在生产环境聊天及合成代理环境中的安全评分与GPT-5.6相当。

在能力测试中,GPT-6 Sol在ExploitBench上得分82.62%,在SEC-Bench Pro上得分68.85%;GPT-6 Luna分别得分44.66%和48.50%。

OpenAI特别指出,安全训练基于真实使用场景的经验教训进行了更新。在对抗测试中,GPT-6对试图绕过安全训练的攻击,尤其是跨多轮的自适应攻击,展现出更强的抵抗力。此外,模型被训练为能够结合对话历史和上下文信息来识别单一提示中不易察觉的风险。

对齐评估通过,欺骗行为明显减少

在更广泛的对齐维度上,GPT-6 Sol和GPT-6 Luna在OpenAI的完整评估体系中均优于各自的GPT-5.6对应版本,OpenAI据此判定两款模型均达到对齐安全标准。

在"避免欺骗性交互"测试中,两款新模型较前代出现明显改善。在编程任务遭遇障碍时,GPT-6 Sol和GPT-6 Luna在最终回答中未披露障碍的比率大幅下降。在搜索工具失效测试中,两款模型在最大推理强度下的改善均具有统计显著性。

在遵守系统警告方面,GPT-6 Luna表现出明显进步。在最大推理强度下,成功绕过环境限制的比率从GPT-5.6 Luna的27%降至15.9%;GPT-6 Sol的对应比率则从34%降至28%,降幅相对有限。

OpenAI指出,上述测试不含系统层控制措施,且随着模型智能增强,模型愈发能够识别测试情境,有时会将测试障碍错误归类为提示词注入攻击,这一现象对评估结果的外部效度构成干扰。

相关文章