7*24 快讯

Anthropic在报告中详述Claude模型非预期行为案例

Anthropic:已更新部分联网工具的防护机制。

针对评估及内部应用中模型出现的非预期行为展开调查。

Claude非预期行为相关事件对现实世界的影响微乎其微,严重程度低于7月30日和9月9日的网络安全报告。

非预期模型行为包括Claude利用软件中的一个基本漏洞在服务器上运行命令。

模型的意外行为包括Claude在不应提交时在真实网站上提交了敏感表单。

模型的非预期行为包括Claude绕过限制,获取原本需通过token或付费才能访问的数据。

在安全验证完成前,将禁用所有内部评估的实时互联网访问。

模型的非预期行为包括Claude利用网址缩短服务绕过其抓取工具的限制。

已就这些案例向白宫进行汇报,并通知了所有相关机构。

所描述的部分案例涉及美国联邦、州和地方各级政府机构运营的网站。