国际AI安全基准测试平台CyberGym发布最新榜单,复旦大学团队研发的白泽智能体Whitzard以91.2%的真实漏洞攻防成功率位列全球第二、高校第一,超过Anthropic面向网络安全打造的前沿模型Claude Mythos,以及微软、Google旗下Wiz等国际头部团队。该测试覆盖188个大型开源项目的1507个真实漏洞,要求智能体在完整代码库中自主完成漏洞定位、攻击构造和验证。
该团队采用自主研发的模块化框架,仅调用单个基础模型,通过将程序运行中的路径可达性等转化为推理约束,实现精准收敛。全量测试中,模型调用总成本不足5000元人民币。此前该智能体曾取得68.9%的成绩,经对推理机制和验证环节迭代优化,最新版本成功攻克1374个漏洞。相关智能体框架和评测基准已开源。(央视新闻)
风险提示及免责条款
市场有风险,投资需谨慎。本文不构成个人投资建议,也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资,责任自负。