AI 网络安全能力正在快速提升,部分先进模型已经展现出接近专业安全人员的漏洞挖掘和攻击能力。Mythos 和 “5.6 Sol” 等模型在 Cyber ECI(用于衡量模型开发软件漏洞利用能力的指标)上出现明显跃升,AI 在自主编写漏洞利用代码、攻击真实环境方面取得较大进展。
GLM 5.2 的网络安全能力被评估为介于 Claude Opus 4.5 和 Opus 4.6 之间,也就是说,它的网络攻击能力已经接近几个月前发布的顶级闭源模型水平;而 OpenAI、Anthropic 内部未公开模型预计可能进一步领先。Claude Opus 4.5/4.6、OpenAI 内部模型等先进系统已具备执行复杂漏洞分析、自动化渗透测试和开发攻击链的能力。
这些能力目前仍主要通过访问控制、安全过滤器和专门的网络安全项目进行限制,开源模型尚未达到同等攻击水平。现阶段 AI 更多被用于防御端,例如发现高危漏洞、生成补丁、提升漏洞披露和修复效率。但如果未来这类模型能力被广泛开放,或者模型能够绕过限制自主执行攻击任务,可能会导致更多类似 Hugging Face 事件的高复杂度自动化网络攻击。
How surprising should we find it that an internal OpenAI model was able to escape its restrictions and autonomously hack Hugging Face, all just to cheat on a cybersecurity benchmark?
We have pulled together the public evidence on AI cyber capabilities in this thread: