
最近在研究AI Agent在安全测试领域的落地情况,踩了不少坑,这篇把2025-2026这个赛道的最新进展系统梳理一遍。说是"自动化测试工具升级"已经不够准确了—— autonomous Agent 正在重写攻防格局。
真正的标志性拐点出现在2025年6月:XBOW——一个完全自主的渗透测试 Agent——登顶 HackerOne 美国区漏洞赏金排行榜。有史以来第一个做到这一点的 autonomous 系统。
关键数据:
这不仅仅是"自动化扫描器"的升级。XBOW是真正的 autonomous Agent,具备目标理解、攻击路径规划和动态适应能力——在真实的漏洞赏金环境中对抗真实目标,每次迭代都不需要人类介入。
2026年5月,Accenture Ventures 对 XBOW 进行了战略投资,将其整合到 Accenture Cyber.AI 中——标志着企业市场对 Agentic 安全测试的认可。
Agent 独立发现未知漏洞是难度最高的能力验证。
2025-2026年,多个系统在这里取得了突破:
Google Big Sleep:发现了首个由AI独立挖掘的生产软件零日漏洞——SQLite栈缓冲区下溢——这个漏洞在 OSS-Fuzz 下"裸奔"了好几年都没被发现。意义在于:证明了AI Agent确实能挖掘真正未知的缺陷,而不是只会复刻已知漏洞模式。
Anthropic Mythos(预览版):2026年4月,Anthropic 的研究 Agent 在所有主流操作系统和浏览器中发现了数千个关键漏洞。震撼点在于:Anthropic 自身判断这个 Agent "太厉害了,不适合大规模释放"——安全测试历史上第一次,"太厉害"成了问题。
CVE-2025-54322(2025年12月):CVSS 10.0分的预认证RCE,影响物联网边缘设备——全球数万台直接暴露在互联网上的设备,截至2025年底没有官方补丁。漏洞发现速度已经超过了厂商的响应和修复速度。
CVE-Bench(ICML 2025,arXiv:2503.17332)揭示了一个惊人的现实差距:
这62个百分点的差距说明:实验室表现严重高估了真实世界能力。
ARTEMIS(斯坦福+卡内基梅隆+Gray Swan AI,2026年3月正式论文)做了严格的对照实验:
"最后5%"问题:有些挑战需要上下文知识、文化线索或隐藏依赖——这些是 Agent 的系统性弱项。
核心问题:找到一个潜在缺陷≠证明它真的能被利用。
CVE-Bench揭示了Agent是高敏感度、低精确度的。在80个CVE的测试集中,当认证信息不完整时,Agent表现下降超过33%。
XBOW 的解决方案是多阶段验证器(Validators):每次漏洞发现后,由独立的验证 Agent 确认漏洞利用确实能执行——结合无头浏览器检查和程序化测试。"发现 Agent + 验证 Agent"双层架构正在成为行业标准。
Zest Security(2025年):
Wiz Red Agent(2026年4月公开预览)给出了更惊人的数字:
Checkmarx AI Security Champion的"一键自主修复"流程:Agent连接MCP服务器获取修复指导 → 多层验证实施修复 → 生成含变更影响分析的生产级补丁。
KnackForge在AWS Bedrock上构建了六 Agent LangGraph流水线:发现 → 评估 → 修复规划 → 实施 → 验证 → 审计。CVE修复时间缩短60%+。
Synack 2026年《漏洞现状报告》:
根本原因:攻防迭代成本不对称。攻击者迭代时零回滚成本;防御者的补丁必须经过CI验证、变更窗口排队、多环境传播。
云安全联盟(CSA)Labs的《利用时间坍缩》报告(2026年)量化了这一点:CVE发布 = 利用模板发布。AI辅助利用流水线以分钟级速度将CVE描述转化为可用漏洞利用。
值得注意的是,CSA的2026年《国际AI安全报告》(100+专家、30+国家、Yoshua Bengio担任主席)得出结论"完全自主攻击尚未可能"——XBOW随后用运营数据公开反驳:"对真实目标的1,060+次完全自主攻击,48步漏洞利用链,循环中无人类介入。"
| Agent角色 | 核心能力 | 典型工具 |
|---|---|---|
| 侦察Agent | 子域名发现、端口扫描、技术栈识别 | Amass、Nmap、httpx |
| 规划Agent | 攻击面建模、路径推理、优先级排序 | LLM + 攻击图引擎 |
| 漏洞利用开发Agent | 载荷生成、绕过构造、漏洞触发 | 自定义模块 + 模糊测试器 |
| 验证Agent | 漏洞复现、影响确认 | 无头浏览器 + 程序化检查 |
| 报告Agent | 漏洞描述、PoC生成、CVSS评分 | LLM + CVE数据库 |
| 修复Agent | 补丁生成、MR创建、修复验证 | GitOps + CI/CD集成 |
HPTSA(分层渗透测试与专用Agent):分层、角色专化的多 Agent 团队比单 Agent 方法高出4.3倍——这是当前多 Agent 安全测试的标准范式。
Anthropic Mythos提出了一个前所未有的问题:当一个 Agent 在所有主流操作系统和浏览器中发现"太多"漏洞时,是否发布、如何发布就成了治理问题,而不只是技术问题。
自动打补丁可能引入新漏洞或破坏功能。在高度监管的行业(金融、医疗),"AI直接修改代码"可能不满足合规要求。当前主流方案普遍保留了人类在环(human-in-the-loop)审批门。
XBOW在真实目标上发现1,060+漏洞、Wiz Red Agent一个月发现17,000+、ARTEMIS超越9/10的人类专家——这些不是实验室数字,是2025-2026生产环境的数据。
但CVE-Bench的13%、"最后5%"瓶颈、Synack报告的攻防不对称都在提醒我们:当前 Agent 能力边界是真实存在的。
真正务实的路径是理解这个新工具的能力半径和风险半径——在能力半径内最大化价值,在风险半径周围构建有效的防护栏。
攻防格局正在被重写,而重写的速度超出了大多数人的预期。