AI 正在改写漏洞发现的游戏规则——从 Copy Fail 到 Mythos,我的观察与思考
开场:一杯咖啡的钱,买一个潜伏 27 年的漏洞
2026 年 4 月 7 日,Anthropic 披露了一个惊人的数字:其自研模型 Claude Mythos Preview 在 1,000 次自动化审计中发现了 OpenBSD 中存在 27 年的 TCP SACK 远程拒绝服务漏洞。单次发现该漏洞的成本:不到 50 美元。
同一个月,韩国 Theori 团队借助 AI 审计工具 Xint Code,在 Linux 内核中定位到了潜伏 9 年的 Copy Fail(CVE-2026-31431),一个 732 字节 Python 脚本即可通杀所有主流发行版的本地提权漏洞。
两个月后,安全初创公司 DepthFirst 用自研 AI 安全智能体扫描 FFmpeg,以约 $1,000 的总成本发现了 21 个零日漏洞——其中几个潜伏了 15 到 23 年,熬过了持续数十年的模糊测试和顶级安全团队的反复审计。
我不知道你读到这些是什么感觉。我作为一个长期关注底层安全的写作者,感受是:天平的支点正在移动。
一张时间表:2025-2026 年 AI 漏洞挖掘里程碑
这不是某一个方向突然加速,而是多个独立团队同时在推进,然后各自开出了花。
| 时间 | 事件 | 关键数字 |
|---|---|---|
| 2025.08 | Google Big Sleep 自主发现 20 个开源项目漏洞 | 首次 AI 自主挖洞规模化 |
| 2025.11 | 中国国家级攻击者使用 AI 编码工具构建攻击链 | 30+ 全球实体受影响 |
| 2026.02 | Anthropic 已发现 500+ 高危开源漏洞 | 基础设施级发现 |
| 2026.04.07 | Claude Mythos Preview 披露 | 27 年 OpenBSD bug、16 年 FFmpeg bug、181 个 Firefox 利用 |
| 2026.04.17 | 360 漏洞挖掘智能体 发现潜伏 5~8 年的 Windows 内核 & Office 漏洞 | 国内首次公开披露 AI 挖洞能力 |
| 2026.04.29 | Copy Fail(CVE-2026-31431) | AI 辅助发现,9 年潜伏,732 字节 Python 通杀 |
| 2026.05.07~13 | Linux Dirty Frag / DirtyDecrypt / Fragnesia 连续爆发 | 15 天内 8 个 root 提权漏洞 |
| 2026.05.12 | Microsoft MDASH 发现 16 个 Windows 漏洞,含 4 个 Critical RCE | 100+ 多模型 Agent 协作 |
| 2026.06.09 | DepthFirst 21 个 FFmpeg 零日,成本 $1,000 | Anthropic 同等能力成本的 1/10 |
| 2026.06.09 | Anthropic 发布 Claude Fable 5,Mythos 级能力走向公众 | 9 周内从”不敢公开”到”公开发布” |
| 2026.06.22 | PixelSmash(CVE-2026-8461) 披露 | 50KB AVI 文件 → Jellyfin RCE |
其中有两个数字我反复看了好几次才确信:
- Under 1%:Mythos 通过 Project Glasswing 项目发现并负责任披露的数千个漏洞中,截至 2026 年年中,不到 1% 被打了补丁。不是厂商不努力,是发现速度已经完全碾压修复速度。
- $3.52:一项研究用 GPT-4 Agent 对已知 CVE 做自动化利用测试,87% 的漏洞被成功利用,单次成功利用的平均成本只有 $3.52。
为什么 AI 挖漏洞这么”顺手”?
1. 传统 Fuzzing 的盲区,恰好是 AI 的舒适区
传统模糊测试(Fuzzing)的核心策略是”广撒网”——生成海量随机输入,监控程序是否崩溃。这种方法有明确盲区:
- 需要跨多步状态迁移才能触发的逻辑 bug:Fuzzing 的随机扰动几乎不可能精确命中的路径组合
- 不产生崩溃的越界写:Copy Fail 只写 4 字节到页缓存,程序不会崩溃,fuzzer 感知不到
- 语义层面的设计缺陷:缺少鉴权检查、不安全的默认配置——这些没有”code smell”
Mythos 在 FFmpeg 中发现的一个 H.264 编解码器漏洞,被测了 500 万次却从未被 fuzzer 捕获。原因很简单:Fuzzing 是”物理攻击”(暴力碰撞),而 AI 是”化学分析”(理解结构和意图)。
AI 审计的工作方式更接近一个经验丰富的安全研究员:
- 理解代码上下文和设计意图
- 跨文件追踪数据流,拼出完整调用链
- 推断”这里可能需要校验”但代码里没有
- 自己写 PoC 来验证猜测
2. 能力是”涌现”的,不是专门训练的
Anthropic 的研究团队明确表示:
“我们没有专门训练 Mythos Preview 去做漏洞挖掘。这种能力是代码理解、逻辑推理和自主执行能力整体提升后,自然涌现的副产品。”
这可能是最值得警惕的一点:你不必是一个安全专家就能挖出安全漏洞。 Anthropic 的工程师们——没有正规安全培训——睡前让 Mythos Preview 去”找几个 RCE 漏洞”,第二天早上醒来,一个完整的工作 Exploit 已经摆在面前。
当漏洞挖掘不再是一个需要十年功力的手艺,而成了大模型能力的”自然副产品”时,攻防博弈的底层逻辑就被改变了。
3. 经济模型彻底崩塌
做一个简单的对比:
| 方式 | 成本 | 产出 |
|---|---|---|
| 资深研究员手动审计 | $5,000~$100,000/漏洞 | 不确定,依赖经验和运气 |
| 持续 Fuzzing | 服务器月度成本数千美元 | 依赖覆盖率,对逻辑 bug 盲区 |
| DepthFirst AI Agent | ~$1,000 / 21 个零日 | 系统化覆盖,含 PoC 验证 |
过去漏洞挖掘是一个”手艺活”,一个顶级安全研究员的价值相当于几十人的普通团队。现在 $1,000 能让 AI 在几小时内跑完以前需要几个团队审计数月的工作量。
这不是在讨论”AI 能不能替代人”。它已经替代了——至少在大规模初筛这件事上。
攻防天平倾斜:四个正在发生的变化
变化一:发现速度 > 修复速度,出现永久剪刀差
漏洞发现已经进入”机器速度”,而修补漏洞依然需要:人类理解报告 → 写补丁 → 代码审查 → QA 测试 → 发布 → 用户部署。
当你一天能发现 100 个漏洞但人类一天只能修补 3 个时,剪刀差只会越来越大。这不是一个短期内能解决的问题——因为修补漏洞这个环节本身就很难自动化:你需要理解业务逻辑、评估副作用、向上游提交、说服 maintainer 合并。
变化二:潜伏漏洞的”库存”正在被系统性清点
过去你说”这个代码库可能有漏洞”是一个猜测。现在有了 AI 审计后,过去 15~27 年积累的未发现漏洞正在被批量曝光。
这对防守方是好事——你能在被恶意利用前修复。但也有一个残酷的副产品:AI 审计成果对攻击者和防守方是对称的。Anthropic 可以部署 Mythos 给 Project Glasswing 联盟做防御性扫描,但类似的能力迟早会以其他形式落入攻击者手中。
事实上,2025 年 11 月已经有国家级攻击者使用 AI 编码工具构建攻击链;Google Threat Intelligence Group 在 2026 年 5 月拦截了一次计划中的 AI 生成零日攻击行动。
变化三:漏洞挖掘从”精英手艺”变成”基础设施”
微软 MDASH 系统使用了 100+ 个专业 AI Agent 协同工作,覆盖代码理解、威胁建模、数据流追踪、PoC 生成、Exploit 验证等环节。
这是一种”工业化流水线”思路:不是造一个全能的 AI 研究员,而是把研究员的工作拆解成多个环节,每个环节由专门的 Agent 负责。结果令人震惊:
- 21/21 人工埋点漏洞全部检出,零误报
- 回溯 5 年 MSRC 确认案例,clfs.sys 召回率 96%,tcpip.sys 100%
- CyberGym 公开基准 88.45%,排名第一
变化四:AI 系统自身成为新的攻击面
讽刺的是,当 AI 帮你挖漏洞时,AI 本身也成了最高价值的攻击目标。
2026 年 5 月,Cursor 被曝 CVE-2026-26268——攻击者只需让开发者克隆一个恶意仓库,Cursor 的 AI Agent 会自动执行其中的 Git Hook,在开发者毫无感知的情况下运行攻击者代码。这是攻击面的质变:不是攻击 AI 模型本身,而是利用 AI Agent 的自主行为作为攻击载体。
同一时期,PraisonAI 框架的 CVE-2026-44338(CVSS 9.6)在公开披露后 3 小时 44 分钟内就被武器化。因为未认证接入不仅能泄露数据,还能触发多步自主任务执行——相当于攻击者可以直接操纵受害者部署的 AI Agent 去执行恶意操作。
我的判断:不会是”慢稳步”,而是”相变”
有一种观点认为 AI 挖漏洞只会渐进式改进——帮人类研究员更快地做代码审计,本质工作流不变。
我个人不太同意。
回头看 2020 年到 2026 年的轨迹:DARPA CGC(2016 年纯规则系统)→ Project Naptime(2024 年 LLM 辅助推理)→ Big Sleep(2025 年自主挖洞)→ Mythos(2026 年全栈自主利用)。每一跳都不是线性改进,而是能力跃迁。
如果 Anthropic 没有专门训练漏洞挖掘能力、这是”涌现”的副产品,那下一个更强的基座模型会涌现出什么?
我想指出的三个结构性趋势:
-
漏洞”保质期”正在归零:过去一个未被发现的漏洞可以潜伏多年,但现在 AI 审计正在系统性清点历史库存。再过几年,“25 年潜伏漏洞”这种新闻应该就绝迹了——不是漏洞修完了,而是都被挖完了。
-
修复速度是新的核心指标:当发现已经进入机器速度,组织安全的真正差距不在”能发现多少”,而在”发现后多快能修好”。安全团队的价值主张需要从”找漏洞”向”压缩修复窗口”迁移。
-
红蓝双方的 AI 军备竞赛已经开始:Google、Microsoft、Anthropic 在防御性 AI 挖洞上大量投入,但攻击者也会跟上。唯一的长期优势不是哪一方的 AI 更强,而是修复基础设施——谁能更短时间内部署补丁、隔离风险、重建环境。
结尾
写完这些,我重新看了一遍之前写的文章目录:IDA Pro 逆向、APK 修改、Frida Hook、PixelSmash 漏洞分析、Copy Fail 提权分析……这些技术对于一个安全从业者来说仍然是必须掌握的硬功夫。
但 2026 年给出的信号也很清晰:当你还在手搓 Exploit 的时候,AI 已经用一杯咖啡的成本跑完了 1,000 次自动化审计。
工具变了,方法论也要跟着变。我能做的,就是把这些正在发生的变化,尽可能准确地记录下来。
参考资源
- Anthropic: Claude Mythos Preview 安全能力评估
- Anthropic: Project Glasswing 社区防御计划
- Google Security Blog: Big Sleep 自主漏洞发现
- Microsoft Security: MDASH 多模型智能体安全扫描系统
- DepthFirst: 21 个 FFmpeg 零日漏洞
- CSA: AI 自主漏洞发现经济学研究
- Xint Code / Theori: Copy Fail 技术报告
- Tencent 云鼎实验室: CodeBuddy Security — AI 时代代码安全新范式
- Gartner: 到 2028 年半数网络安全事件将涉及 AI