Claude 加密弱点审计案例:Mythos 跑 60 小时说明了什么
Anthropic 研究用 Claude Mythos 找 HAWK 与弱化 AES 的数学缺陷,约 60 小时、估约 10 万美元 API。本文解读可复用的提示策略,以及普通开发者能学什么、学不会什么。

Simon Willison 在 2026-07-28 的链接博文里点出这项工作最有传播力的部分:不是“AI 又破了现实世界 AES”,而是研究者如何逼模型不要放弃。Claude Mythos Preview 前后工作约 60 小时,估计 API 成本约 10 万美元,找到 HAWK 与一个弱化版 AES 上的数学缺陷——原文也强调对当今实际部署系统没有直接打击面。对写代码的人,价值在方法,不在跟风宣称“本地也能挖出 CVE”。
结果边界先说清
- 目标包含学术向、弱化参数或特定构造,不是“一键砍穿网银”。
- 人类介入主要是方向校正与抗放弃,不是全程手算证明。
- 同步产物包括与高校合作的评测 CryptanalysisBench,用来衡量 LLM 做密码分析的能力,而不是替换专业密码学家。
把边界写进标题和导语,是避免新闻式夸张毁掉可信度——这也是 Bing/Google 质量评估里对 YMYL 边缘话题的基本要求。
提示策略:比“请找出漏洞”更关键
Willison 摘录的提示(含拼写错误)方向非常一致:
- 模型默认觉得“不可能”,所以不试——要明确要求继续挖。
- 不要降目标去捡低挂果实;要“值得发表”的难度。
- 不要改攻击目标来制造廉价胜利。
- 把模型定位成“顶尖研究者”,而不是“帮我写个扫描脚本”。
这和日常 coding agent 的反模式正好相反:日常我们常把任务改小好交差;密码分析实验却要防止模型自我降级。
普通开发者能迁移的三条
- 抗放弃指令写进流程:长任务中定期插入“不要降范围、不要改成功标准”。
- 成功标准外置:什么叫完成,写在文件里,避免模型用“已尝试”冒充“已证明”。
- 成本与时限显式化:60 小时 / 高额 API 是研究预算;产品排障应设
max步数与预算,参见 Gemini Managed Agents 的 token 封顶思路(另文)。
不要迁移的:在无隔离环境对生产密码体系乱挖;把研究新闻当成你已具备攻击能力。
和日常安全审计的距离
日常更划算的是:依赖扫描、密钥泄露检测、权限最小化、威胁建模。密码学硬问题仍需要专业评审。Agent 更适合做“辅助推理 + 文档化尝试路径”,不适合当未监督的红队。
若关心的是 agent 权限与仓库写入面,读 GitHub 权限安全审计 比追 Mythos 更贴近交付风险。
常见问题
我用普通 Claude Code 也能复现吗?
大概率不能按同成本同模型复现。Mythos Preview 与研究脚手架、评测集是专用设置;本地 Coding 助手默认目标也不是密码分析。
10 万美元是必须的吗?
这是该次研究量级的估计,不是行业标价。它提醒:开放式研究循环的 token 账单可以极端;工程任务必须设预算。
这对选型 Claude 还有意义吗?
有弱信号:长程研究型循环需要强推理与可干预的人类反馈。对 CRUD 业务开发,优先级仍是工作流、权限与成本控制。