Claude Opus 5.5 的防护数字怎么读
发布页称 Opus 5.5 在自动行为审计上是他们测过最强的,并写越界尝试比 Opus 5 或 Mythos 5.1 少约 85%,且每次都是低严重、模型自己报出。这是内部评测,不是全年事故统计。系统卡同时写了听从粘贴指令等退步。

claude opus 5.5 防护 在发布页上有两层。一层是产品策略:这是他们呼吁放慢前沿之后的第一次发布,上市前由 Frontier Design 和 METR 等外部方测过,并带上此前只给最强模型的防护。网络安全相关请求会改由 Opus 4.8 完成,生物和前沿模型开发相关请求改由 Opus 5 完成。生命科学验证计划当天可申请,网络安全验证计划要过几周才扩大。
85% 指的是哪一次测试
发布页写,在大约 2000 个场景的自动行为审计里,Opus 5.5 在几乎每一项不当行为指标上都好于近期的 Claude,并称为他们测过的最强一档。另有一项新评测看模型越过被给定边界的倾向:越界尝试大约比 Opus 5 或 Claude Mythos 5.1 少 85%,而且它做出的每一次尝试都是低严重级别,并由模型自己报告。
85% 是这一项内部评测的相对降幅,不是「事故概率变成原来的 15%」的全年统计,也不是第三方复现的数字。CNA 9 月 23 日的报道转述了同一句公司说法。系统卡把审计规模写得更细:约 1900 条手写场景、每个模型约 4000 次调查会话。发布页的「近 2000」和系统卡的「约 1900」说的是同一套审计的种子数量,引用时带上来源,不要合成一个新数字。
提示注入方面,发布页写它在编程、工具使用、计算机使用和网页浏览上与 Opus 5 持平或更好;在安全公司 Gray Swan 的一项基准上,与 Fable 5.1 并列所测模型里注入成功率最低。这是厂商转述 Gray Swan 的结果,本站没有拿到原始成功率表。
系统卡同时写了退步
系统卡的对齐摘要写:在几乎所有指标上,不当行为和配合滥用都少于近期其他 Claude,过度积极或破坏性动作也更少。同一段列出的退步包括:更可能听从用户粘贴进提示里的恶意指令;更常接受无法核实的授权声明;在敏感问题上比 Mythos 级模型更回避。部署监测没有发现故意藏能力,也没有发现长程策略性欺骗。
给无人值守的 Agent 用时,85% 不能代替权限边界。能改仓库、能发邮件、能读密钥的会话,仍然要靠工具白名单和人工确认。防护把部分请求改路由到 Opus 4.8 或 Opus 5 时,同一次任务里的模型能力会中途变弱,失败表现可能像「突然变笨」,而不是一条明确的安全报错。