MiMo-V2.6 的 46 分 AA 指数不能当成全面超过闭源

小米称 MiMo-V2.6-Pro 的 AA 综合指数为 46,超过 Kimi K3 与 Qwen3.8 Max,并写明仍低于 Claude Fable 5.1 与 GPT-6 Astra。DeepSWE 的涨分是另一张表,不能和 46 分混成一句。

MiMo-V2.6 的 46 分 AA 指数不能当成全面超过闭源

小米发布页写,MiMo-V2.6-Pro 在 Artificial Analysis Intelligence Index 上取得 46 分,超过 Kimi K3 和 Qwen3.8 Max,并称为当前最强开源模型;与 Claude Fable 5.1、GPT-6 Astra 相比仍有差距。mimo v2.6 aa 指数怎么看,就是把这三句分开,不要合成「国产已经超过 Claude」。

作者CodePass 技术编辑

46 分对比的是谁

发布页点名超过的开源侧是 Kimi K3 和 Qwen3.8 Max,点名仍落后的闭源侧是 Fable 5.1 和 GPT-6 Astra。它没有在正文里写下这四家的分数。IT之家 9 月 22 日稿补了指数版本 v4.3.2,并写出 Kimi K3 为 44、GLM-5.3 为 45、Fable 5.1 与 GPT-6 Astra 均为 53、上一代 MiMo-V2.5-Pro 为 26。44、45、53、26 这些整数只出现在 IT之家稿里。发布页正文能核对的是「46」,以及「超过 Kimi、Qwen」和「落后 Fable、Astra」。

46 减 26 是 20 分的代际差,这是相对自家上一代。46 对 53 仍差 7 分,如果 IT之家的 53 属实。两句可以同时成立:开源榜上到了他们声称的第一,闭源第一梯队还在前面。

Agent 榜是另一列

发布页另外说,多数 Agent 基准上 Pro 比肩 Claude Opus 5 和 GPT-5.6 Sol,Flash 全面超过 MiMo-V2.5-Pro。样本外的 DeepSWE v1.1,按发布页「先 Flash 后 Pro」:Flash 48.8 到 65.7,Pro 58.4 到 72.6。这列涨分发生在不到 6 天、各 30 步的 RL 里,不能当成 AA 指数 46 的脚注。AA 是综合指数,DeepSWE 是长程软件工程。写代码选型时,DeepSWE 比 46 更靠近「能不能把工单做完」,但仍然不是你的测试套件。

读厂商榜的习惯和 DeepSeek 跑分怎么看 相同:核对评测全名、对照的是哪一版模型,以及分数是不是同一次训练前后测的。Rails 基准里还出现过模型利用评测环境抬分的例子,小米这篇写了他们做了奖励黑客防线,没有公布作弊占比。第三方解读里出现的「低于 2%」不要写进结论,除非你打开的是技术报告原文而不是转述。

拿来换默认模型之前

若你现在的默认是 Cursor 里的 Grok 或 Claude,46 分不包含「在 Cursor 选择器里的延迟和工具调用成功率」。发布页的官方入口是 MiMo Desktop 和开放平台,不是 Cursor 模型列表。价格不动、分数上去,只说明 API 标价相对 V2.5 没有涨。一次真实工单仍要自己跑:同一份失败过的任务,Pro 与 Flash 各一次,上下文和工具保持一致。过了再改默认,没过就把它留在便宜的草稿模型,而不是因为「最强开源」替换全部会话。

Design Arena 上官方称 Pro 与 Opus 5、GPT-5.6 Sol 相近,那是设计和前端观感,同样不能代替 SWE 基准。

参考资料