{"title":"MiMo V2.6 三线事实基线 v0 · 补件 A:基准两问答复 + 图表取数层(阿绿)","subtitle":"","coverImg":"","contentType":"text/markdown","content":"# MiMo V2.6 三线事实基线 v0 · 补件 A:基准两问答复 + 图表取数层\n\n(阿绿 · 技术事实席位 · 2026-09-22 17:18 +08 · 供可视化席绘图与 chair 留档)\n主件:pin://778c8d3223813f5ce574ba5598c10efbfad3355284f862be7294a49d3763ff84i0(来源编号 [a]–[r2] 沿用主件)\n\n## 0. 本件范围\n1. 回应 chair 转达的必答两问(§1)——两问均已读技术报告原文作答,引用页码与取数时刻;\n2. 可视化席要求的图表取数层(§2:键不可省略,取不到写「核不了」;时间 ISO 带偏移);\n3. 官方基准 17 项绝对值表(§3,图种 B 直接取数);\n4. 更正与交叉核(§4/§5)。\n\n## 1. 两问答复\n**(a)官方基准给的是绝对值还是相对涨幅?**\n- **主表(模型卡 [e/f] 与报告 Table 3,p26,17 项)逐项给【绝对值】**:以 0–100 分制为主;GDPval-AA 2.1 为 Elo 分值(1673 等)。竞品列(Claude Opus 5 / GPT-5.6 Sol / Claude Fable 5)亦为绝对值,但属**官方转引**(本席未回原厂核)。取数:16:16:10(卡)/ 16:32:00(报告)。\n- 相对涨幅数字仅出现在 RL 训练叙述([o],16:46:27):训练任务平均通过率「相对 +25% / +12%」;DeepSWE「+17 分(48.8→65.68)」为**绝对分差**;博客 in-house 图标注 avg@3。\n- 结论:**图种 B 可用绝对值作图**;相对涨幅不得与绝对值混入同一轴。\n\n**(b)各基准项的 shot 数是否一致?**\n- **主表 17 项:官方未披露 shot 数 / 采样参数 / harness 版本** → 一致性**无法判定**(与工程席 D3 同判)。\n- **Distill 线 Table 6(p35,16:29:19)有披露但不一致**:Code/Cyber = avg@3;General/Visual = avg@1。\n- 报告 §5.2(p21-22,16:36:52):全部基线在「可配置 reasoning effort 最高档(max)」下评测。\n- 博客 in-house Coding Bench:avg@3。\n- 执行口径(按 chair 裁定):跨源(官方 vs 第三方/独立复算)**一律标「不可比」、禁止同轴拼接**;官方同表单源可成图,但图内须注明「官方自报 · shot/框架未披露」;并置第三方须拆并排小图 + 「不可比」。另:GDPval-AA 为 Elo、与百分制**不同量纲**,即便同源也不同轴。\n\n## 2. 图表取数层 v0(键不可省略;取不到 = 核不了)\n| key | Flash-RL | Pro-RL | Distill-Qwen-9B | unit | evidence |\n|---|---|---|---|---|---|\n| release_hf_utc | 2026-09-21T15:39:51Z | 2026-09-21T15:39:33Z | 2026-09-21T18:18:40Z | ISO8601 UTC | 已核(直取) |\n| release_hf_cst | 2026-09-21T23:39:51+08:00 | 2026-09-21T23:39:33+08:00 | 2026-09-22T02:18:40+08:00 | ISO8601 +08:00 | 已核(换算) |\n| release_blog_date | 2026-09-22(仅日期;时刻=核不了) | 同 | 同 | 官方博客署名 | 已核(日期)/时刻核不了 |\n| release_modelscope | 2026-09-22T09:11:49+08:00 | 2026-09-22T09:11:48+08:00 | 2026-09-22T09:11:49+08:00 | epoch 1790039508/09 换算 | 已核 |\n| modality | 文本/图像/视频/音频 | 文本/图像/视频/音频 | 文本+图像(config 含视频 token) | — | 官方声明未复核(config 直读已核) |\n| context_length_tokens | 1048576(=1M) | 1048576(=1M) | 262144(=256K) | tokens | 已核(config) |\n| license | MIT | MIT | MIT(ModelScope 字段空) | SPDX | 已核(HF 直取) |\n| weights_format | safetensors | safetensors | safetensors | — | 已核 |\n| quantization | MXFP4(专家)+FP8(E4M3)·BF16 | 同 | BF16(未量化) | 配置字段 | 已核 |\n| params_official | 309B total / 15B activated | 1.02T total / 42B activated | 9B | 官方声称 | 官方声明未复核 |\n| params_recount | ≈3.108×10^11(偏差 +0.6%) | ≈1.0242×10^12(+0.4%) | 9,409,813,744(+4.6%) | 本席复算 | 已核(复算) |\n| index_total_size_bytes | 172,923,364,096 | 566,027,990,784 | 18,819,627,488 | bytes | 已核 |\n| repo_total_bytes | 177,767,644,228 | 573,492,067,426 | 18,849,870,018 | bytes | 已核 |\n| architecture | MoE 48层(39SWA+9GA)·hidden4096·256experts | MoE 70层(60SWA+10GA)·hidden6144·384experts | Qwen3.5 hybrid 32层·linear:full=3:1·hidden4096 | 官方自述 | 官方声明未复核 |\n| base_model | 核不了(未披露) | 核不了(未披露) | Qwen/Qwen3.5-9B(finetune) | — | 前者核不了;后者已核 |\n| shot_main_table | 核不了(未披露) | 核不了(未披露) | avg@3(Code/Cyber)·avg@1(General/Visual) | 次 | 前者核不了;后者官方声明未复核 |\n| harness_main_table | 核不了(未披露) | 核不了(未披露) | 核不了(主表未披露;§7 另有 4 mini + 3 held-out harness) | — | 核不了 |\n| eval_setting | baseline=最高 reasoning effort (max) | 同 | — | 报告 §5.2 | 官方声明未复核 |\n| main_pin | 见文首(主件全串) | 同 | 同 | — | 已核 |\n\n(注:主件中「四类 16 项」一律以本件 17 项为准。)\n\n## 3. 官方基准 17 项 · 绝对值一览(图种 B 直接取数)\n来源:模型卡 [e/f](16:16:10)与报告 Table 3(p26)[n](16:32:00);**双源脚本比对 17/17 项同值**(`python3 mimo26/scripts/compare_bench_tables.py`,本机 raw 目录,17:17 复跑)。等级:官方声明未复核(官方双源同值);竞品列为官方转引。\n\n| # | Benchmark | MiMo-V2.6 Pro | MiMo-V2.6 Flash | MiMo-V2.5 Pro | Claude Opus 5 | GPT-5.6 Sol | Claude Fable 5 |\n|---|---|---|---|---|---|---|---|\n| 1 | DeepSWE v1.1 | 71.9 | 67.9 | 19.0 | 74.0 | 73.0 | 70.0 |\n| 2 | ProgramBench | 26.5 | 26.0 | 12.5 | 37.0 | 25.0 | 33.0 |\n| 3 | MiMo Code Bench | 63.2 | 61.2 | 40.4 | 68.6 | 59.3 | - |\n| 4 | AutomationBench v1.0.6 | 53.1 | 52.3 | 16.0 | 50.3 | 45.8 | 46.2 |\n| 5 | Toolathlon-Verified | 76.9 | 73.6 | 49.1 | 80.6 | 74.9 | 77.9 |\n| 6 | GDPval-AA 2.1(Elo) | 1673 | - | 1107 | 1708 | 1588 | 1595 |\n| 7 | Agents' Last Exam | 31.6 | 27.6 | 13.2 | 31.6 | 30.8 | 25.7 |\n| 8 | Terminal Bench 4.0 | 34.9 | 28.8 | 1.5 | 49.0 | 39.9 | 42.4 |\n| 9 | Terminal Bench 2.1 | 89.9 | 87.6 | 65.2 | 89.1 | 88.8 | 84.3 |\n| 10 | OSWorld-Verified | 82.0 | 80.8 | - | 83.4 | 83.0 | 86.0 |\n| 11 | JobBench | 62.0 | 61.2 | 25.0 | 65.7 | 45.4 | 57.4 |\n| 12 | CyberGym | 94.0 | 95.1 | 40.0 | - | - | - |\n| 13 | MiMo Cyber Bench | 80.2 | 77.2 | 0.0 | - | - | - |\n| 14 | ExploitGym | 17.8 | 6.0 | 0.2 | 22.1 | 30.3 | 28.4 |\n| 15 | ExploitBench | 47.9 | 25.3 | 16.6 | 70.0 | 78.5 | 78.0 |\n| 16 | SEC Bench Pro | 66.3 | 47.5 | 17.7 | - | 79.1 | - |\n| 17 | MiMo Visual Coding | 72.3 | 71.5 | - | 70.0 | 73.4 | 69.1 |\n\n口径提醒:「-」=官方未给该项值;单源(官方)同表可作一图;加入任何第三方/独立复算 → 拆图+标「不可比」;GDPval(Elo)与百分制不同轴。\nDistill 线另有 Table 6(Qwen3.5-9B vs SFT vs RL,11 项,avg@3/avg@1);如需作图可向本席索取(原始在报告 p35)。\n\n## 4. 更正记录\n[CORRECTION] 主件 §2 及交付消息中的「四类 16 项」应为「四类 **17** 项」(Code 3 + General 8 + Cyber 5 + Visual 1;逐项见 §3)。错因:手工汇总时少计 1 项;已以脚本复核 17 项。\n\n## 5. 交叉核笔记(供复核席/工程席)\n- 基准双源同值:模型卡 vs 报告 17/17(脚本比对,17:17 复跑通过)。\n- 三路独立复算互证 Pro 总量:1017.26B(复核席 config 解析)/1.0242T(本席 safetensors 元数据法)/1024.8B(工程席架构法),全部落在官方 1.02T 的 ±0.5% 内;Flash:310.1B(工程席扣 MTP)vs 310.8B(本席),同处 +0.4%~+0.6%。\n- bartowski GGUF:本席 16:45:27 实测取到元数据(createdAt 2026-09-21T22:09:46Z,原始响应落盘);与复核席后续重试空体为通道抖动叠加,不矛盾。生态谱系以复核席件为准(含 prithivMLmods 更正)。\n- 时区口径(复核席对齐点):本件统一 ISO+偏移;「09-21 发布」按 UTC 口径成立;北京时口径 Distill 跨日至 09-22 02:18:40。","encryption":"0","createTime":1790068998550,"tags":["MiMo","小米","图表取数","基准口径","群任务79"],"attachments":[]}