{"title":"MiMo-V2.6 复核件 #1 · 生态衍生谱系 + 可跑性初探(附参数总量独立复算)","subtitle":"任务 #79 小米 MiMo V2.6 深度研究报告 · 小明(复核 + 生态/可跑性)· 取数 2026-09-22 16:13–16:40 CST","coverImg":"","contentType":"text/markdown","content":"# MiMo-V2.6 复核件 #1 · 生态衍生谱系 + 可跑性初探\n\n**执行**:小明(5F·Studio worker)|**任务**:#79 小米 MiMo V2.6 深度研究报告|**分工**:复核 + 生态/可跑性\n**取数窗口**:2026-09-22 16:13 – 16:40 CST(Asia/Shanghai)\n**证据等级**:`[已核]` = 有独立复算或直读路径,附可重跑命令;`[官方声明未复核]` = 仅官方自述;`[核不了]` = 本次未能定论\n**上游数据源**:HuggingFace API(`/api/models/{id}?blobs=true`、`raw/main/{config.json, README.md, model.safetensors.index.json}`)、ModelScope API。原始 JSON 已落地本机 `data/`,命令见 §8。\n\n![MiMo-V2.6 生态衍生谱系与参数复算](metafile://ff4707cee1ed0b54a3058a90c4447452b4c1e1c8d4dde5737e0902a98296bb71i0)\n\n## 0. 一句话结论\n\n三条线的发布面事实均可回源直读;**参数总量**经独立解析复算与官方声明一致(偏差 <0.3%),但**激活参数量**复算显著低于官方(Flash −8.3% / Pro −13.4%),口径不可比,已列存疑;生态衍生件在官方权重上链后 **15 小时内**出现 ≥14 个;本机(Apple M4 / 16GB / 无 CUDA)**当前不可跑通任何一条线**,阻塞点已定位到具体包与版本,并给出可复跑的最小验证命令。\n\n## 1. 官方三线基线快照 `[已核]`\n\n来源:HF API `/api/models/{id}` 的 `createdAt` / `lastModified`(机器时间戳,任何人可复跑)。\n\n| 模型线 | HF repo | 权重 createdAt (UTC) | 北京时 | 模态 | 许可 | 权重格式 |\n|---|---|---|---|---|---|---|\n| Pro-RL(旗舰) | `XiaomiMiMo/MiMo-V2.6-Pro-RL` | 2026-09-21T15:39:33Z | 09-21 23:39:33 | 文/图/视/音 | MIT | safetensors;`quantization_config`: quant_method=fp8, fmt=e4m3, store_dtype=mxfp4, block 32 |\n| Flash-RL(效率档) | `XiaomiMiMo/MiMo-V2.6-Flash-RL` | 2026-09-21T15:39:51Z | 09-21 23:39:51 | 文/图/视/音 | MIT | safetensors;同上(mxfp4 / fp8 e4m3) |\n| Distill-Qwen-9B | `XiaomiMiMo/MiMo-V2.6-Distill-Qwen-9B` | 2026-09-21T18:18:40Z | **09-22 02:18:40** | 图+文(image-text-to-text) | MIT | safetensors bf16(index `total_size` 18.82 GB) |\n\n三线均为 `gated=false / private=false`,即无门控、可直接下载。Pro/Flash 的 HF 卡带 `MiMo_V2_6_technical_report.pdf`(技术报告原文,未在本次复核范围内)。\n\n> **对齐提醒(给 @阿绿)**:Distill 的北京时间落在 09-22 凌晨。任务书「2026-09-21 发布」在 **UTC 口径成立**,在**北京时口径跨日**。这属于口径问题而非事实冲突——见存疑 S2。\n\n## 2. 架构事实(config.json 直读) `[已核]`\n\n| 字段 | Flash-RL | Pro-RL |\n|---|---|---|\n| `model_type` / arch | mimo_v2 / MiMoV2ForCausalLM | mimo_v2 / MiMoV2ForCausalLM |\n| 层数 | 48(MoE 47 + dense FFN 1) | 70(MoE 69 + dense FFN 1) |\n| hidden_size | 4096 | 6144 |\n| routed experts(总/激活) | 256 / 8(scoring=sigmoid, n_group=1, topk_group=1) | 384 / 8 |\n| moe_intermediate_size / dense intermediate | 2048 / 16384 | 2048 / 16384 |\n| 注意力 | Q 64 / KV 4(SWA)· head_dim 192 · v_head_dim 128 | Q 128 / KV 8 · head_dim 192 · v_head_dim 128 |\n| sliding_window / max_position_embeddings | 128 / **1048576(1M)** | 128 / **1048576(1M)** |\n| rope_theta / dtype | 1e7 / bfloat16 | 1e7 / bfloat16 |\n| vocab_size | 152576 | 152576 |\n| 视觉/音频 | vision depth 28 · hidden 1280;audio_tokenizer 20 RVQ | 同 |\n| MTP | `num_nextn_predict_layers` 存在(官方卡述 5 层 SWA MTP drafter) | 同 |\n\nDistill-Qwen-9B:`model_type=qwen3_5`,`architectures=[Qwen3_5ForConditionalGeneration]`,cardData `base_model=Qwen/Qwen3.5-9B`(relation `finetune`),非自研 backbone——官方卡自述为「对 Qwen3.5-9B 在 MiMo 生成数据上做 SFT」,SFT 数据 77.4B tokens(含 27.2B loss-bearing)。\n\n## 3. 独立复算 ①:参数总量(验收③)\n\n脚本 `scripts/recount_params.py`,只吃各模型 `config.json`,不做下载权重。口径假设 A1–A4 写在脚本头部(A1 MoE 层判定取 `moe_layer_freq`;A2 单 expert = gate/up/down 三矩阵;A3 激活按 top-k;A4 编码器解析式估计单列)。\n\n```\n$ python3 scripts/recount_params.py\nmodel | backbone_total(复算) | +encoders(复算) | 官方total | 官方activated | 复算activated\nXiaomiMiMo_MiMo-V2.6-Flash-RL | 307.7193B | 308.2982B | 309B | 15B | 13.7615B\n layers=48 moe=47 dense=1 experts=256 topk=8\n moe=302.7952B dense=0.2013B attn=3.4729B embed=1.2499B encoders=0.5789B\nXiaomiMiMo_MiMo-V2.6-Pro-RL | 1016.6804B | 1017.2593B | 1020B | 42B | 36.3898B\n layers=70 moe=69 dense=1 experts=384 topk=8\n moe=1000.1905B dense=0.3020B attn=14.3131B embed=1.8749B encoders=0.5789B\n```\n\n| 口径 | 官方 | 本复算 | 偏差 | 等级 |\n|---|---|---|---|---|\n| Flash total | 309B | 308.30B(backbone+编码器) | **−0.23%** | `[已核]` |\n| Pro total | 1.02T(1020B) | 1017.26B | **−0.27%** | `[已核]` |\n| Flash activated | 15B | 13.76B | −8.3% | **不可比** `[官方声明未复核]` |\n| Pro activated | 42B | 36.39B | −13.4% | **不可比** `[官方声明未复核]` |\n\n**判读**:总量口径可复核(差在舍入与编码器估计误差内);**激活口径不可比**——偏差远超复算误差,而官方未公开逐组件口径(是否计入 MTP drafter / 视觉音频编码器 / dense 层)。按验收③要求,此处**公开标注「不可比」**,并落为存疑 S1,不据此给官方数字下负评。\n\n**独立复算 ②(体积交叉校验)**:Distill 的 `model.safetensors.index.json` `metadata.total_size = 18,819,627,488 B = 18.82 GB`;MLX 社区量化卡自述「Size on disk 6.77 GB(from ~18 GB bf16)」→ 两者一致 `[已核]`。按 bf16=2 B/参数 反推 ≈ **9.41B 参数**(含视觉编码器),与线名「9B」同量级。\n\n**一处必须说清的坑**:Flash 的 index `metadata = {save_format: mxfp4, total_size: 172,923,364,096 B, tp_size: 4}`。`tp_size=4` 意味着张量并行下有复制副本,**不能**用 172.9 GB ÷ 0.5 B 反推参数量——那会算成 ~346B,与 309B 差 12%。凡看到有人拿这个体积直接反推参数,都是错的。落为存疑 S3。\n\n## 4. 生态衍生谱系(①) `[已核]`\n\n时间线以官方权重上链(2026-09-21T15:39:33Z)为 T0,见上方图①。\n\n| # | 衍生件 repo | createdAt (UTC) | 距 T0 | 类型 | 基座 |\n|---|---|---|---|---|---|\n| 1 | `holooo/MiMo-V2.6-Distill-Qwen-9B-Q5_K_S-GGUF` | 2026-09-21T20:47:56Z | +5h08m | llama.cpp GGUF Q5_K_S | Distill-9B |\n| 2 | `Vontra/MiMo-V2.6-Flash-RL-MLX-4bit-MTP` | 2026-09-21T21:21:31Z | +5h42m | MLX 4bit(含 dflash 草稿头) | Flash-RL |\n| 3 | `ggml-org/MiMo-V2.6-Distill-Qwen-9B-GGUF` | 2026-09-21T21:31:35Z | +5h52m | GGUF Q8_0 + mmproj(VLM 需 mmproj) | Distill-9B |\n| 4 | `prithivMLmods/MiMo-V2.6-Distill-Qwen-9B-FP8` | 2026-09-21T21:38:09Z | +5h59m | FP8 | Distill-9B |\n| 5 | `CNWPlayer/MiMo-V2.6-Distill-Qwen-9B-Q4_K_M-GGUF` | 2026-09-21T21:43:16Z | +6h04m | GGUF Q4_K_M | Distill-9B |\n| 6 | `mlx-community/MiMo-V2.6-Distill-Qwen-9B-OptiQ-4bit` | 2026-09-21T23:21:27Z | +7h42m | MLX 4/8bit 混合(bpw 6.34,134 层 8bit / 116 层 4bit,6.77 GB) | Distill-9B |\n| 7 | `mlx-community/MiMo-V2.6-Flash-RL-mxfp4-q8` | 2026-09-21T23:40:28Z | +8h01m | MLX mxfp4-q8(36 shards) | Flash-RL |\n| 8 | `sakamakismile/MiMo-V2.6-Distill-Qwen-9B-GGUF` | 2026-09-22T00:22:03Z | +8h43m | GGUF Q4_K_M + mmproj F16 | Distill-9B |\n| 9 | `ProCreations/MiMo-V2.6-Flash-RL-NVFP4` | 2026-09-22T01:20:09Z | +9h41m | NVFP4(modelopt)+ DFlash BF16 gguf | Flash-RL |\n| 10 | `prithivMLmods/MiMo-V2.6-Distill-Qwen-9B-MLX` | 2026-09-21T22:36:32Z | +6h57m | MLX | Distill-9B |\n| 11 | `dealignai/MiMo-V2.6-Pro-RL-UNCENSORED` | 2026-09-22T05:55:20Z | +14h16m | 去对齐微调(记录,不背书) | Pro-RL |\n\n**结构判读**:衍生谱系明显**偏向 Distill-Qwen-9B**(本地可承载的小尺寸),Pro/Flash 的衍生以 MLX / NVFP4 等**量化封装**为主,未见第三方再训练版本。官方发布后 6 小时内出现 GGUF/FP8,是「小尺寸蒸馏件 + GGUF 生态」的标准扩散路径。`[已核]`(HF API `createdAt` + `siblings`)。\n\n`[核不了]`:`bartowski/MiMo-V2.6-Distill-Qwen-9B-GGUF`、`prithivMLmods/MiMo-V2.6-Distill-Qwen-9B-GGUF` —— 两次取数(16:16、16:29)HF API 连接中断,只能确认仓库存在(搜索索引命中),文件清单未取到。见存疑 S5。\n\n## 5. 可跑性初探(②)\n\n**本机环境(实测)**:Apple M4 / 10 核 GPU / **16 GB RAM** / 195 GB 可用磁盘 / **无 CUDA**、无 Docker、无 ollama、无 llama.cpp;Python 3.9 + torch 2.8.0 + transformers 4.57.6 + mlx_lm 0.29.1 + safetensors 0.7.0;**mlx-vlm 未安装**。\n\n三组**实测**(不是推测,命令与错误串原文如下):\n\n```\nA) python3 -c \"from transformers import AutoConfig; AutoConfig.from_pretrained('XiaomiMiMo/MiMo-V2.6-Distill-Qwen-9B')\"\n → ValueError: The checkpoint you are trying to load has model type `qwen3_5`\n but Transformers does not recognize this architecture. [本机 transformers 4.57.6]\n\nB) python3 -c \"from transformers import AutoConfig; AutoConfig.from_pretrained('XiaomiMiMo/MiMo-V2.6-Flash-RL', trust_remote_code=True)\"\n → OK: MiMoV2Config | model_type mimo_v2 | layers 48 [Pro-RL 同样 OK,layers 70]\n\nC) mlx_lm 0.29.1 模块清单核对:models/mimo.py 存在(旧版 MiMo-7B dense 架构),\n models/mimo_v2.py 不存在,models/qwen3_5.py 不存在;\n mlx-community OptiQ-4bit 的 config.json `model_type = qwen3_5` → 同样无法派发。\n```\n\n**结论(`[已核]`,阻塞点已定位)**:本机当前**不可跑通任何一条线**——但这**不是「核不了」**,因为失败点精确到包与版本,给出可复跑路径:\n\n| 路径 | 目标线 | 需要什么 | 本机可行性 |\n|---|---|---|---|\n| A. MLX | Distill-9B | `mlx-vlm`(且需支持 `qwen3_5`)+ OptiQ-4bit 6.77 GB | 体积可入 16 GB,**缺包待升级** |\n| B. llama.cpp | Distill-9B | 装 llama.cpp;`ggml-org` Q8_0 9.53 GB + mmproj 0.62 GB | 体积勉强可入,**缺运行时** |\n| C. SGLang/vLLM | Flash/Pro | 官方示例 `--tp 8 --dp 2`(8 卡起步) | **核不了**(本机无 GPU 集群) |\n\n> 给 @阿绿 的交接点:路径 A/B 都是**可改造的本机实测**,我可以在拿到 chair 允许后实际装 `mlx-vlm` 或 llama.cpp 跑一次最小推理,把「未跑通」升级为「已跑通/实测失败」。当前不擅自装环境。\n\n## 6. 独立复算的对照对象预选(③)\n\n| 候选对照 | 可比性判定 | 等级 |\n|---|---|---|\n| **MiMo-V2.5-Pro**(HF `XiaomiMiMo/MiMo-V2.5-Pro`) | 官方评测表**同表内**给出 19.0/12.5/40.4 等旧分,可与 V2.6 同表对照 | **非独立第三方**(厂商自报、同表),标注「同表跨代对照」而非独立复测 |\n| 表中竞品列(Claude Opus 5 / GPT-5.6 Sol / Claude Fable 5) | 均为厂商引用他方自述,harness 版本未公开 | `[官方声明未复核]` |\n| 第三方榜单(Artificial Analysis / LMArena / SWE-bench 官方榜) | **本次未取到** | `[核不了]` |\n\n**可比性硬条件**:DeepSWE v1.1 从 19.0 → 71.9 这类跨代跃升,只有在**评测框架、harness 版本、shot/rollout 口径一致**时才可比。HF 卡未给出 harness 版本号;`avg@3` / `avg@1` 混用(Distill 卡),也已说明不同 benchmark 口径不同。**在拿到 harness 版本号之前,这份表只能标「口径不可比」用于跨代趋势,不能用于定论排名**——这与团队「判据冻结」原则一致。\n\n## 7. 存疑清单(S1–S5)\n\n**S1 · 激活参数量官方 42B/15B vs 复算 36.39B/13.76B(偏差 −13.4%/−8.3%)**\n为何存疑:偏差远超解析复算误差,且官方未公开逐组件口径(MTP drafter?视觉音频编码器?dense 层?shared expert 计法?)。\n要什么才能定:官方逐组件参数表;或按权重 index 逐张量 dtype 求和(需全量权重元数据与专家命名规范)。\n\n**S2 · Distill 线的「发布时刻」口径**\n为何存疑:HF 权重 `createdAt = 2026-09-21T18:18:40Z`,UTC 口径在 09-21、北京时口径在 09-22。任务书写「2026-09-21 发布」,未指明时区口径。\n要什么才能定:官方公告(`mimo.xiaomi.com/mimo-v2-6` 博客)的发布时间戳与公告时区。\n\n**S3 · Flash index `total_size=172.9 GB` 不可用于反推参数量**\n为何存疑:`tp_size=4`,张量并行带复制副本;直接除以 mxfp4 的 0.5 B/参数会得到 ~346B,与官方 309B 差 12%。\n要什么才能定:官方 checkpoint 体积声明,或单副本(tp=1)体积。\n\n**S4 · 社区去对齐微调 `dealignai/MiMo-V2.6-Pro-RL-UNCENSORED` 出现在官方发布后 +14h16m**\n为何存疑:官方对社区微调/去对齐派生件是否有政策表态,本次未取到;该件声称基于 Pro-RL 量化封装(fp8/mxfp4 tags)。\n要什么才能定:官方对社区衍生件的政策声明;或该件作者的量化/微调方法说明。\n\n**S5 · 两个衍生件明细未取到**\n`bartowski/MiMo-V2.6-Distill-Qwen-9B-GGUF`、`prithivMLmods/MiMo-V2.6-Distill-Qwen-9B-GGUF`:两次取数均 HF API 连接中断(`Expecting value: line 1 column 1`,HTTP 000)。\n要什么才能定:网络恢复后重跑 §8 命令即可,无需额外证据。\n\n## 8. 可复跑取数脚本(命令 + 预期输出)\n\n```bash\n# 0) 官方三线元数据(预期:createdAt 与 §1 表一致,likes 279/267/218)\nfor m in XiaomiMiMo/MiMo-V2.6-Flash-RL XiaomiMiMo/MiMo-V2.6-Pro-RL XiaomiMiMo/MiMo-V2.6-Distill-Qwen-9B; do\n curl -s \"https://huggingface.co/api/models/$m\" | python3 -c \"import json,sys;d=json.load(sys.stdin);print(d['modelId'],d['createdAt'],d['lastModified'],d.get('likes'))\"\ndone\n\n# 1) 架构直读(预期:§2 表)\nfor m in XiaomiMiMo/MiMo-V2.6-Flash-RL XiaomiMiMo/MiMo-V2.6-Pro-RL; do\n curl -sL \"https://huggingface.co/$m/raw/main/config.json\" -o data/$(echo $m|tr '/' '_')_config.json\ndone\n\n# 2) 参数总量独立复算(预期输出见 §3)\npython3 scripts/recount_params.py\n\n# 3) 权重体积交叉校验(预期 Flash: 172923364096, tp_size 4;Distill: 18819627488)\ncurl -sL \"https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-RL/raw/main/model.safetensors.index.json\" | python3 -c \"import json,sys;print(json.load(sys.stdin)['metadata'])\"\ncurl -sL \"https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Distill-Qwen-9B/raw/main/model.safetensors.index.json\" | python3 -c \"import json,sys;print(json.load(sys.stdin)['metadata'])\"\n\n# 4) 可跑性探针(预期:A 抛 qwen3_5 ValueError;B/C 见 §5)\npython3 -c \"from transformers import AutoConfig; AutoConfig.from_pretrained('XiaomiMiMo/MiMo-V2.6-Distill-Qwen-9B')\"\npython3 -c \"from transformers import AutoConfig; AutoConfig.from_pretrained('XiaomiMiMo/MiMo-V2.6-Flash-RL', trust_remote_code=True)\"\n\n# 5) 生态谱系(预期:§4 的 createdAt 序列)\ncurl -s \"https://huggingface.co/api/models?search=MiMo-V2.6&limit=50\" | python3 -c \"import json,sys;[print(m['modelId'],m.get('createdAt')) for m in json.load(sys.stdin)]\"\n```\n\n**本机落地文件**:`data/{flash_rl,pro_rl,distill}_README.md`、`data/XiaomiMiMo_MiMo-V2.6-*.json`(HF 原始元数据)、`data/*_config.json`、`data/flash_index.json`、`data/distill_index.json`、`data/optiq_config.json`、`scripts/recount_params.py`、`scripts/make_chart.py`、`data/mimo_v26_ecosystem.png`。\n\n---\n*本件为任务 #79 的 worker 交付(复核线)。所有数字均带来源与取数时刻;凡未取到者一律标 `[核不了]`,未使用任何记忆数字补位。*","encryption":"0","createTime":1790066442862,"tags":["MiMo","MiMo-V2.6","小米","开源模型","复核","可复跑","证据等级","任务79"],"attachments":[]}