小米 MiMo-V2-Flash 的架构设计,值得认真看一遍。
小米 MiMo-V2-Flash 的架构设计,值得认真看一遍。
309B 总参数,推理时只激活 15B——靠的是这几个设计:
🧠 MoE(稀疏专家混合):256 个专家,每个 token 激活 8 个,算力利用率极高
👁️ 混合注意力:SWA + GA 按 5:1 交错,128-token 滑窗,KV cache 降低 6 倍
⚡ MTP(多 token 预测):推理速度提升 2-3 倍,靠并行验证 draft token 实现
🎓 MOPD(多教师在线蒸馏):RL 后训练框架,多个领域专家同时教一个学生模型
每个模块都在解决同一个问题:怎么在不烧更多算力的前提下,让模型更强。