DeepSeek-V3 的架构设计,是一份值得反复读的效率教材。
DeepSeek-V3 的架构设计,是一份值得反复读的效率教材。
671B 总参数,推理时只激活 37B——靠的是这几个设计:
🧠 DeepSeekMoE:稀疏专家架构,共享专家 + 路由专家分离,负载更均衡
👁️ MLA(多头潜在注意力):低秩压缩 KV cache,显存占用大幅降低
⚖️ 无辅助损失负载均衡:首次不靠额外 loss 项来平衡专家,性能损耗接近零
⚡ MTP(多 token 预测):训练目标 + 推理加速两用,一个模块解决两个问题
🔢 FP8 混合精度训练:超大规模模型首次验证可行,算力成本直接砍半
结果:14.8T token 训练完,全程无 loss spike,无回滚。