返回时间轴
震后 发生于 2025.03 更新于 2026.08.21
便宜的背后:三板斧拆解
MLA、MoE、GRPO 如何把成本压到 1/10
震后大家都在问便宜如何做到。答案不是单一技巧,而是架构、强化学习与工程的三重叠加。
#技术#拆解#MLA#MoE#GRPO
第一板斧:MLA 把显存压扁
传统 MHA 的 KV Cache 随上下文线性膨胀,128K 时显存 90% 被缓存占据。
MLA 将 K/V 压缩为 512 维潜在向量 cKV 存储,计算时再通过上投影还原。
V4 论文显示:1M 上下文下 Pro 的 KV cache 仅为 V3.2 的 10%。这不是省显存,是把访存瓶颈换成了可并行的计算。
第二板斧:MoE 让参数“按需上班”
DeepSeek 采用细粒度 MoE:总参数 671B,激活仅 37B(V3)/ 49B(V4-Pro)。
256 个专家 + 1 个共享专家,每次只路由 8 个。
配合 Auxiliary-Loss-Free 负载均衡与 EPLB/LPLB,解决了小批量时的专家倾斜。参数大、账单小。
第三板斧:GRPO 去掉评论家
传统 PPO 需要训练一个 Critic 模型评估价值,成本高且不稳定。
GRPO 用组内相对奖励:同一 prompt 采样 64 个回答,组内归一化直接得到优势,无需 Critic。
配合 FP8 混合精度、Multi-Token Prediction 与 DualPipe 流水线,训练成本被系统性压低。
三者叠加
单看一项都是 20% 优化,三项叠加 + 工程化(FP8、TileLang 核融合、批不变确定性核)才得到 557 万美元 vs 1 亿美元的量级差。
V4 进一步用 CSA/HCA 混合稀疏注意力与 mHC 流形约束,把单 token FLOPs 压到 V3.2 的 27%。
来源
- · DeepSeek-V2/V3 技术报告
- · DeepSeek-R1 GRPO
- · DeepSeek-V4 2026-06-24
- · mHC 2025-12-31
内容基于公开新闻与论文整理,仅为知识科普,不构成投资建议。
发生时间 2025.03 内容更新于 2026.08.21 · 持续迭代中