返回时间轴
震后 发生于 2025.03 更新于 2026.08.21

便宜的背后:三板斧拆解

MLA、MoE、GRPO 如何把成本压到 1/10

震后大家都在问便宜如何做到。答案不是单一技巧,而是架构、强化学习与工程的三重叠加。

#技术#拆解#MLA#MoE#GRPO

第一板斧:MLA 把显存压扁

传统 MHA 的 KV Cache 随上下文线性膨胀,128K 时显存 90% 被缓存占据。

MLA 将 K/V 压缩为 512 维潜在向量 cKV 存储,计算时再通过上投影还原。

V4 论文显示:1M 上下文下 Pro 的 KV cache 仅为 V3.2 的 10%。这不是省显存,是把访存瓶颈换成了可并行的计算。

第二板斧:MoE 让参数“按需上班”

DeepSeek 采用细粒度 MoE:总参数 671B,激活仅 37B(V3)/ 49B(V4-Pro)。

256 个专家 + 1 个共享专家,每次只路由 8 个。

配合 Auxiliary-Loss-Free 负载均衡与 EPLB/LPLB,解决了小批量时的专家倾斜。参数大、账单小。

第三板斧:GRPO 去掉评论家

传统 PPO 需要训练一个 Critic 模型评估价值,成本高且不稳定。

GRPO 用组内相对奖励:同一 prompt 采样 64 个回答,组内归一化直接得到优势,无需 Critic。

配合 FP8 混合精度、Multi-Token Prediction 与 DualPipe 流水线,训练成本被系统性压低。

三者叠加

单看一项都是 20% 优化,三项叠加 + 工程化(FP8、TileLang 核融合、批不变确定性核)才得到 557 万美元 vs 1 亿美元的量级差。

V4 进一步用 CSA/HCA 混合稀疏注意力与 mHC 流形约束,把单 token FLOPs 压到 V3.2 的 27%。

来源
  • · DeepSeek-V2/V3 技术报告
  • · DeepSeek-R1 GRPO
  • · DeepSeek-V4 2026-06-24
  • · mHC 2025-12-31

内容基于公开新闻与论文整理,仅为知识科普,不构成投资建议。

发生时间 2025.03 内容更新于 2026.08.21 · 持续迭代中