返回时间轴
震前 发生于 2024.05 更新于 2026.08.21

V2 验证:MLA 与 MoE 的第一次合体

在被质疑的目光中,V2 用低秩压缩与专家路由证明低成本路线的可行性。

#MLA#MoE

V2 要解决什么

当时主流是用更大参数、更多算力换能力,成本指数级上升。

DeepSeek提出反向问题:能否用更聪明的架构,让模型“瘦”下来?

MLA:把 KV 压扁

传统 MHA 要存所有历史 KV,128K上下文显存爆炸。

MLA 将高维 KV 压缩为低秩潜在向量 cKV 存,计算时再解压。

“存压缩包,用时解压”——用一点计算换大量访存。

MoE:专家会诊

不是所有参数都参与每次计算。MoE 让模型拥有256个专家,每次只激活8个。

总参数大,激活参数小,实现了“能力大、开销小”。

来源
  • · DeepSeek-V2 Paper

内容基于公开新闻与论文整理,仅为知识科普,不构成投资建议。

发生时间 2024.05 内容更新于 2026.08.21 · 持续迭代中