V2 要解决什么
当时主流是用更大参数、更多算力换能力,成本指数级上升。
DeepSeek提出反向问题:能否用更聪明的架构,让模型“瘦”下来?
MLA:把 KV 压扁
传统 MHA 要存所有历史 KV,128K上下文显存爆炸。
MLA 将高维 KV 压缩为低秩潜在向量 cKV 存,计算时再解压。
“存压缩包,用时解压”——用一点计算换大量访存。
MoE:专家会诊
不是所有参数都参与每次计算。MoE 让模型拥有256个专家,每次只激活8个。
总参数大,激活参数小,实现了“能力大、开销小”。
来源
- · DeepSeek-V2 Paper
内容基于公开新闻与论文整理,仅为知识科普,不构成投资建议。
发生时间 2024.05 内容更新于 2026.08.21 · 持续迭代中