成本是刻意设计的
V3 论文公开:278.8M token 训练,成本约 557.6万美元。
同级别 GPT-4 估算成本超1亿美元,相差近20倍。
怎么做到的
1. FP8 混合精度训练,大幅降低显存与通信。
2. MLA+MoE 架构红利,激活参数仅37B。
3. 高质量数据配比,而非堆量。
为 R1 铺路
V3 是基座,R1 是在 V3 之上用 GRPO 做推理强化。
没有 V3 的低成本基座,就没有 R1 的低成本推理。
来源
- · DeepSeek-V3 Technical Report
内容基于公开新闻与论文整理,仅为知识科普,不构成投资建议。
发生时间 2024.12 内容更新于 2026.08.21 · 持续迭代中