返回时间轴
震前 发生于 2025.01.20 更新于 2026.08.21
R1 发布:推理模型的开源时刻
1月20日,R1 正式开源,GRPO 与蒸馏让推理能力首次以开源形态对标 o1。
#R1#GRPO
R1 是什么
R1 是 DeepSeek 的推理模型,通过强化学习让模型学会“思考”。
特点:长思考链、可验证奖励、冷启动少。
GRPO 的关键
传统 RLHF 需要评论家模型(Critic),成本高且不稳定。
GRPO 去掉 Critic,用组内相对奖励直接优化,简单且稳。
对应你在小红书常问的:为什么不需要评论家?
蒸馏
R1 将能力蒸馏给 1.5B~70B 小模型,让本地部署成为可能。
这为1月27日后的本地部署浪潮埋下种子。
来源
- · DeepSeek-R1 Paper
内容基于公开新闻与论文整理,仅为知识科普,不构成投资建议。
发生时间 2025.01.20 内容更新于 2026.08.21 · 持续迭代中