返回时间轴
震前 发生于 2025.01.20 更新于 2026.08.21

R1 发布:推理模型的开源时刻

1月20日,R1 正式开源,GRPO 与蒸馏让推理能力首次以开源形态对标 o1。

#R1#GRPO

R1 是什么

R1 是 DeepSeek 的推理模型,通过强化学习让模型学会“思考”。

特点:长思考链、可验证奖励、冷启动少。

GRPO 的关键

传统 RLHF 需要评论家模型(Critic),成本高且不稳定。

GRPO 去掉 Critic,用组内相对奖励直接优化,简单且稳。

对应你在小红书常问的:为什么不需要评论家?

蒸馏

R1 将能力蒸馏给 1.5B~70B 小模型,让本地部署成为可能。

这为1月27日后的本地部署浪潮埋下种子。

来源
  • · DeepSeek-R1 Paper

内容基于公开新闻与论文整理,仅为知识科普,不构成投资建议。

发生时间 2025.01.20 内容更新于 2026.08.21 · 持续迭代中