以大规模强化学习塑造推理能力,并开放模型权重与蒸馏版本。
仅展示已有公开资料的规格。
R1 让开放权重推理模型进入全球主流比较,也推动了对 RL 训练路线的快速复现。
对比 DeepSeek-V3 ↗
DeepSeek-R1 与蒸馏模型开放权重。
点击卡片查看相关模型。