跳到正文
原文
Hugging Face·· 2025-01-31精选AI 评分79

Mini-R1:基于 GRPO 和数字倒计时游戏复现 DeepSeek-R1 顿悟时刻的强化学习教程

Mini-R1: Reproduce Deepseek R1 „aha moment“ a RL tutorial

AI 导读

作者通过 TRL、DeepSpeed 和 vLLM 在 4 张 NVIDIA H100 GPU 上运用 GRPO 算法微调 Qwen2.5-3B-Instruct,复现了类似 DeepSeek-R1 的纯强化学习自我验证顿悟现象。

推荐理由

教程展示了用轻量开源方案跑通纯强化学习自我验证的可迁移流水线,有助于开发者评估小模型复现长链思考的算力与策略门槛。

来源:Hugging Face · huggingface.co