Hugging Face·· 2026-09-03精选AI 评分67
通过 100 步 GRPO 微调提升 350M 小模型的结构化输出能力
Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps
AI 导读
Hugging Face 发布了一套低成本微调方案,使用 TRL 库和 GRPO 算法在 100 个训练步内显著提升小模型的结构化输出合规性。实验基于约 500 条样本对 LFM2.5-350M 进行 LoRA 微调,在 IFStruct 基准上的整体通过率从 22.6% 提升至 29.7%,其中 JSON 格式通过率从 18.0% 跃升至 31.9%。
推荐理由
教程展示了如何在免费 GPU 上仅用百步强化学习微调端侧小模型,为端侧结构化提取任务提供了低成本可复现方案。
来源:Hugging Face · huggingface.co