跳到正文
原文
Hugging Face·· 2026-09-03精选AI 评分67

通过 100 步 GRPO 微调提升 350M 小模型的结构化输出能力

Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps

AI 导读

Hugging Face 发布了一套低成本微调方案,使用 TRL 库和 GRPO 算法在 100 个训练步内显著提升小模型的结构化输出合规性。实验基于约 500 条样本对 LFM2.5-350M 进行 LoRA 微调,在 IFStruct 基准上的整体通过率从 22.6% 提升至 29.7%,其中 JSON 格式通过率从 18.0% 跃升至 31.9%。

推荐理由

教程展示了如何在免费 GPU 上仅用百步强化学习微调端侧小模型,为端侧结构化提取任务提供了低成本可复现方案。

来源:Hugging Face · huggingface.co