Mini-R1:基于 GRPO 和数字倒计时游戏复现 DeepSeek-R1 顿悟时刻的强化学习教程
作者通过 TRL、DeepSpeed 和 vLLM 在 4 张 NVIDIA H100 GPU 上运用 GRPO 算法微调 Qwen2.5-3B-Instruct,复现了类似 DeepSeek-R1 的纯强化学习自我验证顿悟现象。
推荐理由:教程展示了用轻量开源方案跑通纯强化学习自我验证的可迁移流水线,有助于开发者评估小模型复现长链思考的算力与策略门槛。
作者通过 TRL、DeepSpeed 和 vLLM 在 4 张 NVIDIA H100 GPU 上运用 GRPO 算法微调 Qwen2.5-3B-Instruct,复现了类似 DeepSeek-R1 的纯强化学习自我验证顿悟现象。
推荐理由:教程展示了用轻量开源方案跑通纯强化学习自我验证的可迁移流水线,有助于开发者评估小模型复现长链思考的算力与策略门槛。
OpenAI 最新推理模型系列将提供给美国顶尖科学家使用,用于推动前沿科学突破。该计划通过与美国国家实验室展开合作,旨在进一步强化美国在 AI 领域的领先地位。
Hugging Face 宣布启动 Open-R1 项目,旨在全面复现并开源 DeepSeek-R1 未公开的训练代码、数据集及完整管线。项目分为三步推进:首先通过 DeepSeek-R1 蒸馏高质量推理数据以复现轻量模型,随后构建大规模数学、代码与推理数据以复现类似 R1-Zero 的纯强化学习管线,最后打通从基座模型到 SFT 再到强化学习的多阶段训练。
推荐理由:Hugging Face 启动开源复现项目,旨在补齐 DeepSeek-R1 未公开的训练代码与数据集构建细节。
OpenAI 推出面向 o1 模型的新对齐策略“审思对齐”(Deliberative alignment)。该策略直接向模型传授安全规范,并训练其基于这些规范进行链式推理,从而构建更加安全的大语言模型。
推荐理由:原文介绍了利用模型推理能力学习安全规范的新对齐策略,有助于读者理解思考型模型的安全防护机制。
Hugging Face 介绍了基于 LayerSkip 的自推测解码技术,并在 transformers 库中通过 assistant_early_exit 参数支持单模型早退加速生成。
Intel Labs 与 Hugging Face 联合推出通用辅助生成(UAG),突破传统辅助生成对分词器一致的限制,允许任意小模型为不同架构的大模型加速,已在 Transformers 4.46.0 中上线。
量子物理学家 Mario Krenn 使用 OpenAI o1 辅助解答重大科学问题,探索量子物理领域的关键疑问。
Cognition 联合创始人兼 CEO Scott Wu 解析了 OpenAI o1 在编程任务中的表现,阐述该模型如何以更贴近人类开发者的方式进行代码决策。
OpenAI 探讨通过证明者-验证者博弈(Prover-Verifier Games)提升语言模型输出的可读性。该方法使 AI 解决方案更加清晰、更易于验证,从而让人类与机器都能更好地信任模型输出。
Numina 与 Hugging Face 合作开发的 NuminaMath 7B TIR 在首届 AI 数学奥林匹克竞赛(AIMO)进展奖中夺冠,并在私有测试集上解出 29/50 道题目。
推荐理由:文章提供了在受限推理算力下结合工具调用与多阶段微调的完整工程方案,适合需要优化推理模型落地表现的团队参考。
Color Health 联合 OpenAI 推出 Cancer Copilot 应用,利用 GPT-4o 加速癌症患者获得治疗。该应用通过识别缺失的诊断信息并生成定制化检查方案,协助医务人员在癌症筛查与治疗中做出循证决策。
Hugging Face 在 Optimum Habana 中为 Intel Gaudi 处理器适配并优化了辅助生成(Assisted Generation)技术。该方案结合量化与 KV cache 支持推测采样,在保证与自回归采样相同质量的前提下,在大型 Transformer 模型上通常可实现约 2x 的生成加速,用户配置 assistant_model 参数即可启用。
Hugging Face 详解了 Text Generation Inference(TGI)内置的基准测试工具 TGI Benchmarking tool,用于综合评估大语言模型推理中的吞吐量与延迟权衡。该工具支持分析首字延迟(TTFT)以及预填充与解码阶段的性能表现,帮助用户针对不同并发场景优化部署配置。开发者可在 Hugging Face Space 中通过 CLI 快速运行该评测。
Hugging Face 在 Transformers 库中集成了 KV Cache 量化功能,可大幅降低大语言模型长文本生成时的显存占用。该功能基于 quanto 与 HQQ 后端支持 int2、int4 和 int8 精度,其中 int4 精度可节省约 2.5 倍显存且模型困惑度与原版 fp16 相当。
Hugging Face 推出 Open CoT Leaderboard,用于评估大语言模型在复杂推理任务中生成有效思维链(CoT)的能力。与传统基准不同,该榜单以引入 CoT 前后的准确率增益(Δ)作为核心指标,以此检验 CoT 对模型精度的真实影响并降低数据污染干扰。评测基于 LogiQA 与 LSAT 数据集,目前支持 Classic 和 Reflect 两种提示策略。
Hugging Face 推出基于 LiveCodeBench 的代码大模型评测排行榜,通过持续收集竞赛编程平台题目并标注发布日期,实现按时间窗口评估以防范测试集污染。
推荐理由:基准通过按发布时间切片和多场景评测应对数据污染,为评估代码大模型的真实泛化能力提供了动态参照体系。
加州大学洛杉矶分校(UCLA)研究人员推出富文本视觉推理评测数据集 ConTextual 及排行榜,涵盖导航、信息图表等 8 类场景共 506 条高难度指令。首期实验测试了 GPT-4V、Gemini-Vision-Pro 和 LLaVA-1.5-13B 等 13 个模型,显示当前多模态模型整体表现明显弱于人类。表现最佳的 GPT-4V 虽在抽象推理上超越人类,但在时间读取等任务上仍显吃力。
Hugging Face 推出大语言模型推理评估基准及排行榜 NPHardEval,包含覆盖 P 到 NP-hard 复杂度的 900 道算法题。该基准排除数值计算并按月动态更新以防过拟合,采用加权准确率(WA)与失败率(FR)评估纯逻辑推理。测试显示 GPT 4 Turbo 综合表现最佳,开源模型中 Yi-34b、Qwen-14b、Phi-2 和 Mistral-7b 处于领先水平。
Hugging Face 发布了在 Amazon SageMaker 上使用其专用推理容器部署 Llama 2 的全面基准评测,覆盖 3 种模型尺寸、多种 EC2 实例及并发等级共 60 种配置。
Hugging Face 在 Transformers 库中引入 Assisted Generation 解码方法,利用轻量辅助模型生成候选 token 并由主模型单次前向传播并行确认,以此缓解内存带宽瓶颈并降低生成延迟。
推荐理由:读者可以了解利用小模型生成候选与大模型并行验证的机制,在消费级硬件及显存卸载场景下显著降低推理延迟。
Hugging Face 的 Transformers 库现已支持在 TensorFlow 中使用 XLA 编译文本生成,推理速度最高可较以往提升 100x,甚至超越 PyTorch。该优化需配合 transformers >= 4.21.0 使用,并完全兼容贪婪解码、采样及 Beam Search 等常用生成参数控制。
OpenAI 构建了一个面向 Lean 的神经定理证明器,成功学会求解多种具有挑战性的高中数学奥赛题。该系统能够解答来自 AMC12 和 AIME 竞赛的题目,以及两道改编自国际数学奥林匹克(IMO)的试题。
推荐理由:原文展示了基于 Lean 形式化语言解决竞赛级数学题的方法,为自动化定理证明与复杂逻辑推理提供了参考。