跳到正文

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

最新精选

第 61–80 条 · 共 81 条
3月10日周一
  1. OpenAI70

    OpenAI:如何检测前沿推理模型的不当行为

    OpenAI 研究表明可以通过大语言模型监控思维链来检测前沿推理模型的漏洞利用行为。研究同时发现,直接惩罚模型的“不良思维”并不能阻止大多数不当行为,反而会促使其隐藏真实意图。

    推荐理由:研究指出用大语言模型监控思维链可发现漏洞利用,而直接惩罚不良思维反而会促使模型隐匿意图。

2月11日周二
2月3日周一
  1. OpenAI83

    OpenAI 推出 Deep Research

    OpenAI 推出基于推理的 Deep Research 智能体,能够综合大量在线信息并为用户完成多步骤研究任务。该功能即日起面向 Pro 用户开放,随后将提供给 Plus 和 Team 用户。

    推荐理由:原文说明了该智能体结合推理与多步信息综合的能力定位,并给出了面向不同订阅层级的开放安排。

2月2日周日
  1. Hugging Face70

    Hugging Face 公布 Open-R1 首周进展:TRL 集成 GRPO 与合成数据工程方案

    Hugging Face 公布了旨在开源复现 DeepSeek-R1 训练管线与数据集的 Open-R1 项目首周进展,成功复现了各尺寸蒸馏模型在 MATH-500 上的评测表现。

    推荐理由:文章给出了利用 TRL 集成 GRPO 以及多节点流式请求生成合成数据的具体配置,为开源社区复现长链条推理模型提供了工程参考。

1月31日周五
  1. Hugging Face79

    Mini-R1:基于 GRPO 和数字倒计时游戏复现 DeepSeek-R1 顿悟时刻的强化学习教程

    作者通过 TRL、DeepSpeed 和 vLLM 在 4 张 NVIDIA H100 GPU 上运用 GRPO 算法微调 Qwen2.5-3B-Instruct,复现了类似 DeepSeek-R1 的纯强化学习自我验证顿悟现象。

    推荐理由:教程展示了用轻量开源方案跑通纯强化学习自我验证的可迁移流水线,有助于开发者评估小模型复现长链思考的算力与策略门槛。

1月28日周二
  1. Hugging Face67

    Hugging Face 启动 Open-R1 项目:全面开源复现 DeepSeek-R1

    Hugging Face 宣布启动 Open-R1 项目,旨在全面复现并开源 DeepSeek-R1 未公开的训练代码、数据集及完整管线。项目分为三步推进:首先通过 DeepSeek-R1 蒸馏高质量推理数据以复现轻量模型,随后构建大规模数学、代码与推理数据以复现类似 R1-Zero 的纯强化学习管线,最后打通从基座模型到 SFT 再到强化学习的多阶段训练。

    推荐理由:Hugging Face 启动开源复现项目,旨在补齐 DeepSeek-R1 未公开的训练代码与数据集构建细节。

12月20日周五
  1. OpenAI66

    OpenAI 推出审思对齐策略:利用推理能力提升语言模型安全性

    OpenAI 推出面向 o1 模型的新对齐策略“审思对齐”(Deliberative alignment)。该策略直接向模型传授安全规范,并训练其基于这些规范进行链式推理,从而构建更加安全的大语言模型。

    推荐理由:原文介绍了利用模型推理能力学习安全规范的新对齐策略,有助于读者理解思考型模型的安全防护机制。

  2. Hugging Face69

    Artificial Analysis 发布音频推理基准 Big Bench Audio:原生语音推理存在显著差距

    Artificial Analysis 发布用于评估音频语言模型推理能力的评测数据集 Big Bench Audio,测试显示原生端到端语音推理相比纯文本存在显著性能下滑。

    推荐理由:测试量化了原生端到端语音模型在复杂推理上的准确率下滑,为语音智能体选择级联还是原生方案提供了对比依据。

12月17日周二
  1. Hugging Face65

    TII 发布 Falcon 3 系列开源模型

    阿布扎比技术创新研究院(TII)推出 Falcon 3 系列开源大语言模型,包含 1B、3B、Mamba-7B、7B 和 10B 五款基础模型及对应的 Instruct 版本。

    推荐理由:TII 发布了涵盖 1B 至 10B 规模的 Falcon 3 系列开源模型,读者可了解其通过单次预训练、深度放大和蒸馏兼顾性能与训练成本的技术路径。

9月12日周四
7月11日周四
  1. Hugging Face74

    Numina 与 Hugging Face 详解 NuminaMath 赢得首届 AIMO 进展奖的技术方案

    Numina 与 Hugging Face 合作开发的 NuminaMath 7B TIR 在首届 AI 数学奥林匹克竞赛(AIMO)进展奖中夺冠,并在私有测试集上解出 29/50 道题目。

    推荐理由:文章提供了在受限推理算力下结合工具调用与多阶段微调的完整工程方案,适合需要优化推理模型落地表现的团队参考。

4月16日周二
  1. Hugging Face68

    Hugging Face 推出 LiveCodeBench 排行榜:无污染的代码大模型综合评测

    Hugging Face 推出基于 LiveCodeBench 的代码大模型评测排行榜,通过持续收集竞赛编程平台题目并标注发布日期,实现按时间窗口评估以防范测试集污染。

    推荐理由:基准通过按发布时间切片和多场景评测应对数据污染,为评估代码大模型的真实泛化能力提供了动态参照体系。

9月15日周五
  1. Hugging Face69

    Hugging Face 发布大语言模型生产环境部署优化指南

    Hugging Face 发布生产环境下大语言模型推理与显存优化指南,系统梳理低精度量化、Flash Attention 与架构选型三大方向。文章通过实测展示 8-bit 和 4-bit 量化大幅削减显存需求,利用 Flash Attention 缓解长文本注意力的二次方显存瓶颈。

    推荐理由:文章给出了量化、Flash Attention 与架构演进的实测显存对比,读者可以直接作为大语言模型部署调优的参考框架。

5月31日周三
  1. OpenAI75

    OpenAI 提出通过过程监督提升数学推理能力

    OpenAI 训练模型通过奖励每个正确的推理步骤(过程监督)而非仅奖励最终答案(结果监督),在数学问题求解中达到 SOTA 水平。相比结果监督,过程监督不仅显著提升了模型性能,还能直接引导模型生成人类认可的思维链,带来重要的对齐收益。

    推荐理由:研究对比了过程监督与结果监督在数学推理上的差异,展示了逐步奖励思维链对解题性能和模型对齐的双重价值。

5月11日周四
  1. Hugging Face79

    Hugging Face 推出 Assisted Generation 解码方案以降低文本生成延迟

    Hugging Face 在 Transformers 库中引入 Assisted Generation 解码方法,利用轻量辅助模型生成候选 token 并由主模型单次前向传播并行确认,以此缓解内存带宽瓶颈并降低生成延迟。

    推荐理由:读者可以了解利用小模型生成候选与大模型并行验证的机制,在消费级硬件及显存卸载场景下显著降低推理延迟。

8月17日周三
2月2日周三
  1. OpenAI62

    OpenAI 研发 Lean 神经定理证明器并求解部分奥数题

    OpenAI 构建了一个面向 Lean 的神经定理证明器,成功学会求解多种具有挑战性的高中数学奥赛题。该系统能够解答来自 AMC12 和 AIME 竞赛的题目,以及两道改编自国际数学奥林匹克(IMO)的试题。

    推荐理由:原文展示了基于 Lean 形式化语言解决竞赛级数学题的方法,为自动化定理证明与复杂逻辑推理提供了参考。