跳到正文

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

最新精选

第 41–60 条 · 共 60 条
9月10日周三
  1. Hugging Face67

    Jupyter Agent:训练大语言模型在 Notebook 中进行推理

    Hugging Face 开源了 Jupyter Agent 系列成果,通过精简脚手架与高质量代码执行轨迹微调,让小模型能够在 Jupyter Notebook 环境中自主推理与执行数据科学任务。

    推荐理由:展示了如何通过极简脚手架与真实代码执行轨迹合成训练数据,帮助轻量模型提升复杂数据分析任务的执行表现。

8月21日周四
  1. Hugging Face66

    NVIDIA 发布 600 万条多语言推理数据集与 Nemotron Nano 2 9B 模型

    NVIDIA 开源了包含 600 万条样本的 Nemotron 后训练多语言推理数据集,并推出 9B 参数的 Nemotron Nano 2 端侧模型。该数据集将提示词和回答翻译至法、德、意、日、西五种语言并保留英文链式推理,通过逐行翻译与输出格式标记过滤幻觉数据。

    推荐理由:原文公开了基于开源大模型构建多语言推理数据的格式约束与过滤方案,为合成数据清洗提供了实用参考。

8月7日周四
  1. OpenAI89

    OpenAI 面向开发者推出 GPT-5 API

    OpenAI 正式在 API 平台面向开发者推出 GPT-5。该模型具备高推理性能,为开发者提供了新的控制项,并在实际编码任务中表现突出。

    推荐理由:官方在 API 平台面向开发者推出 GPT-5,重点突出推理能力、开发者控制项以及真实编程任务表现。

  2. OpenAI92

    OpenAI GPT-5 系统卡

    OpenAI 发布 GPT-5 系统卡(System Card),介绍了支撑快速与高智能响应的统一模型路由系统。该系统通过调度 gpt-5-main、gpt-5-thinking 以及轻量级的 gpt-5-thinking-nano 等不同模型版本,针对多样化任务需求与开发者场景进行了定向优化。

    推荐理由:该文档说明了多版本模型的统一路由机制,便于开发者了解其在不同任务负载下的分发策略与适配方案。

8月5日周二
  1. Hugging Face93

    OpenAI 发布开源模型家族 GPT OSS,Hugging Face 全面支持部署与微调

    OpenAI 正式发布开源开放权重模型家族 GPT OSS,包含 117B 参数的 gpt-oss-120b 和 21B 参数的 gpt-oss-20b 两款 MoE 架构纯文本推理模型,采用 Apache 2.0 许可证。

    推荐理由:原文详细梳理了该系列模型的量化方案、显存门槛以及在主流推理框架中的适配方法,适合需要本地部署或微调的开发者参考。

  2. OpenAI84

    OpenAI 发布 gpt-oss-120b 与 gpt-oss-20b 模型卡

    OpenAI 推出 gpt-oss-120b 和 gpt-oss-20b 两款开源权重推理模型。两款模型在 Apache 2.0 许可证和 gpt-oss 使用政策下分发,并公开了对应的模型卡文档。

    推荐理由:OpenAI 开放了两款不同参数规模的开源权重推理模型并采用 Apache 2.0 协议,为本地部署与推理研究提供了新选择。

  3. OpenAI76

    OpenAI 发布开源权重模型 gpt-oss-120b 与 gpt-oss-20b

    OpenAI 正式发布开源权重语言模型 gpt-oss-120b 与 gpt-oss-20b,采用 Apache 2.0 许可证。两款模型在同尺寸开源模型的推理任务中表现更优,具备强大的工具调用能力,并针对消费级硬件上的高效部署进行了优化。

    推荐理由:模型采用宽松开源协议并在消费级硬件优化部署,为开发者低成本构建兼具推理与工具调用能力的本地应用提供了参考。

  4. Hugging Face64

    在 DeepResearch Bench 上评测开源 Llama Nemotron 模型

    NVIDIA 的 AI-Q 深度研究智能体在 DeepResearch Bench 的搜索增强大语言模型榜单中取得 40.52 的总分,位列完全开源架构榜首。

    推荐理由:文章呈现了开源大模型结合检索架构在深度研究基准上的实测表现,为构建本地可部署的智能体工作流提供了参数选型与评测参考。

7月8日周二
  1. Hugging Face76

    Hugging Face 开源 3B 推理模型 SmolLM3 并公布完整训练配方

    Hugging Face 正式发布完全开源的 3B 规模模型 SmolLM3,包含基础模型与支持双模式推理的指令微调版本,并同步公开了完整训练配方。该模型在 11.2T token 上训练完成,支持英法德意西葡 6 种语言,并利用 NoPE 和 YaRN 将推理上下文扩展至最高 128k。

    推荐理由:原文完整公开了小模型三阶段预训练与双模式推理的工程配方,为轻量端侧模型的复现与训练优化提供了可迁移参考。

5月23日周五
  1. OpenAI76

    OpenAI Operator 底层模型升级为 o3

    OpenAI 宣布将智能体产品 Operator 原有的 GPT-4o 底层模型替换为基于 OpenAI o3 的版本。此外,Operator 的 API 版本仍将继续基于 GPT-4o 运行。

    推荐理由:原文明确了 Operator 智能体底座切换为推理模型 o3 且 API 维持原状的调整,可作为跟踪其落地形态的参考。

4月30日周三
  1. Hugging Face66

    深入解析 Qwen-3 对话模板带来的 4 个关键设计变化

    Qwen-3 采用了相比前代更加复杂的 Jinja 对话模板,展示了针对推理与智能体工作流的多项底层设计演进。模板通过 enable_thinking 参数实现链式推理的自由开关,并引入滚动检查点机制在多步工具调用中按需保留或裁剪思考标记。此外,Qwen-3 改进了工具参数的 JSON 序列化检查并去除了默认系统提示词。

    推荐理由:原文通过拆解对话模板的工程实现,展示了推理模型在工具调用与思考上下文管理上的演进思路。

4月16日周三
  1. OpenAI85

    OpenAI 发布 o3 与 o4-mini 系统卡

    OpenAI 发布 o3 与 o4-mini 的系统卡,展示两款模型在前沿推理能力基础上结合完整工具链的实际表现。模型支持网页浏览、Python、图像与文件分析、图像生成、canvas、自动化、文件搜索以及记忆功能。

    推荐理由:系统卡展示了模型在深度推理与全套工具链结合下的能力边界,有助于读者评估复杂任务的工作流集成路径。

1月31日周五
  1. Hugging Face79

    Mini-R1:基于 GRPO 和数字倒计时游戏复现 DeepSeek-R1 顿悟时刻的强化学习教程

    作者通过 TRL、DeepSpeed 和 vLLM 在 4 张 NVIDIA H100 GPU 上运用 GRPO 算法微调 Qwen2.5-3B-Instruct,复现了类似 DeepSeek-R1 的纯强化学习自我验证顿悟现象。

    推荐理由:教程展示了用轻量开源方案跑通纯强化学习自我验证的可迁移流水线,有助于开发者评估小模型复现长链思考的算力与策略门槛。

1月28日周二
  1. Hugging Face67

    Hugging Face 启动 Open-R1 项目:全面开源复现 DeepSeek-R1

    Hugging Face 宣布启动 Open-R1 项目,旨在全面复现并开源 DeepSeek-R1 未公开的训练代码、数据集及完整管线。项目分为三步推进:首先通过 DeepSeek-R1 蒸馏高质量推理数据以复现轻量模型,随后构建大规模数学、代码与推理数据以复现类似 R1-Zero 的纯强化学习管线,最后打通从基座模型到 SFT 再到强化学习的多阶段训练。

    推荐理由:Hugging Face 启动开源复现项目,旨在补齐 DeepSeek-R1 未公开的训练代码与数据集构建细节。

12月20日周五
  1. OpenAI66

    OpenAI 推出审思对齐策略:利用推理能力提升语言模型安全性

    OpenAI 推出面向 o1 模型的新对齐策略“审思对齐”(Deliberative alignment)。该策略直接向模型传授安全规范,并训练其基于这些规范进行链式推理,从而构建更加安全的大语言模型。

    推荐理由:原文介绍了利用模型推理能力学习安全规范的新对齐策略,有助于读者理解思考型模型的安全防护机制。

7月11日周四
  1. Hugging Face74

    Numina 与 Hugging Face 详解 NuminaMath 赢得首届 AIMO 进展奖的技术方案

    Numina 与 Hugging Face 合作开发的 NuminaMath 7B TIR 在首届 AI 数学奥林匹克竞赛(AIMO)进展奖中夺冠,并在私有测试集上解出 29/50 道题目。

    推荐理由:文章提供了在受限推理算力下结合工具调用与多阶段微调的完整工程方案,适合需要优化推理模型落地表现的团队参考。

4月16日周二
  1. Hugging Face68

    Hugging Face 推出 LiveCodeBench 排行榜:无污染的代码大模型综合评测

    Hugging Face 推出基于 LiveCodeBench 的代码大模型评测排行榜,通过持续收集竞赛编程平台题目并标注发布日期,实现按时间窗口评估以防范测试集污染。

    推荐理由:基准通过按发布时间切片和多场景评测应对数据污染,为评估代码大模型的真实泛化能力提供了动态参照体系。

5月11日周四
  1. Hugging Face79

    Hugging Face 推出 Assisted Generation 解码方案以降低文本生成延迟

    Hugging Face 在 Transformers 库中引入 Assisted Generation 解码方法,利用轻量辅助模型生成候选 token 并由主模型单次前向传播并行确认,以此缓解内存带宽瓶颈并降低生成延迟。

    推荐理由:读者可以了解利用小模型生成候选与大模型并行验证的机制,在消费级硬件及显存卸载场景下显著降低推理延迟。

2月2日周三
  1. OpenAI62

    OpenAI 研发 Lean 神经定理证明器并求解部分奥数题

    OpenAI 构建了一个面向 Lean 的神经定理证明器,成功学会求解多种具有挑战性的高中数学奥赛题。该系统能够解答来自 AMC12 和 AIME 竞赛的题目,以及两道改编自国际数学奥林匹克(IMO)的试题。

    推荐理由:原文展示了基于 Lean 形式化语言解决竞赛级数学题的方法,为自动化定理证明与复杂逻辑推理提供了参考。