跳到正文

#推理

今日 2 条
8月5日周二
  1. Hugging Face64

    在 DeepResearch Bench 上评测开源 Llama Nemotron 模型

    NVIDIA 的 AI-Q 深度研究智能体在 DeepResearch Bench 的搜索增强大语言模型榜单中取得 40.52 的总分,位列完全开源架构榜首。

    推荐理由:文章呈现了开源大模型结合检索架构在深度研究基准上的实测表现,为构建本地可部署的智能体工作流提供了参数选型与评测参考。

8月1日周五
7月10日周四
  1. Hugging Face56

    Numina 联合 Kimi 发布形式化推理模型 Kimina-Prover-72B

    Numina 与 Kimi 团队联合发布形式化定理证明模型 Kimina-Prover-72B 及其 8B、1.7B 蒸馏版本,在 miniF2F 基准测试中取得 92.2% 的通过率。模型基于 Qwen 架构并通过 Kimi k1.5 强化学习流程训练,引入测试时强化学习搜索框架以自主递归生成和复用引理。此外,系统集成了针对 Lean 报错信息的错误修复机制,显著提升了多轮证明迭代中的样本效率。

7月8日周二
  1. Hugging Face76

    Hugging Face 开源 3B 推理模型 SmolLM3 并公布完整训练配方

    Hugging Face 正式发布完全开源的 3B 规模模型 SmolLM3,包含基础模型与支持双模式推理的指令微调版本,并同步公开了完整训练配方。该模型在 11.2T token 上训练完成,支持英法德意西葡 6 种语言,并利用 NoPE 和 YaRN 将推理上下文扩展至最高 128k。

    推荐理由:原文完整公开了小模型三阶段预训练与双模式推理的工程配方,为轻量端侧模型的复现与训练优化提供了可迁移参考。

6月4日周三
  1. Hugging Face45

    在 nanoVLM 中从零实现 KV cache

    nanoVLM 代码库从零实现了 KV cache,使模型生成速度提升了 38%。该实现基于纯 PyTorch 开发,通过在注意力模块和语言模型中缓存已计算的键值(K 与 V),消除了自回归生成时全序列重复计算的冗余,将单步解码转化为轻量级的增量更新。

5月23日周五
  1. OpenAI76

    OpenAI Operator 底层模型升级为 o3

    OpenAI 宣布将智能体产品 Operator 原有的 GPT-4o 底层模型替换为基于 OpenAI o3 的版本。此外,Operator 的 API 版本仍将继续基于 GPT-4o 运行。

    推荐理由:原文明确了 Operator 智能体底座切换为推理模型 o3 且 API 维持原状的调整,可作为跟踪其落地形态的参考。

4月30日周三
  1. Hugging Face66

    深入解析 Qwen-3 对话模板带来的 4 个关键设计变化

    Qwen-3 采用了相比前代更加复杂的 Jinja 对话模板,展示了针对推理与智能体工作流的多项底层设计演进。模板通过 enable_thinking 参数实现链式推理的自由开关,并引入滚动检查点机制在多步工具调用中按需保留或裁剪思考标记。此外,Qwen-3 改进了工具参数的 JSON 序列化检查并去除了默认系统提示词。

    推荐理由:原文通过拆解对话模板的工程实现,展示了推理模型在工具调用与思考上下文管理上的演进思路。

4月16日周三
  1. OpenAI85

    OpenAI 发布 o3 与 o4-mini 系统卡

    OpenAI 发布 o3 与 o4-mini 的系统卡,展示两款模型在前沿推理能力基础上结合完整工具链的实际表现。模型支持网页浏览、Python、图像与文件分析、图像生成、canvas、自动化、文件搜索以及记忆功能。

    推荐理由:系统卡展示了模型在深度推理与全套工具链结合下的能力边界,有助于读者评估复杂任务的工作流集成路径。

2月27日周四
2月13日周四
2月4日周二
1月31日周五
  1. Hugging Face79

    Mini-R1:基于 GRPO 和数字倒计时游戏复现 DeepSeek-R1 顿悟时刻的强化学习教程

    作者通过 TRL、DeepSpeed 和 vLLM 在 4 张 NVIDIA H100 GPU 上运用 GRPO 算法微调 Qwen2.5-3B-Instruct,复现了类似 DeepSeek-R1 的纯强化学习自我验证顿悟现象。

    推荐理由:教程展示了用轻量开源方案跑通纯强化学习自我验证的可迁移流水线,有助于开发者评估小模型复现长链思考的算力与策略门槛。

1月30日周四
1月28日周二
  1. Hugging Face67

    Hugging Face 启动 Open-R1 项目:全面开源复现 DeepSeek-R1

    Hugging Face 宣布启动 Open-R1 项目,旨在全面复现并开源 DeepSeek-R1 未公开的训练代码、数据集及完整管线。项目分为三步推进:首先通过 DeepSeek-R1 蒸馏高质量推理数据以复现轻量模型,随后构建大规模数学、代码与推理数据以复现类似 R1-Zero 的纯强化学习管线,最后打通从基座模型到 SFT 再到强化学习的多阶段训练。

    推荐理由:Hugging Face 启动开源复现项目,旨在补齐 DeepSeek-R1 未公开的训练代码与数据集构建细节。

12月20日周五
  1. OpenAI66

    OpenAI 推出审思对齐策略:利用推理能力提升语言模型安全性

    OpenAI 推出面向 o1 模型的新对齐策略“审思对齐”(Deliberative alignment)。该策略直接向模型传授安全规范,并训练其基于这些规范进行链式推理,从而构建更加安全的大语言模型。

    推荐理由:原文介绍了利用模型推理能力学习安全规范的新对齐策略,有助于读者理解思考型模型的安全防护机制。

11月20日周三
10月29日周二
9月12日周四
7月17日周三
7月11日周四
  1. Hugging Face74

    Numina 与 Hugging Face 详解 NuminaMath 赢得首届 AIMO 进展奖的技术方案

    Numina 与 Hugging Face 合作开发的 NuminaMath 7B TIR 在首届 AI 数学奥林匹克竞赛(AIMO)进展奖中夺冠,并在私有测试集上解出 29/50 道题目。

    推荐理由:文章提供了在受限推理算力下结合工具调用与多阶段微调的完整工程方案,适合需要优化推理模型落地表现的团队参考。

6月17日周一
6月4日周二
  1. Hugging Face32

    Intel Gaudi 获得更快的辅助生成支持

    Hugging Face 在 Optimum Habana 中为 Intel Gaudi 处理器适配并优化了辅助生成(Assisted Generation)技术。该方案结合量化与 KV cache 支持推测采样,在保证与自回归采样相同质量的前提下,在大型 Transformer 模型上通常可实现约 2x 的生成加速,用户配置 assistant_model 参数即可启用。

5月29日周三
  1. Hugging Face46

    评测 Text Generation Inference(TGI)

    Hugging Face 详解了 Text Generation Inference(TGI)内置的基准测试工具 TGI Benchmarking tool,用于综合评估大语言模型推理中的吞吐量与延迟权衡。该工具支持分析首字延迟(TTFT)以及预填充与解码阶段的性能表现,帮助用户针对不同并发场景优化部署配置。开发者可在 Hugging Face Space 中通过 CLI 快速运行该评测。

5月16日周四
4月23日周二
  1. Hugging Face46

    Hugging Face 推出 Open CoT Leaderboard

    Hugging Face 推出 Open CoT Leaderboard,用于评估大语言模型在复杂推理任务中生成有效思维链(CoT)的能力。与传统基准不同,该榜单以引入 CoT 前后的准确率增益(Δ)作为核心指标,以此检验 CoT 对模型精度的真实影响并降低数据污染干扰。评测基于 LogiQA 与 LSAT 数据集,目前支持 Classic 和 Reflect 两种提示策略。

4月16日周二
  1. Hugging Face68

    Hugging Face 推出 LiveCodeBench 排行榜:无污染的代码大模型综合评测

    Hugging Face 推出基于 LiveCodeBench 的代码大模型评测排行榜,通过持续收集竞赛编程平台题目并标注发布日期,实现按时间窗口评估以防范测试集污染。

    推荐理由:基准通过按发布时间切片和多场景评测应对数据污染,为评估代码大模型的真实泛化能力提供了动态参照体系。

3月5日周二
  1. Hugging Face45

    ConTextual 发布:测试多模态大模型在富文本场景下的图文联合推理能力

    加州大学洛杉矶分校(UCLA)研究人员推出富文本视觉推理评测数据集 ConTextual 及排行榜,涵盖导航、信息图表等 8 类场景共 506 条高难度指令。首期实验测试了 GPT-4V、Gemini-Vision-Pro 和 LLaVA-1.5-13B 等 13 个模型,显示当前多模态模型整体表现明显弱于人类。表现最佳的 GPT-4V 虽在抽象推理上超越人类,但在时间读取等任务上仍显吃力。

2月2日周五
  1. Hugging Face49

    NPHardEval 排行榜:通过计算复杂度与动态更新揭示大语言模型推理能力

    Hugging Face 推出大语言模型推理评估基准及排行榜 NPHardEval,包含覆盖 P 到 NP-hard 复杂度的 900 道算法题。该基准排除数值计算并按月动态更新以防过拟合,采用加权准确率(WA)与失败率(FR)评估纯逻辑推理。测试显示 GPT 4 Turbo 综合表现最佳,开源模型中 Yi-34b、Qwen-14b、Phi-2 和 Mistral-7b 处于领先水平。

9月26日周二
5月11日周四
  1. Hugging Face79

    Hugging Face 推出 Assisted Generation 解码方案以降低文本生成延迟

    Hugging Face 在 Transformers 库中引入 Assisted Generation 解码方法,利用轻量辅助模型生成候选 token 并由主模型单次前向传播并行确认,以此缓解内存带宽瓶颈并降低生成延迟。

    推荐理由:读者可以了解利用小模型生成候选与大模型并行验证的机制,在消费级硬件及显存卸载场景下显著降低推理延迟。

7月27日周三
2月2日周三
  1. OpenAI62

    OpenAI 研发 Lean 神经定理证明器并求解部分奥数题

    OpenAI 构建了一个面向 Lean 的神经定理证明器,成功学会求解多种具有挑战性的高中数学奥赛题。该系统能够解答来自 AMC12 和 AIME 竞赛的题目,以及两道改编自国际数学奥林匹克(IMO)的试题。

    推荐理由:原文展示了基于 Lean 形式化语言解决竞赛级数学题的方法,为自动化定理证明与复杂逻辑推理提供了参考。