跳到正文

#推理

今日 1 条
今天10月3日周六
10月2日周五
  1. LINUX DO 最新25

    GPT 降智或再创新高

    用户在最新知识测试中发现 GPT 出现性能波动与降智迹象。测试显示,其一个账号在 high 思考强度下已无法答对相关测试题,需提升至 xhigh 强度才能答对,而另一个账号在 high 强度下仍能做对。与此同时,测试中两个账号的 web 模式均宣告失败。

  2. Latent Space67

    Latent Space 对话 MIT Alex Zhang:探讨递归语言模型与智能体系统设计

    Latent Space 专访 MIT 学者 Alex Zhang,深入探讨了递归语言模型(RLM)的核心机制与智能体运行架(Harness)设计。Alex 指出当前大模型多被原始系统包裹而未充分发挥能力,RLM 通过上下文卸载与基于代码的程序化子智能体调用,能实现跨任务的组合泛化并优化推理延迟。此外,访谈还探讨了 AI 生成 GPU 算子的验证瓶颈以及未来大模型演化为隐式多智能体集群的可能性。

10月1日周四
  1. Google DeepMind82

    Google DeepMind 发布前沿模型 Gemini 4 Argon

    Google DeepMind 宣布推出新前沿模型 Gemini 4 Argon,重点强化长程复杂工作流推理、软件工程与网络安全防御能力。该模型将输出 token 上限从 64K 提升至 1M,在 DeepSWE v1.1 评测中达到 77.9%,上线尝鲜定价为每百万输入 tokens 2 美元、输出 tokens 10 美元(缓存输入优惠 95%)。

    推荐理由:官方披露了将输出上限扩至1M tokens的技术指标与内部工程迁移实测数据,便于评估长程任务执行能力。

9月30日周三
9月29日周二
  1. Simon Willison84

    Anthropic 发布 Claude Sonnet 5.5 并上线免费层

    Anthropic 正式推出 Claude Sonnet 5.5,官方称其运行速度提升 30% 以上且成本更低,并已直接作为 claude.ai 免费层的使用模型。实测显示其在部分编码任务上表现接近 Opus 5.5,但在极高思考模式下可能消耗大量 token 导致输出中断;官方同时确认 Haiku 5.5 将在未来几周内推出。

    推荐理由:Anthropic 将新模型直接下放到免费层,实测展示了其思考模式下的成本表现,为评估免费端生产力提供了参考。

9月25日周五
  1. Latent Space29

    [AINews] Latent Space 的未来规划

    Latent Space 宣布将推出 AINews v3 并合并 Discord 社区与时讯,同时探索迁移至 Beehiiv 以转型为多节目内容网络。本期时讯还汇总了最新前沿模型进展,涵盖 Claude Opus 5.5 以 88.4% 领跑 SimpleBench、MIT 开源全模态模型 Xiaomi MiMo-V2.6-Pro,以及决策模型 TypeSafe Jev 等。

9月23日周三
  1. Latent Space84

    Anthropic 发布 Claude Opus 5.5 与 OpenAI 推出 GPT-6 Sol,大模型 API 迎来降价潮

    Anthropic 正式推出 Claude 5.5 系列首款模型 Claude Opus 5.5,具备接近 Fable 5.1 的能力且单任务成本号称降低约 40%,OpenAI 也随即推出降价 50% 的 GPT-6 Sol 与 Luna。

    推荐理由:文章系统梳理了两款新模型的基准表现与 token 计费细节,读者可以借此评估高强度推理下的真实成本变化与架构选型。

9月22日周二
  1. Latent Space73

    小米发布 MiMo-V2.6-Pro 开源全模态模型,以约 300 万美元完成强化学习训练

    小米发布 MiMo-V2.6 系列原生全模态开源大模型,其中旗舰款 MiMo-V2.6-Pro 拥有 1.02T 总参数和 42B 激活参数,并在 Artificial Analysis 评测中登顶开源权重榜首。该模型采用 MIT 协议开源,强化学习阶段耗时 130 小时、耗资约 260 万美元,团队采用全异步架构和最高 1M 上下文训练,并承诺开源相关训练套件与数千个强化学习环境。

  2. Latent Space69

    Latent Space 对话 TypeSafe AI 创始人 Diogo Almeida:解读系统 1 模型 Jev 与 RLCD 技术路线

    TypeSafe AI 创始人 Diogo Almeida 在 Latent Space 播客中解读了新发布的模型 Jev,阐述其面向软件调用而非聊天助手的定位。他认为当前依赖 RLHF 与 RLVR 的大模型存在校准与拒答问题,Jev 采用面向校准决策的强化学习(RLCD)及纯合成数据,旨在为软件自动化提供高可靠性、高性价比的系统 1 认知原语。

9月9日周三
9月3日周四
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 正式推出 Gemini 3.8 Flash 与专用于网络安全的 Gemini 3.8 Flash Cyber,在维持与 3.7 Flash 相同速率及价格(每百万输入 token $0.75、输出 $3.75)的前提下显著提升了软件工程和复杂推理能力。

    推荐理由:新模型在维持低成本的同时强化了自主编码与网络防御能力,适合需要多步推理且看重成本效益的开发者评估落地。

9月2日周三
  1. Hugging Face54

    AllenAI 推出 BenchMIRT:基于多维项目反应理论审计大语言模型评测基准

    AllenAI 推出基准审计方法 BenchMIRT,引入心理测量学中的多维项目反应理论(MIRT),在单题层级拆解大语言模型评测实际考察的底层能力。基于 100 个大模型在 16 个基准、逾 3.4 万道题目上的表现,该工具无需预设标签即独立析出安全与通用推理两个主维度,发现 BBQ、WMDP 等安全评测实际与通用推理高度关联。

8月25日周二
  1. Hugging Face45

    Quantization-Aware Healing:4-bit 压缩模型性能反超全精度版本

    研究团队提出 Quantization-Aware Healing(QAH)方法,使经结构压缩与 4-bit 量化的大模型性能反超其全精度版本。在将 GPT-OSS 120B 压缩至 60B 并量化至 MXFP4 的实验中,QAH 模型在 9 个基准测试中有 7 个击败对应的 bfloat16 版本。该方法直接从原始全尺寸模型蒸馏,并通过分块损失支持 32k tokens 上下文修复。

8月14日周五
  1. Hugging Face82

    Hugging Face 发布 2026 年夏季开源模型观察报告

    Hugging Face 发布 2026 年夏季开源模型生态报告,总结了 1 至 8 月平台公开模型库增至 2.96 百万个背景下的关键趋势。数据显示关注度与实际工程采用存在明显分化,千问(Qwen)以超过 15 万个衍生模型成为社区的核心基座模型,中国机构在开源超大参数规模上持续推进且开源许可整体更宽松。

    推荐理由:结合平台真实下载与衍生数据,梳理了开源生态中关注度与实际工程落地的显著脱节,为技术选型和生态布局提供了客观参照。

8月13日周四
7月29日周三
7月15日周三
6月18日周四
6月5日周五
5月7日周四
  1. OpenAI68

    OpenAI 在 API 中推出新实时语音模型

    OpenAI 在 API 中推出全新实时语音模型,具备链式推理、翻译和语音转录能力。该模型旨在帮助开发者构建更自然、更智能的实时语音交互体验。

    推荐理由:新模型将推理能力直接融入实时语音交互,为构建低延迟自然语音应用提供了直接入口。

4月15日周三
  1. Hugging Face51

    深入剖析 VAKRA 基准:AI 智能体的推理、工具调用与失效模式

    IBM Research 详解了面向企业级 AI 智能体的可执行评测基准 VAKRA,用于评估智能体跨 API 与文档的多步复合推理能力。该基准覆盖商业智能 API 链式调用、工具选择、多跳推理及策略约束多源推理四大任务,依托 62 个领域的 8,000 多个本地 API。实验显示主流模型在长链调用、参数填充及外部策略约束下表现明显下滑。

4月13日周一
  1. Google DeepMind71

    Google DeepMind 发布 Gemini Robotics-ER 1.6:增强具身空间推理与仪表读取能力

    Google DeepMind 推出专为机器人设计的具身推理模型 Gemini Robotics-ER 1.6,大幅增强了空间推理、多视角理解、任务成功检测与复杂仪器读数能力。

    推荐理由:该模型强化了多视角空间指向与工业仪表识别能力,为实体机器人在复杂工业场景中的自主感知和规划提供了可落地的工具调用方案。

3月18日周三
  1. Google DeepMind51

    Google DeepMind 提出评估 AGI 进展的认知能力框架

    Google DeepMind 发布新论文提出测量 AGI 进展的认知分类框架,并联合 Kaggle 设立 20 万美元奖金池启动评测黑客松。该框架从认知科学等领域提炼出感知、注意、学习、记忆、推理、元认知、执行功能与社会认知等 10 项核心能力,采用留出测试集和人类基线对比的三阶段协议评估模型。

3月16日周一
3月9日周一
3月6日周五
3月5日周四
  1. OpenAI66

    OpenAI 研究发现推理模型难以控制思维链,有助于提升安全可监控性

    OpenAI 提出评估框架 CoT-Control,研究发现推理模型难以自主控制自身的思维链(Chain of Thought)。这一特性表明模型的思考过程难以被刻意伪装或隐藏,从而强化了将思维链可监控性作为 AI 安全防线的有效性。

    推荐理由:研究通过评估发现推理模型难以自主隐匿或操纵思维链,说明思维链监控能作为可靠的 AI 安全监督手段。

3月4日周三
  1. Google DeepMind79

    Google DeepMind 发布 Gemini 3.1 Flash-Lite

    Google DeepMind 推出面向大规模高吞吐工作流的模型 Gemini 3.1 Flash-Lite,已在 Google AI Studio 和 Vertex AI 开启预览。

    推荐理由:原文提供了具体的定价、推理速度提升倍数和基准测试分数,读者可以据此评估高并发任务中的成本与性能权衡。

2月20日周五
  1. Hugging Face81

    GGML 与 llama.cpp 团队加入 Hugging Face

    GGML 与 llama.cpp 团队宣布正式加入 Hugging Face,双方将合作推进本地 AI 与端侧推理技术。Georgi Gerganov 团队将继续全职维护 llama.cpp 并保持技术方向与社区治理的完全自主,项目保持 100% 开源。后续双方将重点实现从 Transformers 库向 llama.cpp 的近乎一键式模型交付,并优化 GGML 生态的打包与部署体验。

    推荐理由:这标志着开源模型生态与端侧推理核心基础设施深度绑定,有助于消除新模型从定义到本地运行的技术断层。

  2. Google DeepMind80

    Google 发布 Gemini 3.1 Pro

    Google 推出新一代核心推理模型 Gemini 3.1 Pro,主打面向复杂任务的高级问题解决能力。在评估新逻辑模式解决能力的 ARC-AGI-2 基准中,该模型取得 77.1% 的验证得分,推理表现达到 3 Pro 的两倍以上。

    推荐理由:该模型在 ARC-AGI-2 基准上实现了相比前代翻倍的推理得分,读者可据此评估其在复杂逻辑与智能体工作流中的落地表现。

2月10日周二
  1. Google DeepMind75

    Google DeepMind 利用 Gemini Deep Think 加速数学与科学发现

    Google DeepMind 发表两篇论文,展示 Gemini Deep Think 结合智能体工作流在数学、物理与计算机科学专业研究中的应用成果。团队基于该模式构建了具备自然语言验证和检索能力的数学研究智能体 Aletheia,已实现全自主生成算术几何论文并解答多项 Erdős 猜想。

    推荐理由:展示了推理模型结合自然语言验证与搜索的智能体架构,为将大模型引入前沿科学研究提供了可复用的人机协作路径。

1月27日周二
1月6日周二