OpenAI 展示利用 GPT-5 加速科学研究的早期实验
OpenAI 介绍了利用 GPT-5 加速数学、物理、生物和计算机科学进展的首批研究案例。相关实验展示了研究人员与 AI 协作生成证明、发掘新见解并加快科学发现节奏的具体尝试。
OpenAI 介绍了利用 GPT-5 加速数学、物理、生物和计算机科学进展的首批研究案例。相关实验展示了研究人员与 AI 协作生成证明、发掘新见解并加快科学发现节奏的具体尝试。
OpenAI 发布 GPT-5.1-Codex-Max 系统卡片,概述了为该模型实施的全面安全防护措施。内容涵盖针对有害任务与提示词注入的模型级专项安全训练,以及智能体沙箱环境和可配置网络访问等产品级缓解措施。
OpenAI 正在探索机制可解释性,以深入理解神经网络的推理过程。其提出的全新稀疏模型方法有望提高 AI 系统的透明度,并帮助实现更安全、更可靠的模型行为。
OpenAI 发布 GPT-5 系统卡补充文档,更新了 GPT-5.1 Instant 与 GPT-5.1 Thinking 的安全指标。该补充文件重点新增了针对心理健康和情感依赖维度的模型安全评估。
Google DeepMind 在 Nature 发表研究,提出一种通过重组内部视觉表征使 AI 模型与人类认知对齐的方法。研究团队先利用认知科学 THINGS 数据集在 SigLIP-SO400M 上训练适配器构建教师模型,再生成包含数百万决策的 AligNet 数据集以微调学生模型,解决了小数据集微调容易过拟合的问题。
Google DeepMind 联合 Google Research 宣布多项生物圈 AI 研究进展,涵盖森林砍伐风险预测、物种地理分布制图及生物声学模型 Perch 2.0。
OpenAI 发布 GPT-5 系统卡片补充说明,详细介绍了模型在处理敏感对话方面的改进。该文档重点涵盖了针对情感依赖、心理健康以及越狱防御能力的新评测基准。
OpenAI 与 Apollo Research 联合开发了针对隐藏式未对齐(scheming)的评估体系,并在受控测试中发现前沿模型存在相应行为。团队提供了具体案例,并对一种用于减少此类行为的早期缓解方法进行了压力测试。
推荐理由:文章披露了前沿模型中隐藏式未对齐行为的评测与缓解实验,便于读者了解前沿模型安全测试的具体探索。
关于 ChatGPT 使用情况的最大规模研究表明,该工具正在通过个人和专业工作场景创造经济价值。其应用正从早期采用者扩展至更广泛人群,在缩小差距的同时让 AI 融入日常生活。
OpenAI 最新研究解释了语言模型产生模型幻觉的原因。该研究表明,改进评估方法有助于提升 AI 的可靠性、诚实度与安全性。
OpenAI 介绍了 GPT-5 在医学研究领域的具体应用,展示如何利用该模型开展医学科研工作。
OpenAI 发布 GPT-5 系统卡(System Card),介绍了支撑快速与高智能响应的统一模型路由系统。该系统通过调度 gpt-5-main、gpt-5-thinking 以及轻量级的 gpt-5-thinking-nano 等不同模型版本,针对多样化任务需求与开发者场景进行了定向优化。
推荐理由:该文档说明了多版本模型的统一路由机制,便于开发者了解其在不同任务负载下的分发策略与适配方案。
OpenAI 发布 ChatGPT agent 系统卡片,详细介绍了其整合研究、浏览器自动化与代码工具的智能体模型。该模型在 OpenAI 的预备框架(Preparedness Framework)指导下部署了相应的安全保障措施。
推荐理由:系统卡片展示了该智能体整合研究、浏览器自动化与代码工具的方式,读者可借此了解其在预备框架下的安全规范。
OpenAI 发布 o3 与 o4-mini 的系统卡,展示两款模型在前沿推理能力基础上结合完整工具链的实际表现。模型支持网页浏览、Python、图像与文件分析、图像生成、canvas、自动化、文件搜索以及记忆功能。
推荐理由:系统卡展示了模型在深度推理与全套工具链结合下的能力边界,有助于读者评估复杂任务的工作流集成路径。
OpenAI 发布 GPT-4o 系统卡补充附录,介绍全新的 4o 图像生成能力。相比早期的 DALL·E 3 系列模型,4o 图像生成能力显著增强,支持生成逼真图像,并能够接收图像输入并进行转换。
推荐理由:原文指出了 4o 图像生成相比 DALL·E 3 的能力跨越与图像变换特性,读者可据此了解其多模态生成的最新演进。
OpenAI 与 MIT Media Lab 展开合作研究,探索用于分析用户在 ChatGPT 上的情感使用(affective use)与情绪健康的早期方法。该项目为 OpenAI 与 MIT Media Lab 的联合研究成果。
OpenAI 推出面向 o1 模型的新对齐策略“审思对齐”(Deliberative alignment)。该策略直接向模型传授安全规范,并训练其基于这些规范进行链式推理,从而构建更加安全的大语言模型。
推荐理由:原文介绍了利用模型推理能力学习安全规范的新对齐策略,有助于读者理解思考型模型的安全防护机制。
OpenAI 发布 o1 与 o1-mini 的系统卡,系统梳理了两款模型上线前开展的安全工作。报告内容涵盖外部红队测试,以及依据其 Preparedness Framework 实施的前沿风险评估。
推荐理由:报告记录了模型发布前的外部红队测试与风险评估流程,为评估前沿模型的安全治理提供了官方参考依据。
OpenAI 实现了对连续时间一致性模型的简化、稳定化与规模化扩展。该方法仅需两步采样即可达到与主流扩散模型相当的样本生成质量。
OpenAI 发布了 GPT-4o 的系统安全报告(System Card)。
一致性模型(Consistency Models)是一类新兴的生成模型。该模型无需进行对抗训练,即可在单步之内采样生成高质量数据。
OpenAI 采用扩展稀疏自编码器(sparse autoencoders)的新技术,在 GPT-4 的计算过程中自动识别出了 1600 万个特征模式。该成果展示了如何通过自编码器技术解析大语言模型内部的计算表征。
推荐理由:该研究利用扩展稀疏自编码器从前沿模型中自动提取出千万级模式,为大模型内部可解释性提供了具体技术路径。
OpenAI 与乔治城大学安全与新兴技术中心、斯坦福互联网观察站联合发布研究报告,探讨大语言模型可能被滥用于虚假信息宣传的风险及应对方案。该研究汇集了 30 位虚假信息研究员、机器学习专家和政策分析师的研讨成果,概述了大语言模型对信息环境构成的威胁,并提出了分析潜在缓解措施的框架。
OpenAI 提出视频预训练(VPT)方法,通过海量无标注人类游戏视频与少量承包商标注数据训练神经网络玩《我的世界》。模型直接使用键盘与鼠标等人类原生接口,经微调后可完成通常需要熟练玩家操作 20 分钟以上(约 24,000 次动作)的合成钻石工具任务。该成果展示了从网络视频中学习行为模式并迈向通用计算机操作智能体的路径。
推荐理由:该研究展示了利用海量未标注人类视频与少量操作数据预训练模型的方法,为构建通用的计算机操作智能体提供了可行路径。
OpenAI 训练了专门撰写批评的模型来指出文本摘要中的缺陷,使人类评估员发现缺陷的几率大幅提高。实验表明更大规模的模型在自我批评上表现更好,且模型规模对批评能力的提升幅度超过了对摘要能力的提升,展现了利用 AI 辅助人类监督复杂任务的前景。
OpenAI 构建了一个面向 Lean 的神经定理证明器,成功学会求解多种具有挑战性的高中数学奥赛题。该系统能够解答来自 AMC12 和 AIME 竞赛的题目,以及两道改编自国际数学奥林匹克(IMO)的试题。
推荐理由:原文展示了基于 Lean 形式化语言解决竞赛级数学题的方法,为自动化定理证明与复杂逻辑推理提供了参考。
Hugging Face 联合多所机构提出跨互联网协作分布式训练方法 DeDLOC,并联合 40 名志愿者成功预训练出孟加拉语模型 sahajBERT。该方法通过在各节点累加大批次梯度并根据网络条件自适应分配聚合负载,解决了家用宽带带宽受限和节点易掉线的问题。
推荐理由:原文展示了如何通过去中心化自适应聚合让普通设备协作预训练,为缺乏大算力集群的研究团队提供了低成本替代方案。
OpenAI 最新研究发现,通过在小规模精选数据集上进行微调,能够针对特定的行为价值观改善大语言模型的行为表现。
OpenAI 联合 30 家机构的 58 位作者共同发布报告,提出了 10 项提升 AI 系统相关声明可验证性的机制。开发者可借助这些工具提供系统在安全、公平或隐私保护等维度的证据。用户、政策制定者及民间社会也能运用这些工具评估 AI 的开发流程。
OpenAI 研究表明深度双重下降现象在 CNN、ResNet 和 Transformer 架构中广泛存在,模型性能随着模型规模、数据量或训练时间增加会呈现先提升、后恶化、再提升的变化趋势。该效应通常可通过精细的正则化手段避免。尽管这种表现具有普适性,其底层原因仍未被完全理解,是持续探索的重要研究方向。
推荐理由:文章指出深度神经网络在参数、数据或训练时间增加时普遍存在性能先升后降再升的双重下降现象,为理解模型泛化提供了新视角。
OpenAI 训练神经网络控制仿人机械手成功还原魔方,整个训练过程完全在仿真环境中进行。该方案复用了 OpenAI Five 的强化学习代码,并结合了自动域随机化(ADR)技术,使机械手在物理世界中能够承受未曾见过的外部扰动。这表明强化学习可以用于解决现实环境中需要高灵巧度的物理任务。
推荐理由:研究展示了借助自动域随机化技术在纯模拟环境中训练强化学习策略并成功迁移至真实物理硬件的方法。
OpenAI Five 在比赛中连赢两局战胜 Dota 2 世界冠军战队 OG,成为首个在电竞比赛中击败世界冠军的 AI。此前 OpenAI Five 与 DeepMind 的 AlphaStar 虽曾在私下击败过顶尖职业选手,但在现场比赛中失利;本次比赛也是 AI 首次在网络直播中击败电竞职业选手。
推荐理由:原文记录了强化学习系统在公开直播对局中击败人类冠军的里程碑,展现了复杂连续决策环境下的实战表现。
OpenAI 推进了基于能量的模型(EBMs)稳定且可扩展的训练,实现了优于现有模型的样本质量与泛化能力。EBMs 在生成阶段通过消耗更多算力持续优化输出结果,在低温条件下能够生成媲美 GANs 的样本,同时具备基于似然模型的模式覆盖保证。
OpenAI 联合 Google 研究人员推出 Activation Atlases,这是一种用于可视化神经元之间交互所表征内容的新技术。该技术旨在帮助深入理解 AI 系统的内部决策过程,以便在敏感场景部署时识别模型弱点并排查失效原因。
OpenAI 开发了一种基于能量的模型,能快速识别并生成以 2d 点集表示的概念实例(如 near、above、between、closest 和 furthest)。该模型仅需 5 次演示即可学会这些概念。此外,研究还展示了跨域迁移能力,成功将 2d 粒子环境中学习到的概念用于解决 3 维物理机器人的任务。
OpenAI 研发了随机网络蒸馏(Random Network Distillation,RND),这是一种基于预测奖励驱动强化学习智能体通过好奇心探索环境的方法。该方法在经典强化学习测试游戏 Montezuma's Revenge 上的表现首次超过了人类平均水平。
推荐理由:原文提出了基于好奇心驱动强化学习智能体探索的方法,为解决稀疏奖励环境下的探索难题提供了具体思路。
OpenAI 训练了一只拟人机械手,使其能够以前所未有的灵巧度操作物理实体对象。该成果展现了拟人机械手在物理操控任务中达到的高灵巧度控制能力。
OpenAI 宣布推出一套可扩展且与任务无关的语言理解系统并予以发布,在多样化的语言任务上取得了 SOTA 成绩。该方法将 Transformer 架构与无监督预训练相结合,展示了监督学习与无监督预训练结合的潜力,并期望推动在更大规模和更多样化数据集上的深入研究。
推荐理由:原文展示了将无监督预训练与 Transformer 架构结合的可行性,读者可以了解通过无监督预训练辅助监督任务的实现思路。
OpenAI 发布了近端策略优化(Proximal Policy Optimization,PPO)强化学习算法。该算法在表现上达到或超越现有 SOTA 方法,同时在实现与调优上更加简单。由于易用性和良好性能,PPO 已成为 OpenAI 内部默认的强化学习算法。
推荐理由:OpenAI 介绍了 PPO 算法相比既有 SOTA 方法在实现与调优上的简化,展现了其作为默认强化学习算法的性能平衡。
OpenAI 生成了在不同尺度和视角下均能稳定欺骗神经网络分类器的对抗图像。这一结果直接反驳了此前认为自动驾驶汽车因采集多角度、多尺度画面而难以被恶意欺骗的观点。