跳到正文

#论文/研究

今日 2 条
今天10月3日周六
  1. LINUX DO 最新51

    以色列科研团队开发出可从大脑信号重建视觉画面的 AI 工具

    以色列魏茨曼科学研究所团队开发出一种新型 AI 工具,可通过分析脑部扫描图像高精度重现受试者观看的视觉画面,并能反向预测相应的大脑活动。该技术未来有望用于辅助闭锁综合征患者沟通或重现梦境内容,但神经伦理学家和学者也对其可能引发的思维隐私泄露与未经许可提取想法的风险表达了担忧。

  2. LINUX DO 最新54

    解读《AI智能体的法律定位与责任配置研究》:智能体动态治理与责任配置

    作者对发表于《信息安全研究》的论文《AI智能体的法律定位与责任配置研究》进行深度解读,探讨智能体从静态内容生成转向持续自主行动过程中的法律定位与多方归责机制。论文主张智能体在法律上仍属于客体,应确立技术身份与法律归属双轨识别,通过动态授权、权限隔离和防篡改日志落实运行控制。责任划分上建议采用关系主义归责与最小必要原则,由面向用户的部署者承担对外责任,再根据技术日志与控制能力向内追偿。

10月2日周五
  1. Hugging Face45

    AutoSynthData:为企业级 AI 智能体生成训练数据

    ServiceNow CoreAI 推出 AutoSynthData,通过分析目标模型的失败与更强教师模型的成功表现,自动为企业级 AI 智能体生成训练数据。该框架将模型的能力短板转化为包含系统规范、用户提示词和验证器的全新可执行任务,并在 EnterpriseOps Gym 中完成了流程验证。生成的任务兼具可行性与真实性,可随模型表现动态调整生成课程用于后训练。

9月29日周二
  1. Hugging Face43

    面向 MCP 智能体的来源感知核验方法 ProvenanceGuard:确保来源与事实双重准确

    ProvenanceGuard 是一种面向 MCP 智能体的生成后事实核验层,旨在解决主张内容属实但归因于错误工具输出的跨来源混淆问题。该方法无需重训智能体,通过保留工具输出与来源 ID,依次执行主张拆解、来源定位、支持度校验与修复决策。在包含 361 项医疗主张的测试中,它成功拦截了专家判定不可通过的 139 项主张中的 138 项,可识别来源的匹配准确率达 86% 左右。

9月16日周三
9月8日周二
  1. OpenAI68

    OpenAI 分享纳维-斯托克斯千禧年大奖难题的 AI 生成解法与 Lean 证明

    OpenAI 分享了针对纳维-斯托克斯千禧年大奖难题的 AI 生成解答。该成果包含完整的技术说明报告,以及基于 Lean 交互式定理证明器给出的形式化证明。

    推荐理由:OpenAI 公开了借助 AI 尝试解决千禧年数学难题的研究,展示了形式化验证在复杂前沿科学探索中的具体落地方式。

9月2日周三
  1. Hugging Face54

    AllenAI 推出 BenchMIRT:基于多维项目反应理论审计大语言模型评测基准

    AllenAI 推出基准审计方法 BenchMIRT,引入心理测量学中的多维项目反应理论(MIRT),在单题层级拆解大语言模型评测实际考察的底层能力。基于 100 个大模型在 16 个基准、逾 3.4 万道题目上的表现,该工具无需预设标签即独立析出安全与通用推理两个主维度,发现 BBQ、WMDP 等安全评测实际与通用推理高度关联。

8月25日周二
  1. Hugging Face45

    Quantization-Aware Healing:4-bit 压缩模型性能反超全精度版本

    研究团队提出 Quantization-Aware Healing(QAH)方法,使经结构压缩与 4-bit 量化的大模型性能反超其全精度版本。在将 GPT-OSS 120B 压缩至 60B 并量化至 MXFP4 的实验中,QAH 模型在 9 个基准测试中有 7 个击败对应的 bfloat16 版本。该方法直接从原始全尺寸模型蒸馏,并通过分块损失支持 32k tokens 上下文修复。

8月1日周六
7月27日周一
7月1日周三
6月30日周二
  1. Hugging Face42

    DiScoFormer:用单一 Transformer 跨分布估计密度与分值

    DiScoFormer 采用 Transformer 架构,无需重新训练即可通过单次前向传播同时估计分布的密度与分值。在 100 维测试中,它相比经调优的核密度估计(KDE)将分值误差降低约 6.5 倍、密度误差降低超过 37 倍。模型还支持在推理阶段利用二者的一致性损失实现即时自适应,可良好泛化至未见过的多模态及非高斯分布。

6月25日周四
6月19日周五
6月18日周四
6月16日周二
6月8日周一
  1. Google DeepMind63

    Google DeepMind 公布 AI 教学实证研究:8 周试验显著提升学生数学成绩

    Google DeepMind 公布了在塞拉利昂开展的预注册对照试验结果,使用基于 LearnLM 定制的 Guided Learning 辅助教学让学生的数学成绩提升 0.258 个标准差,相当于在 8 周内取得了 1.2 至 1.7 年的学习进度。

    推荐理由:该研究通过随机对照试验量化了苏格拉底式 AI 辅导对学生数学成绩的促进作用,为教育场景下的模型落地提供了实证数据与操作手册。

5月19日周二
  1. Google DeepMind56

    Google DeepMind 借助 Co-Scientist 加速逆转细胞衰老的基因线索筛选

    生物学团队借助 Google DeepMind 的 Co-Scientist 系统,加速逆转细胞衰老相关的基因线索筛选与海量实验数据分析。Co-Scientist 检索数万篇文献后提出了 20 多个候选基因因子,其中部分假说已获实验室验证并成功促使细胞恢复更年轻状态。此外,该系统将原本需要研究人员耗时多达 6 个月的筛选数据文献关联分析缩短至数天。

5月16日周六
  1. Google DeepMind49

    利用 Co-Scientist 寻找新型传染病背后的分子开关

    剑桥大学 Clare Bryant 教授正利用 AI 系统 Co-Scientist 寻找病原体跨物种传播引发严重疾病的分子开关。通过分析研究提案与未公开实验数据,Co-Scientist 帮助团队将假说靶点从候选蛋白质精准缩小至特定氨基酸。这一原本通常需要 2 至 3 年实验的氨基酸筛选过程,借助该工具预计缩短至 6 个月完成。

  2. Google DeepMind65

    斯坦福团队利用 DeepMind Co-Scientist 发现抗肝纤维化老药新用候选方案

    斯坦福大学医学院团队在《Advanced Science》发表研究,利用 Google DeepMind 的 Co-Scientist 系统从现有药物文献中筛选治疗肝纤维化的老药新用候选药。

    推荐理由:该研究给出了 AI 系统筛选老药新用并在活体人类细胞中实验验证的对比数据,为科研智能体在生物医药发现中的实际表现提供了直接参考。

4月30日周四
  1. Google DeepMind65

    Google DeepMind 推出 AI 协诊医生研究计划并探索多模态远程医疗

    Google DeepMind 宣布启动 AI 协诊医生研究计划,探索由 AI 智能体在医生监督下协助患者的三方护理模式。该系统基于 Gemini 与 Project Astra 的实时音视频能力构建,在与哈佛及斯坦福合作的远程问诊模拟中,能在实时指导查体的同时通过双智能体架构由规划模块全程监控对话边界。

    推荐理由:原文结合双智能体架构与临床模拟实测,展示了多模态交互在远程问诊和查体指导中的实际边界。

4月25日周六
  1. OpenAI40

    OpenAI 建模分析 AI 就业转型

    OpenAI 提出一项全新分析框架,涵盖 921 种职业和 1.48 亿个美国就业岗位。该框架旨在评估劳动力受 AI 的影响,识别哪些角色正面临自动化风险、业务重组、需求增长或极小的 AI 冲击。

4月22日周三
3月26日周四
  1. Google DeepMind63

    Google DeepMind 发布 AI 有害操纵评测工具包与实证研究

    Google DeepMind 发布了首个用于测量 AI 有害操纵的实证评估工具包,并公开了涵盖英美印三国 10,000 多名参与者的 9 项研究成果。该研究系统衡量了模型在金融和健康等高风险决策场景中的操纵倾向与实际有效性,开源了开展该类实验所需的全部材料。相关评估指标已纳入其前沿安全框架,用于测试 Gemini 3 Pro 等前沿大模型。

    推荐理由:该研究公开了测量 AI 有害操纵的实证工具包,为行业量化大模型在金融与健康等场景中的诱导风险提供了可复用的实验框架。

3月18日周三
  1. Google DeepMind51

    Google DeepMind 提出评估 AGI 进展的认知能力框架

    Google DeepMind 发布新论文提出测量 AGI 进展的认知分类框架,并联合 Kaggle 设立 20 万美元奖金池启动评测黑客松。该框架从认知科学等领域提炼出感知、注意、学习、记忆、推理、元认知、执行功能与社会认知等 10 项核心能力,采用留出测试集和人类基线对比的三阶段协议评估模型。

3月17日周二
3月5日周四
  1. OpenAI66

    OpenAI 研究发现推理模型难以控制思维链,有助于提升安全可监控性

    OpenAI 提出评估框架 CoT-Control,研究发现推理模型难以自主控制自身的思维链(Chain of Thought)。这一特性表明模型的思考过程难以被刻意伪装或隐藏,从而强化了将思维链可监控性作为 AI 安全防线的有效性。

    推荐理由:研究通过评估发现推理模型难以自主隐匿或操纵思维链,说明思维链监控能作为可靠的 AI 安全监督手段。

3月4日周三
2月10日周二
  1. Google DeepMind75

    Google DeepMind 利用 Gemini Deep Think 加速数学与科学发现

    Google DeepMind 发表两篇论文,展示 Gemini Deep Think 结合智能体工作流在数学、物理与计算机科学专业研究中的应用成果。团队基于该模式构建了具备自然语言验证和检索能力的数学研究智能体 Aletheia,已实现全自主生成算术几何论文并解答多项 Erdős 猜想。

    推荐理由:展示了推理模型结合自然语言验证与搜索的智能体架构,为将大模型引入前沿科学研究提供了可复用的人机协作路径。

2月5日周四
  1. OpenAI61

    GPT-5 降低无细胞蛋白质合成成本

    OpenAI 与 Ginkgo Bioworks 的云自动化能力相结合构建自主实验室,通过闭环实验将无细胞蛋白质合成成本降低了 40%。

    推荐理由:展示了大模型与自动化实验室闭环实验的落地成效,提供了前沿模型降低生物合成实验成本的具体数据。

1月20日周二
  1. Hugging Face44

    Differential Transformer V2

    Differential Transformer V2(DIFF V2)正式公开,通过将 Query 头翻倍但保持 KV 头数量不变,无需自定义注意力算子即可达到媲美标准 Transformer 的解码速度。该版本还移除了 V1 中的逐头 RMSNorm,解决了大规模预训练时的梯度暴增与数值不稳定问题,并可消除注意力黑洞,相关代码已在 GitHub 开源。

1月16日周五
12月16日周二
  1. OpenAI67

    OpenAI 评估 AI 加速生物湿实验研究能力

    OpenAI 推出了一套真实世界评测框架,用于衡量 AI 加速湿实验生物研究的能力。该研究利用 GPT-5 优化分子克隆方案,探讨了 AI 辅助实验的前景以及潜在风险。

    推荐理由:该研究将模型评估延伸至湿实验生物场景,为考察前沿大模型在物理实验中的效用与风险提供了参考维度。

12月11日周四
  1. OpenAI60

    OpenAI 更新 GPT-5.2 系统卡片

    OpenAI 发布 GPT-5.2 的系统卡片更新,说明该系列模型的综合安全缓解方案与 GPT-5 及 GPT-5.1 基本一致。GPT-5.2 同样基于多样化数据集训练,数据来源包括公开互联网信息、第三方合作数据以及用户和研究人员提供或生成的内容。

    推荐理由:读者可以从中了解 GPT-5.2 沿用了前代模型的安全缓解方案,并查看其训练数据来源构成。

12月5日周五
  1. Google DeepMind53

    DeepMind 展示科研人员利用 AlphaFold 改良光合作用关键酶以培育耐热农作物

    科研人员利用 AlphaFold 预测光合作用关键酶甘油酸激酶的结构并进行分子改造,成功设计出可在 65 °C 高温下保持稳定的杂合酶。密歇根州立大学团队通过比对植物与温泉嗜热藻类的酶结构,准确定位了植物酶在高温下易形变失稳的关键区域。研究人员随后用藻类刚性结构替换不稳定片段,为后续培育耐高温农作物提供了具体分子方案。

11月25日周二
  1. Google DeepMind74

    Google DeepMind 借助 AlphaFold 助力科学家解析心脏病关键蛋白 apoB100 结构

    密苏里大学研究团队结合冷冻电镜与 AlphaFold,成功绘制出构成坏胆固醇(LDL)分子骨架的关键蛋白质 apoB100 的原子级分辨率结构。该蛋白质因体积极大且与脂质复杂连接困扰学界 50 年,结构显示其呈现包裹 LDL 颗粒的笼状外壳与带状支撑结构。这一突破为理解坏胆固醇致病机理以及研发心血管疾病靶向治疗方案提供了关键结构依据。

    推荐理由:研究展示了AlphaFold结合冷冻电镜解析超大复杂蛋白的实践路径,为心血管疾病靶向研发提供了分子层面的结构依据。

11月24日周一
11月20日周四