Google DeepMind·· 2026-08-27精选AI 评分60
Google DeepMind 试点双盲 AI 评测机制
Piloting the world's first double-blind AI evaluations
AI 导读
Google DeepMind 联合多家机构试点双盲 AI 评测机制,利用密码学安全环境隔离外部测试集,防止模型提前接触题目造成基准污染。团队与新加坡 AI 安全研究所、OpenMined、AVERI 及 MLCommons 合作,在隐私保护环境中对 Gemini Flash Lite 模型进行保密基准测试。该方案旨在通过技术与密码学防护手段,确保前沿模型的能力和安全评测结果真实可信。
推荐理由
DeepMind 通过密码学安全环境隔离测试数据与前沿模型,为防止基准污染和建立可信评测提供了技术落地参考。
来源:Google DeepMind · deepmind.google