OpenAI·· 2025-08-27精选AI 评分67
OpenAI 与 Anthropic 公布联合安全评估结果
OpenAI and Anthropic share findings from a joint safety evaluation
AI 导读
OpenAI 与 Anthropic 联合开展了针对彼此模型的安全互测,并公布了联合安全评估结果。该评估涵盖对齐偏差、指令遵循、模型幻觉以及越狱等多项维度,展示了模型安全进展与挑战,并体现了跨实验室协作评测的价值。
推荐理由
两家前沿实验室通过互相测试对方模型来检验越狱与对齐风险,为行业建立跨机构的模型安全评估与协作提供了参考范式。
来源:OpenAI · openai.com