Hugging Face·· 2026-09-02AI 评分54
AllenAI 推出 BenchMIRT:基于多维项目反应理论审计大语言模型评测基准
BenchMIRT: What are LLM benchmarks actually measuring?
AI 导读
AllenAI 推出基准审计方法 BenchMIRT,引入心理测量学中的多维项目反应理论(MIRT),在单题层级拆解大语言模型评测实际考察的底层能力。基于 100 个大模型在 16 个基准、逾 3.4 万道题目上的表现,该工具无需预设标签即独立析出安全与通用推理两个主维度,发现 BBQ、WMDP 等安全评测实际与通用推理高度关联。
来源:Hugging Face · huggingface.co