跳到正文
原文
Hugging Face·· 2023-06-12精选AI 评分69

Hugging Face 实测基模型能否像人类一样评估标注数据

Can foundation models label data like humans?

AI 导读

Hugging Face 团队联合 Scale AI 展开实测,对比了 GPT-4 与专业人类标注员在评估开源模型表现时的差异。测试显示 GPT-4 虽能维持模型间的大致相对排名,但存在显著的位置偏置、长度偏好,并倾向于给蒸馏自 OpenAI 风格的模型打高分,甚至将人类示范排在开源模型之后。两者打分相关性在头脑风暴等高熵生成任务中可达 0.60,但在代码等低熵任务中降至 0.33。

推荐理由

该研究对比了 GPT-4 与专业人类标注员在模型评估上的打分差异,揭示出大模型评测存在位置偏好和长度偏置。

来源:Hugging Face · huggingface.co