跳到正文
原文
Hugging Face·· 2024-07-25AI 评分34

LAVE:基于大语言模型在 Docmatix 上的零样本 VQA 评测——我们还需要微调吗?

LAVE: Zero-shot VQA Evaluation on Docmatix with LLMs - Do We Still Need Fine-Tuning?

AI 导读

Hugging Face 探讨了利用大语言模型辅助评测方法 LAVE 解决传统 VQA 指标因格式差异导致评分失真的问题,并在合成数据集 Docmatix 上开展零样本评测。实验以 MPLUGDocOwl1.5 为基线并使用 Llama-2-Chat-7b 打分,传统指标 ANLS 仅为 0.002、BLEU 为 0.0032,而 LAVE 得分达 0.58,能更准确评估模型的实际语义泛化能力。

来源:Hugging Face · huggingface.co