Hugging Face·· 2024-03-05AI 评分45
ConTextual 发布:测试多模态大模型在富文本场景下的图文联合推理能力
Introducing ConTextual: How well can your Multimodal model jointly reason over text and image in text-rich scenes?
AI 导读
加州大学洛杉矶分校(UCLA)研究人员推出富文本视觉推理评测数据集 ConTextual 及排行榜,涵盖导航、信息图表等 8 类场景共 506 条高难度指令。首期实验测试了 GPT-4V、Gemini-Vision-Pro 和 LLaVA-1.5-13B 等 13 个模型,显示当前多模态模型整体表现明显弱于人类。表现最佳的 GPT-4V 虽在抽象推理上超越人类,但在时间读取等任务上仍显吃力。
来源:Hugging Face · huggingface.co