Hugging Face·· 2025-07-23AI 评分49
TimeScope:视频大多模态模型到底能处理多长的视频?
TimeScope: How Long Can Your Video Large Multimodal Model Go?
AI 导读
开源评测基准 TimeScope 在 Hugging Face 发布,旨在通过在 1 分钟至 8 小时的基础视频中插入 5 至 10 秒的短视频片段,评估视觉语言模型的长视频理解能力。该基准从局部检索、信息综合和细粒度时序感知三项任务进行评测,测试发现前沿模型在面对真实时序理解时仍表现吃力,性能随视频变长出现明显下滑。
来源:Hugging Face · huggingface.co