文章核心总结与创新点
主要内容
本文针对现有多模态大语言模型(MLLMs)评估基准中缺乏对人类语音细粒度视听推理能力测试的问题,提出了AV-SpeakerBench基准数据集。该数据集包含3212个选择题,聚焦真实世界视频中以说话人为核心的视听推理任务,涵盖说话人检测、识别、计数、语音内容推理、时间定位等12类任务。通过对主流闭源模型(如Gemini系列)和开源模型(如Qwen3-Omni-30B)的全面评估,发现Gemini 2.5 Pro表现最佳(总体准确率73.04%),但与人类表现(93.74%)仍有20余个百分点的差距;开源模型中Qwen3-Omni-30B接近Gemini 2.0 Flash水平,但视听融合能力较弱。研究还揭示,音频感知不足、时间定位不准是模型失败的主要原因,为未来多模态模型的优化提供了明确方向。
创新点
- 以说话人为核心的任务设计:突破现有基准聚焦场景或事件的局限,将说话人作为推理核心单元,要求模型关联“谁在说、说什么、何时说”,适配真实世界人机交互需求。
- 融合驱动的问题构造:所有问题均嵌入视听依赖关系,必须通过跨模态融合求解(如将语音短语与视觉人物绑定、基于视觉事件定位语音内容),避免单模态捷径。
- 高质量人工标注流程:通过多阶段专家审核确保标注的时间精度和跨模态有效性,视频片段选自YouTube真实场景(电影片段、访谈、播客等),覆盖多样对话场景和视觉复杂度。