InternVL Mantis评测实战:交错图像文本理解能力测试
2026/9/17 18:51:40 网站建设 项目流程

InternVL Mantis评测实战:交错图像文本理解能力测试

【免费下载链接】InternVL[CVPR 2024 Oral] InternVL Family: A Pioneering Open-Source Alternative to GPT-4o. 接近GPT-4o表现的开源多模态对话模型项目地址: https://gitcode.com/GitHub_Trending/in/InternVL

InternVL 是接近 GPT-4o 表现的开源多模态对话模型(CVPR 2024 Oral)。本文带你用官方评测脚本完成 Mantis 评测——一套专门测试「交错图像文本理解」能力的基准,一条命令跑通,新手友好。

🖼️ 什么是 Mantis-Eval:交错图文理解基准

Mantis-Eval 与普通 VQA 最大的不同:一道题里会出现多张图片,问题需要跨图关联——例如"Image-1 里的动物比 Image-2 里的离镜头更近吗?"。这类交错图像文本(interleaved image-text)问题,考验的不是"看图说话",而是模型在多视觉输入与文本指令之间来回指代、比较和推理的能力。

以仓库内置的两张示例图为例,评测时模型会被要求同时理解并对比两张图的信息:

数据集自带两种题型:

  • multi-choice(单选):模型只需输出选项字母
  • short-answer(简答):模型用单个词或短语回答

🚀 Mantis 评测一键运行:从克隆仓库到出分

步骤 1:获取代码与安装依赖

git clone https://gitcode.com/GitHub_Trending/in/InternVL cd InternVL/internvl_chat pip install -r ../requirements/internvl_chat.txt

步骤 2:运行 Mantis 评测

评测数据集会从 HuggingFace 的TIGER-Lab/Mantis-Eval(test 分片)自动下载,缓存到data/mantis_eval目录,无需手动准备数据:

# 8 卡推荐写法 GPUS=8 sh evaluate.sh ${CHECKPOINT} mantis --dynamic # 或直接用 torchrun torchrun --nproc_per_node=8 eval/mantis_eval/evaluate_mantis.py --checkpoint ${CHECKPOINT} --dynamic

⚠️ 官方特别强调:测试 InternVL 1.5 / 2.0 / 2.5 及更新版本时,务必加--dynamic开启动态高分辨率推理,结果才有可比性。

💡 单卡显存放不下大模型?加上--auto,官方的 split_model 会自动把 LLM 各层切分到多张 GPU,视觉编码器固定在 0 号卡。

⚙️ 评测流程解析:图片标记、判分逻辑与结果输出

评测主脚本 evaluate_mantis.py 的处理链路非常直白:

  1. 加载数据:读取 Mantis-Eval 的 test 分片,自动下载并缓存;
  2. 图片标记:把题干中的<image>依次替换为Image-1Image-2,并在问题前拼接Image-1: <image>前缀,让模型明确每张图的身份(见 evaluate_mantis.py#L52-L100);
  3. 附加提示词:单选题追加"Answer with the option's letter...",简答题追加"Answer the question using a single word or phrase.";
  4. 自动判分:选择题同时接受选项字母与选项原文;简答题做大小写不敏感的精确匹配;
  5. 输出结果:终端打印 Multi-choice / Short-answer / Overall 三项 Accuracy,逐题明细以 JSONL 保存到results/目录。

整个推理由 torchrun 启动多进程,InferenceSampler将样本均匀切分到各 GPU,最后 all_gather 汇总,天然支持多卡加速,无需自己写分布式逻辑。

📋 Mantis 评测关键参数速查表

参数类型默认值说明
--checkpointstr''模型权重路径
--datasetsstrMantis-Eval评测数据集
--dynamicflagFalse动态高分辨率切块,1.5+ 版本必开
--max-numint6动态分辨率最大切块数
--load-in-8bitflagFalse8-bit 量化加载,省显存
--autoflagFalse大模型自动切分到 8 卡
--out-dirstrresults结果输出目录

完整参数说明见 eval/mantis_eval/README.md,mantis分支的入口在 evaluate.sh#L491-L499。

📊 读懂评测结果与常见坑

  • 结果文件results/Mantis-Eval_<时间戳>.jsonl,每行包含 question / pred / answer / correct 字段,方便逐题复盘错因;
  • 三项指标:Multi-choice Accuracy、Short-answer Accuracy、Overall Accuracy 直接打印在终端,可用来横向对比不同模型;
  • 显存不足:优先--load-in-8bit,其次--auto,最后再考虑换更小的 checkpoint;
  • 版本对比陷阱:不同 InternVL 版本若一个开动态分辨率、一个没开,分数不可比——对比前统一--dynamic开关。

Mantis 之外,仓库eval/目录还内置了 MMMU、ScienceQA、VQA、MMBench 等几十个基准,全部通过同一个 evaluate.sh 统一调度。把 Mantis 与其他基准拼在一起,就能拼出模型完整的评测画像,类似的雷达图可以一眼看出各维度的能力轮廓:

按上面的步骤跑完一轮 Mantis 评测,你就掌握了 InternVL 交错图像文本理解能力的量化测试方法——这也是评估多模态模型时最容易区分"看图说话"与"真多图文推理"的基准之一。

【免费下载链接】InternVL[CVPR 2024 Oral] InternVL Family: A Pioneering Open-Source Alternative to GPT-4o. 接近GPT-4o表现的开源多模态对话模型项目地址: https://gitcode.com/GitHub_Trending/in/InternVL

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询