摘要:面向多模态程序性知识理解与视觉语言推理的烹饪食谱问答数据集,旨在以真实烹饪流程作为测试平台,研究模型如何联合理解文本、图像和事件顺序。
数据集概述
面向多模态程序性知识理解与视觉语言推理的烹饪食谱问答数据集,旨在以真实烹饪流程作为测试平台,研究模型如何联合理解文本、图像和事件顺序。数据集包含约 2万个独特食谱以及由这些食谱自动生成的 3.6万多个问答对,每个食谱均提供分步骤的自然语言说明和对应图片。与传统文本阅读理解数据集不同,RecipeQA 的问题往往同时涉及标题、步骤描述和视觉内容,要求模型综合多种模态信息进行推理,因此能够更加真实地评估人工智能对复杂操作流程的理解能力。
数据结构与关键特征
该数据集以“食谱—步骤文本—步骤图片—问题—答案”为核心结构组织。每个食谱包含完整的烹饪流程、按时间顺序排列的操作步骤及相应视觉图像,并在此基础上构建多模态问答任务。问题通常需要模型同时完成三类推理:一是联合理解图像与文本内容,识别食材、厨具及操作行为;二是掌握步骤之间的时间顺序和事件关系,判断某一操作发生在何时或前后顺序;三是理解烹饪流程中的程序性知识,推断完成某一步骤所需的条件及后续结果。数据中的图像大量来源于普通用户在真实、非受限环境下拍摄,因此具有背景复杂、视角变化和图像质量不一致等现实特征。
应用价值与研究方向
适用于多模态问答、视觉语言理解、程序性知识建模、时序推理和跨模态信息融合等研究。研究人员可以利用 Transformer、CLIP、BLIP、LLaVA 等视觉语言模型联合编码食谱文本与步骤图像,并研究模型对操作顺序、因果关系和步骤依赖的理解能力。进一步可开展多模态食谱问答、步骤排序、缺失步骤预测、图文语义对齐、操作流程生成以及智能烹饪辅助系统等任务。由于其真实自然语言、多模态问题设计以及大量用户拍摄图像,也适合作为评估多模态模型是否真正具备程序性推理能力的重要基准。
数据集来源
由张家梁(Bob)整理并于2026年在7zcode平台公开发布。
数据集信息
免责声明与引用
数据仅用于科研与教学用途。若用于商业场景,请自行核验数据许可。如需引用,请在论文或报告中注明数据集名称与版本号。
作者信息
作者:Bob (张家梁)
项目编号:Datasets-451
文件大小:2.5G
原创声明:本数据集为整理作品