ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

面向多模态程序性知识理解与视觉语言推理的烹饪食谱问答数据集

面向多模态程序性知识理解与视觉语言推理的烹饪食谱问答数据集 摘要面向多模态程序性知识理解与视觉语言推理的烹饪食谱问答数据集旨在以真实烹饪流程作为测试平台研究模型如何联合理解文本、图像和事件顺序。数据集概述面向多模态程序性知识理解与视觉语言推理的烹饪食谱问答数据集旨在以真实烹饪流程作为测试平台研究模型如何联合理解文本、图像和事件顺序。数据集包含约 2万个独特食谱以及由这些食谱自动生成的 3.6万多个问答对每个食谱均提供分步骤的自然语言说明和对应图片。与传统文本阅读理解数据集不同RecipeQA 的问题往往同时涉及标题、步骤描述和视觉内容要求模型综合多种模态信息进行推理因此能够更加真实地评估人工智能对复杂操作流程的理解能力。数据结构与关键特征该数据集以“食谱—步骤文本—步骤图片—问题—答案”为核心结构组织。每个食谱包含完整的烹饪流程、按时间顺序排列的操作步骤及相应视觉图像并在此基础上构建多模态问答任务。问题通常需要模型同时完成三类推理一是联合理解图像与文本内容识别食材、厨具及操作行为二是掌握步骤之间的时间顺序和事件关系判断某一操作发生在何时或前后顺序三是理解烹饪流程中的程序性知识推断完成某一步骤所需的条件及后续结果。数据中的图像大量来源于普通用户在真实、非受限环境下拍摄因此具有背景复杂、视角变化和图像质量不一致等现实特征。应用价值与研究方向适用于多模态问答、视觉语言理解、程序性知识建模、时序推理和跨模态信息融合等研究。研究人员可以利用 Transformer、CLIP、BLIP、LLaVA 等视觉语言模型联合编码食谱文本与步骤图像并研究模型对操作顺序、因果关系和步骤依赖的理解能力。进一步可开展多模态食谱问答、步骤排序、缺失步骤预测、图文语义对齐、操作流程生成以及智能烹饪辅助系统等任务。由于其真实自然语言、多模态问题设计以及大量用户拍摄图像也适合作为评估多模态模型是否真正具备程序性推理能力的重要基准。数据集来源由张家梁(Bob)整理并于2026年在7zcode平台公开发布。数据集信息免责声明与引用数据仅用于科研与教学用途。若用于商业场景请自行核验数据许可。如需引用请在论文或报告中注明数据集名称与版本号。作者信息作者Bob (张家梁)项目编号Datasets-451文件大小2.5G原创声明本数据集为整理作品
返回列表