赛题核心回顾
1. 背景
本次赛题聚焦于 “多模态 RAG 图文问答挑战赛”,核心任务是处理财报 PDF 中的多模态信息(文本、表格、图片等),构建能理解图文关联的问答系统。不同于纯文本问答,财报 PDF 中大量关键数据(如财务指标、趋势图表)常以表格或图片形式呈现,传统文本处理技术无法覆盖这些信息,因此需要多模态处理能力 —— 既要解析文本内容,也要理解表格结构、图片含义,并建立不同模态信息间的关联(如 “某图表对应哪段文字说明”)。
2. 目标
构建一个 “可溯源的多模态问答系统”,具体要求有两点:
- 准确回答与财报相关的问题;
- 必须明确输出答案的来源,包括对应的 PDF 文件名和具体页码。
这一目标强调 “闭环性”—— 所有答案必须来自给定的财报知识库(不能依赖外部信息),且来源精准,避免模型 “编造” 答案或来源。
3. 评估标准
总分 1 分,由三部分构成:
- 答案内容相似度(0.5 分):评估生成答案与标准答案的语义一致性;
- 文件名匹配准确率(0.25 分):判断答案对应的 PDF 文件是否正确;
- 页码匹配准确率(0.25 分):判断答案对应的页码是否准确。
关键洞察: 来源准确性占比 50%,说明 “精准溯源” 与 “答案正确” 同等重要。实际优化中需平衡两者,避免出现 “答案对但来源错” 的情况(如答案正确但页码偏差,仍会大幅失分)。
4. 数据集
- 知识库:以 “财报数据库.zip” 形式提供,包含多个图文混排的 PDF 文件,是系统唯一的信息来源(封闭域问答);
- 训练集(train.json):包含 “问题 - 答案 - 来


1552

被折叠的 条评论
为什么被折叠?



