一、赛题背景
近年来,大语言模型(LLM)的崛起为自然语言理解带来了革命。然而,它们也面临两大挑战:
1、知识局限性 :LLM的知识是预训练好的,对于私有的、最新的或特定领域的文档(比如本次比赛的财报)一无所知,并且可能产生幻觉。
2、模态单一性 :大多数LLM本身只能处理文本,无法直接“看到”和理解图像。
检索增强生成(RAG) 技术的出现,通过从外部知识库中检索信息来喂给LLM,有效地解决了第一个挑战。而本次比赛的核心—— 多模态检索增强生成(Multimodal RAG),则是应对这两大挑战的前沿方案。它赋予了AI系统一双“眼睛”,让他不仅能阅读文字,还能看懂图片,并将两者结合起来进行思考和回答。
二、官方资料学习心得
1、魔塔Notebook平台
https://www.modelscope.cn/my/mynotebook/preset
2、RAG处理流程
RAG的四层架构如下:
Loader:加载预处理数据
EmbeddingModel:文本向量化
VectorStore:近似最近邻搜索
Generator:大模型交互
可知,其处理流程包含下述几个部分
1、原始材料信息提取与存储
2、信息向量化及存储
3、检索策略
4、模型输入构建
5、模型回答生成及后处理
提供的baseline代码对其设定如下:
1、pymupdf提取(仅提取pdf文本信息)、按页分块存储
2、信息向量化及存储:BAAI/bge-m3
3、检索策略:余弦相似度,topk
4、模型输入构建:
prompt = (
f"你是一名专业的金融分析助手,请根据以下检索到的内容回答用户问题。\n"
f"请严格按照如下JSON格式输出:\n"
f'{{"answer": "你的简洁回答", "filename": "来源文件名", "page": "来源页码"}}'"\n"
f"检索内容:\n{context}\n\n问题:{question}\n"
f"请确保输出内容为合法JSON字符串,不要输出多余内容。"
)
5、模型回答生成及后处理:大模型Qwen/Qwen3-8B、正则表达式后处理
3、PDF文件信息提取
- PyMuPDF : 一个高性能的Python PDF处理库
- MinerU : 功能强大的文档解析工具,能将PDF精准地转换为结构化的Markdown或JSON;MinerU 可以对PDF进行深度的版面分析,除了能更精准地提取文本块外,还可识别表格、提取图片以及调用多模态模型为提取出的图片生成文字说明
4、多模态处理技术路径
- 将原始图片信息专为图像描述
- 采用多模态嵌入模型将文本与图像映射到统一的高维向量空间
- 多模态大模型直接进行内部信息融合与推理
5、文本/多模态向量化模型
FlagEmbedding (BGE模型) : 领先的中文文本向量化模型库
通义千问Qwen-VL (多模态) : 阿里巴巴开源的性能强大的多模态对话语言模型
6、Xinference、LlamaIndex以及FAISS
- Xinference:(Xorbits Inference)是一个开源平台,用于简化各种 AI 模型的运行和集成。提供了易于使用的接口,包括 Web 图形用户界面(Web GUI)和 RESTful API,以及命令行工具,使得用户可以轻松部署和管理模型。其 API 兼容 OpenAI API,基于 OpenAI API 的应用程序可较容易地迁移到 Xinference 上。
Xinference 详细介绍 - LlamaIndex:是一个专注于检索增强生成(RAG)的开源工具,主要用于构建基于大语言模型(LLM)的应用程序,能帮助用户将自定义数据与 LLM 相结合。
教程文档 - FAISS:Faiss(Facebook AI Similarity Search)是由 Facebook AI Research 开发的一个开源库,主要用于高效地进行大规模相似性搜索和聚类操作。
向量数据库技术系列四-FAISS介绍
三、优化思路
1、优化原始信息提取
现有的baseline代码仅采用pymupdf提取pdf文件中的文本信息,丢失了大量非文本例如表格和图片信息,下一步可采用mineru进行优化
2、完善检索过程
目前没引入重排(Re-ranking)模型进行精排,可采用更强大的模型在初步检索结果的基础上进行重排序来筛选最相关的信息
3、模型优化
可尝试使用更强大的向量化模型以及大模型等
4、Prompt调优及参数调整
- 可优化现有的Prompt,引导大模型更精确地使用资料来源,减轻幻觉
- 可优化过程中的超参数设置

679

被折叠的 条评论
为什么被折叠?



