作者:来自 Elastic Felix Wang 及 Scott Martens

Jina Reranker 3.5 在判例法上的表现比 v3 提升超过 50%,在法律、医疗和金融基准测试中,将与体积大 7 倍模型之间的差距缩小,并且在结构化数据上直接超越它们。它是 v3 的直接替代品,无需修改 API。
通过 Elasticsearch 动手实践:深入体验我们的示例 Notebook,查看 Elasticsearch Labs repo,开始免费云试用,或者立即在你的本地机器上体验 Elastic。
jina-reranker-v3.5 是一个拥有 6 亿参数的 重排序模型,相比其前代产品 jina-reranker-v3,在法律 检索 任务上实现了显著提升;在法律、医疗和金融 重排序 任务上,也缩小了与参数规模大 7 倍模型之间的大部分差距。在长文档场景下,它比 jina-reranker-v3 最快可提升 56% 的运行速度,并且在判例法检索任务上的得分提高了超过 50%。它还在 STaRK 结构化数据 基准测试 中击败了 Qwen3-Reranker-4B。
对于 v3 用户来说,它是一个可直接替换的版本,无需修改任何访问模型的 API 代码。
什么是重排序模型,它是如何工作的?
重排序模型( reranker )是一种用于信息检索流水线后期阶段的 AI 模型。在其他模块已经根据 查询( query )筛选出一组候选结果之后,重排序模型会对这些候选结果重新排序,从最匹配到最不匹配。使用专门针对候选结果排序训练的模型,通常可以显著提升检索结果的质量。
Jina AI 最新的重排序模型采用了一种称为 后期交互( late interaction )的技术。在这种方法中,查询和文档会分别编码为一组 token 向量嵌入( embeddings ),这些向量表示每个 token 在当前上下文中的语义,然后再对这些向量进行比较。
这可以看作是词汇歧义消解和语法歧义消解在 AI 中的对应实现。
例如,考虑下面两个句子中 match 一词的含义:
-
She looked for a match to light the candl/她寻找一根火柴来点燃蜡烛。
-
She looked for a match on Tinder/她在 Tinder 上寻找一个匹配对象。
第一句话更可能匹配与火柴盒相关的查询;第二句话则更可能匹配与恋爱相关的查询。
基于 Transformer 的模型能够完成这种上下文中的歧义消解,而且会将更丰富的语义信息编码进生成的 token 向量中。在第一句话里, match 的语义 向量嵌入 可能更接近 fire(火)或 illumination(照明)等词;而在第二句话中,它则可能更接近 smartphone(智能手机)或 swipe(滑动)等词。
后期交互重排序模型会分别为查询和候选文档生成这些融合上下文信息的 token 向量,然后通过比较这些向量计算可排序的分数。它完全不依赖于候选结果列表是如何生成的。无论候选结果来自 词法搜索(例如 BM25)、基于 AI 语义向量嵌入的检索,还是混合搜索、联邦搜索等从多个数据源或采用不同算法获取候选结果的系统,重排序模型的工作方式都完全相同。当然,最终效果仍然取决于候选结果本身的质量,因此重排序模型无法修复糟糕的 第一阶段检索( first-stage retrieval ),但几乎总能进一步提升已有检索结果的质量。
jina-reranker-v3.5 是一种 listwise(列表式)重排序模型,采用了最初为 jina-reranker-v3 开发的 last-but-not-late 技术。查询和一组候选结果会一起输入模型,并在一次前向计算中完成处理,为每个候选结果返回一个数值分数。这使模型能够同时利用查询和整个候选列表中的上下文信息来理解完整输入,由于拥有更丰富的信息,因此能够生成更好的排序结果。
jina-reranker-v3 已经证明,采用 last-but-not-late 交互方式的列表式重排序模型,可以在通用重排序基准测试中与最大的模型竞争。目前,只有 jina-reranker-v3.5 和参数规模超过 40 亿的模型在 大规模文本向量嵌入基准( Massive Text Embedding Benchmark,MTEB ) 重排序任务上的表现超过它。不过,这种方法也对候选列表的大小提出了严格限制。查询以及所有候选结果必须能够全部放入模型的输入上下文窗口中。
Jina Reranker v3.5 解决了哪些问题?
尽管 jina-reranker-v3 整体已经具备业界领先的性能,但它仍然存在一些明显的性能短板。
特定领域文本检索
jina-reranker-v3 是基于通用文本语料训练的,因此在一些重要的应用场景中表现不够理想,尤其包括:
-
法律文本,例如判例法和合同条款。
-
医学文献,例如临床试验和患者病历。
-
金融数据集以及包含大量重要数值的其他文本。
-
计算机编程和 IT 文档。
-
包含大量专业术语和技术规格的产品目录。
结构化数据:表格、 JSON 和键值记录
大量重要的现实世界数据都是以电子表格、表格、键值列表以及 JSON 等结构化记录的形式存储。然而,仅针对文本比较训练的重排序模型(例如 jina-reranker-v3)在处理这类数据时表现较差。
长候选列表带来的计算成本
大多数文本处理 AI 模型核心采用的 自注意力( self-attention )架构意味着,其内存和计算需求会随着输入规模的增加而呈二次方增长。因此,jina-reranker-v3 与其他 AI 模型一样,在使用完整输入上下文窗口时,计算成本非常高。
然而,为了充分发挥模型的效果,我们希望能够尽可能将更多候选匹配结果放入模型输入中。当模型最能发挥价值时,它的运行速度也会更慢,计算成本也会更高。
我们开发 jina-reranker-v3.5,正是为了专门解决这些问题,同时又不会降低它在通用文本检索任务上的性能。
Jina Reranker v3.5 有哪些新特性?
jina-reranker-v3.5 采用了改进后的 注意力机制( attention mechanism ),不仅提升了性能,还提高了处理速度,并降低了在 推理( inference )阶段处理完整输入上下文窗口所需的计算资源。我们还引入了一种全新的三阶段自蒸馏( self-distillation )训练流程,使其更适合大输入上下文模型所采用的滑动窗口架构。
我们还针对 jina-reranker-v3 中发现的性能短板,精心整理并使用了新的训练数据,包括:
-
来自多个国际来源的多语言法律文本。
-
主要来自科学文献以及其他 AI 项目资料的医学文本,其中包括一套中文医疗问答数据。
-
金融行业数据,包括投资相关问答、法规,以及包含数值及其相关文本的表格。
-
结构化数据,特别是来自 电商( ecommerce )领域以及公开表格语料的数据。
-
扩展后的多语言和跨语言文本。
有关 jina-reranker-v3.5 的数据来源和技术创新的详细信息,请参阅我们的技术报告。
Jina Reranker 3.5 在检索基准测试中的表现
| 参数数量 | 5.97 亿 |
|---|---|
| 输入模态 | 仅文本 |
| 上下文窗口大小 | 131,072 个 token |
| 最大候选匹配数量 | 没有固定上限,但所有候选结果和查询必须能够放入上下文窗口中。 |
| 支持语言 | 使用 52 种语言进行训练 |
通用文本重排序性能( BEIR 和 MIRACL )
jina-reranker-v3.5 在通用文本重排序基准测试中的表现相比 jina-reranker-v3 有所提升。在英文 Benchmarking Information Retrieval ( BEIR ) 基准测试中,其平均得分已经提升到超过业界领先的 Qwen3-Reranker-4B、Qwen3-Reranker-0.6B 以及 Mixedbread AI 的重排序模型。

我们还提升了 jina-reranker-v3 在 Multilingual Information Retrieval Across a Continuum of Languages ( MIRACL ) 基准测试上的多语言重排序性能。目前,只有拥有 40 亿参数的 Qwen3 重排序模型能够稳定超过 jina-reranker-v3.5 的得分。

法律、医疗和金融领域的重排序
Retrieval Embedding Benchmark (RTEB) suite 包含多个不同领域的检索基准测试。jina-reranker-v3.5 在所有与法律、医疗和金融相关的 RTEB 任务中都超过了 jina-reranker-v3 的表现。
只有参数量接近其 7 倍的大型 Qwen3 重排序模型,在这三个领域中的平均性能更好。

新模型在法律数据方面展现出特别显著的提升,在判例法检索任务中,其得分相比 jina-reranker-v3 提升超过 50%。
| 任务 | Reranker v3 | Reranker v3.5 | v3 到 v3.5 的提升 |
|---|---|---|---|
| AILA-Case | 20.82 | 32.55 | +11.73(56%) |
| AILA-Statute | 32.15 | 46.16 | +14.01(44%) |
| LegalQuAD | 81.84 | 83.09 | +1.25(1.5%) |
| LegalSum | 69.64 | 70.99 | +1.33(1.9%) |
结构化数据重排序( Struct-IR 和 STaRK 基准测试)
我们在两个基准测试上评估了 jina-reranker-v3.5 的结构化数据重排序能力:Struct-IR 和 STaRK。这两个基准测试都包含由 AI 生成的 JSON 文本数据,覆盖多种应用场景,包括产品记录、科学论文以及生物医学知识库。

jina-reranker-v3.5 在 Struct-IR 基准测试上的得分相比 jina-reranker-v3 有了显著提升,再一次只有 Qwen3-Reranker-4B 超过它。在 STaRK 基准测试中,jina-reranker-v3.5 击败了我们测试过的所有其他模型,无论它们的参数规模大小。
推理速度:短文档和长文档的延迟基准测试
候选文档越长,我们针对 jina-reranker-v3.5 所做的架构改进带来的优势就越明显。为了验证这一点,我们使用了两个检索数据集,这两个数据集的主要区别在于平均 文档 长度存在较大差异:
| 数据集 | 平均文档长度 | jina-reranker-v3 | jina-reranker-v3.5 | 加速比例 |
|---|---|---|---|---|
| BEIR Natural Questions | 145.5 个 token | 371.1 毫秒 | 305.3 毫秒 | 22% |
| RTEB AILAcasedocs | 1,904.0 个 token | 16,064.9 毫秒 | 10,290.9 毫秒 | 56% |
jina-reranker-v3.5 在这两种情况下都显著更快。在 Natural Questions 基准测试中,与 jina-reranker-v3 相比,它的速度提升了 22%,平均请求 延迟 从 371.1 毫秒降低到 305.3 毫秒。
AILAcasedocs 基准测试中的每个查询规模要大得多(平均超过 10 倍),因此重排序平均需要更长时间:jina-reranker-v3 需要 16,064.9 毫秒,而 jina-reranker-v3.5 需要 10,290.9 毫秒。这表示新模型实现了 56% 的速度提升,为应用程序带来更低的延迟以及更低的计算成本。
什么时候应该使用 Jina Reranker v3.5?
重排序几乎在所有情况下都能提升搜索精准度,而 jina-reranker-v3.5 可以应用于各种信息检索场景。不过,它也存在一些限制。下面的表格总结了我们的最佳实践建议:
| 使用场景 | 建议 |
|---|---|
| 常见国际语言的通用文本检索 | 使用 jina-reranker-v3.5。 |
| 法律、金融和医疗领域检索 | 使用 jina-reranker-v3.5。 |
| 半结构化数据、表格、电商产品信息文本 | 使用 jina-reranker-v3.5。 |
| 非文本或混合媒体数据 | 使用支持文本和图像输入的 jina-reranker-m0。 |
如何通过 Elastic Inference API 使用 Jina Reranker 3.5
jina-reranker-v3.5 可以通过 Jina API 使用,并提供免费 token 供你体验。它也可以通过 Elastic Inference API 和 Elastic Inference Service 使用。
如果你已经在使用 jina-reranker-v3,你只需要在发送到 Jina API 的请求中修改 model 字段里的模型名称,或者在配置 Elastic Inference API 端点时修改 model_id 字段即可。这两个模型的接口完全一致。
你可以将 jina-reranker-v3.5 作为 Jina On-Prem 容器安装,以获得一个完全自包含的服务器,并在你自己的硬件上运行。模型权重也可以下载用于测试和研究。请按照 Hugging Face 上该模型页面中的说明进行操作。
在这两种情况下,该模型都基于 CC BY-NC-4.0 许可证提供,因此你可以自由地将其用于测试、构建原型或开展科学研究。对于商业用途,请联系 Elastic 销售团队。
原文:Jina Reranker v3.5: faster legal, medical and structured search - Elasticsearch Labs
933

被折叠的 条评论
为什么被折叠?



