多模型融合推理:花 Fable 5 一半的钱,效果反而更好

每个做 AI 开发的人最终都会面对同一个取舍:怎么让花的每一块钱都换来尽可能高的智能——为每个任务找到最合适的模型、最合适的成本。这正是 DigitalOcean 推理引擎被设计出来的初衷。在最困难的深度研究任务上,将多个模型的输出结果做一次融合,效果要远远好过只靠一个模型。一个全部由开源模型组成的组合(GLM 5.2 + Kimi K2.6),其得分超过了我们测试的每一个单模型,包括 Fable 5,而每个任务的成本却只有它的大约一半。

多模型融合推理 是 DigitalOcean 推理引擎 上一个全新的服务端工具,它会替你完成这项编排工作。它按照你定义的模型配置来运行:你设定一个模型组合,组里的模型并行处理每个请求;再指定一个融合模型,由它来审阅模型组合的输出,并融合成一份最终回复……你可以从优化好的预设起步,也可以自己来定义模型组合和融合模型。如果你不确定模型应该怎么选,可以联系DigitalOcean中国区战略合作伙伴卓普云(aidroplet.com)的技术支持团队。

这确实划得来。我们在 DRACO 上对多模型融合推理做了基准测试——DRACO 是一个包含 100 个任务的深度研究基准,覆盖了 15 种开源和前沿模型配置。关键结果如下:

  • GLM 5.2 + Kimi K2.6 模型组合以每个任务 $0.83 的成本,在质量上拿到 65.65% 的得分,超过了 Fable 5 的 62.21%(每个任务 $1.59),也超过了其他每一个单模型的得分。
  • 有四种开源组合落在了理想象限里,也就是以更低的成本提供了更高的质量。
  • Fable 5 + GPT-5.6 的前沿模型组合以每个任务 $4.76 的成本拿到 69.01% 的质量得分,是我们测试过的所有模型配置里质量最高,同时也是成本最高的。

我们在一系列研究查询上评估了多模型融合推理的响应质量和成本效率,用质量得分(越高越好)和单任务成本(运行一个任务的推理成本,越低越好)来衡量。下面的图表将每种配置的质量与单任务成本做了对比:理想象限是左上角,那里质量最高而单任务成本最低。最好的开源配置正好落在这个理想象限里——与前沿单模型相比,它们质量更高,单任务成本更低。(开源单模型则位于左下角:更便宜,但质量也更低。)

质量与成本对比

图 1. 质量得分与单任务成本(美元),越靠左上角越好;横轴为对数坐标,因此每一条网格线意味着成本翻倍。阴影区域标出了在两项指标上都超越 Fable 5 的配置——质量更高,成本更低。开源的 GLM 5.2 + Kimi K2.6 模型组合最为突出:它的得分高于包括 Fable 5 在内的每一个单模型,成本却只有 Fable 5 的大约一半。前沿的 Fable 5 + GPT-5.6 组合在质量上占据最高点,但也付出了高昂的成本;便宜的开源单模型则位于左下角,最便宜,但质量也最低。每个模型组合中,第一个列出的模型是融合模型。

我们是如何测试的

我们在 DRACO 上将多模型融合推理与单模型做了基准测试对比。DRACO 是一个公开的深度研究基准,它专为那种靠一次快速回答根本搞不定的问题而设计。它提出了 100 个很有挑战性的研究任务,覆盖了十个真实世界领域,从法律、医学到金融和产品对比。每个任务都是开放式且需要大量证据支撑的——这些问题要想给出一个好答案,必须从多个角度收集事实、加以权衡,并给出详尽且有引用的回复,而不是一句话打发了事。每个任务都附带一份详细的评分标准,列出了一份好答案应该覆盖的具体要点,然后由一个独立的评判员根据答案包含并支撑了多少这些要点来打分。因为同一个评判员按照同一套评分标准为所有配置打分,所以这些得分之间可以直接对比。这种广度以及证据层面的工作,恰恰是多模型融合推理被设计来提升的地方,这也是我们选择 DRACO 的原因。对每种配置,我们都记录了一个质量得分和一个单任务成本。我们比较了 15 种配置:4 个单模型(前沿的 GPT-5.6 和 Fable 5,加上开源的 DeepSeek V4 Pro 和 GLM 5.2),以及 11 种模型配置——它们在模型组合和融合模型上各不相同,其中 1 个是前沿模型组合,10 个是开源组合。完整数据见下文中的表 1 和表 2。

测试结果

最出色的那个开源模型配置,在本次基准测试中的得分超过了每一个被测试的单模型,而且大多数模型配置都击败了最强的单模型。与前沿单模型相比,最好的开源多模型组合配置(GLM 5.2 + Kimi K2.6)同时比 Fable 5 和 GPT-5.6 提供了更高的质量,而单任务成本却更低。这里的取舍是与最便宜的开源单模型相比:GLM 5.2 和 DeepSeek V4 Pro 每个任务的运行成本更低,但质量也要低得多。表 1 按质量从高到低列出了我们端到端测量过的配置,并附上了单任务成本。

images (4).jpeg

表 1. 质量得分越高越好,单任务成本越低越好。GLM 5.2 + Kimi K2.6 模型组合和 DeepSeek V4 Pro + Kimi K2.6 模型组合均由 DeepSeek 担任融合模型,二者在同一基准上评分,但本轮运行中未单独计量成本,因此它们按得分列在表 2 中。它们的单任务成本与其他双模型组合处于同一区间。注:成本及单任务成本基于测试时的 token 定价与用量(2026 年 7 月)。

两个规律非常突出。第一,融合模型的选择决定了质量。在每一个模型组合上,GLM 5.2 做融合模型时效果最好,DeepSeek V4 Pro 次之,Kimi K2.6 最后。第二,最好的双模型组合和最好的三模型组合一样强大。表 2 按质量列出了每一种模型组合和融合模型的组合。

images (5).jpeg

表 2. 每一种开源模型配置的质量得分。行为模型组合,列为融合模型。绿色单元格表示超越了最强单模型(GPT-5.6 得分 64.32)。作为参考的单模型:GPT-5.6 64.32,Fable 5 62.21,DeepSeek V4 Pro 58.15,GLM 5.2 58.12。作为参考的前沿模型组合:Fable 5 + GPT-5.6 69.01。

images (6).jpeg

图 2. 每种模型配置按质量得分排名(DRACO,100 个任务;越高越好)。开源模型配置以绿色显示,单模型以灰色显示,前沿配置以黑色显示。大多数开源配置都越过了最强单模型这条线。

你选择的融合模型决定了质量

在每一个模型组合上,GLM 5.2 都是最强的融合模型,DeepSeek V4 Pro 排在第二,Kimi K2.6 排在最后。只更换融合模型,就能让一个模型配置的得分浮动 3 到 5 分,这比双模型组合和三模型组合之间的差距还要大。事实上,最好的双模型组合(65.65)击败了三模型组合(65.21),所以多加一个开源模型在质量上基本没有额外收益。这里的实践启示是:先选一个强大的融合模型,模型组合保持精简就好。

效率:大约一半成本换来高质量

就它交付的质量而言,这个最好的模型配置在成本上也同样胜出。GLM 5.2 配合 Kimi K2.6 的组合,每个任务仅需 $0.83 就能拿到 65.65 分,比所有单模型得分都高,成本却只有 Fable 5($1.59)的大约一半,比 GPT-5.6($1.39)也低了约 40%。你获得了比前沿模型更高的质量,花的钱反而更少。唯一更便宜的选项是单独裸用开源模型(GLM 5.2 每个任务 $0.25,或 DeepSeek V4 Pro 每个任务 $0.31),便宜了几倍,但质量也处于最低一档。所以如果你要的只是尽可能压到最低的成本,单个开源模型确实很难被打败;但如果你追求的是每块钱能换来最高的质量,一个开源模型组合再加上 GLM 5.2 做融合模型,就能以最强单模型大概一半的成本,彻底胜过它们。

单任务成本(美元)基于测试时(2026 年 7 月)的具体定价,并可能随第三方 API 费率调整而变动。(越低越好)

这对你来说意味着什么

贯穿始终的主题是单位成本的智能产出:把你投入的智能用量和每个任务真正需要的智能水平匹配起来。多模型融合推理给了你一个调节旋钮来完成这件事,而不是让你从头去解一道取舍难题。对于那种体量大、成本敏感的工作(比如大规模分类、日常摘要),一个像 GLM 5.2 这样的开源单模型能给你最低的单任务成本。对于那种研究性质很重、答案质量比账单更重要的任务(比如尽职调查、竞品分析、法律或医学研究),把 GLM 5.2 和 Kimi K2.6 组合在一起,用 GLM 做融合模型。同样的工具,同样的 API,只是换了一个设置,你就能完全不依赖前沿模型而搞定这一切。

DigitalOcean 推理引擎的设计目标,就是让你以合适成本获得恰如其分的智能产出。推理路由器和多模型融合推理会协同完成这件事。推理路由器根据你的偏好——成本、延迟和质量——为每个请求选择最合适的模型。而多模型融合推理则是当你觉得一个模型不够、希望多个模型同时攻关同一个问题时,你会伸手去拿的工具。两者加在一起,给了你从单模型路由到跑完整模型组合的全部选择空间,却不需要改变你调用 API 的方式。

开始使用

多模型融合推理现已在 DigitalOcean 推理引擎 上进入公开预览阶段,与模型评估功能一起上线。选择一个优化好的预设,或者直接选择模型和配置——全都通过一次推理调用完成。

预设

根据你的使用场景,直接使用我们优化好的预设

  • 预算型: 成本最低的配置,使用较小的模型组合和较轻的推理设置。
  • 均衡型: 中等规模的模型组合加上中等的推理深度,在质量与成本之间取得平衡。
  • 质量型: 最大规模的模型组合和最深度的推理配置,代价是更高的成本和延迟。

DigitalOcean 推理引擎将每个预设解析为一组经过验证的融合模型、模型组合和推理配置。随着模型、定价和性能的改进,底层配置可以在不要求你改动集成代码的前提下持续更新。

curl -X POST https://inference.do-ai.run/v1/chat/completions \
  -H "Authorization: Bearer $DO_INFERENCE_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.2",
    "messages": [{"role": "user", "content": "你的研究问题放在这里"}],
    "tools": [{
      "type": "model_synthesis",
      "preset": "balanced"
    }]
  }'

直接配置

顶层 model 是融合模型,而多模型融合推理工具里 analysis_models 列表就是模型组合。推理力度在两个位置设置:顶层的值控制融合模型,工具内部的值控制模型组合。

curl -X POST https://inference.do-ai.run/v1/chat/completions \
  -H "Authorization: Bearer $DO_INFERENCE_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.2",
    "messages": [{"role": "user", "content": "你的研究问题放在这里"}],
    "reasoning_effort": "high",
    "tools": [{
      "type": "model_synthesis",
      "model": "glm-5.2",
      "analysis_models": ["glm-5.2", "kimi-k2.6"],
      "reasoning_effort": "high"
    }]
  }'

*免责声明与测试方法:质量指标基于一个公开的深度研究基准(DRACO,覆盖十个领域的 100 个任务)进行衡量,由独立的 LLM 评判员打分。显示的各项指标(质量和成本)反映了 2026 年 7 月使用 DRACO 基准(100 个任务)在受控测试中的结果。这些结果仅供参考,不保证未来能达到相同表现。单任务成本(美元)来源于实际测量的 token 用量和各模型定价(越低越好)。Fable 5 的结果(包括单模型和融合推理配置)覆盖 93 个任务,因为 Fable 5 的安全护栏拦截了其中 7 个输入。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值