欢迎光临
我们一直在努力

复合模型能逼近前沿,但还不能替代

OpenRouter 这条帖本身是产品发布,几小时后的补充才是真正的限定条件。合在一起,他们的说法其实是下面这套。 在这里插入图片描述


Fusion:复合模型能逼近前沿,但还不能替代 Fable

OpenRouter 在 2026 年 6 月发布 Fusion API 时,用了一句很冲的话:「市场上最聪明的复合模型。Fusion 以一半价格达到 Fable 级智力。」

几小时后,他们自己补了一句更重要的话:

目前只评过一项深度研究基准,而且不含长程任务。Fable 的长程能力非常强,两边都还需要专门评测。

把这两段合在一起,OpenRouter 真正的主张不是「Fusion 已经赢了 Fable」,而是:

在深度研究这类任务上,一组模型并行作答再合成,可以打到接近甚至超过单模型前沿的水平,成本更低;但这不等于在所有维度上取代 Fable,尤其不是长程任务。

他们后来说得更直白:Fusion 不是 Fable 的即插即用替代品。


一、他们到底在卖什么

Fusion 不是新训练出来的大模型,而是一套服务端复合系统。

流程很清楚:

  • 用户发一个 prompt。
  • OpenRouter 把它并行分发给一组模型(panel),每个模型都开着 web search 和 bash。
  • 一个 judge / analyst 读完所有回答,抽出结构:共识、矛盾、部分覆盖、独到见解、盲点。
  • 一个 synthesizer 基于这份分析写出最终答案。
  • 对开发者来说,它看起来仍像一个模型:

    • 直接当模型调:"openrouter/fusion"
    • 或者塞进 tools,让外层模型自己决定何时调用:{"type": "openrouter:fusion"}

    也可以自己指定参与模型和合成器。OpenRouter 把它叫成 「模型的神经多样性」:不是一个更强的脑子,而是一屋子不同的脑子,再有人负责综合。


    二、他们用什么证据说话

    评测用的是 Perplexity 的 DRACO:100 道深度研究题,覆盖法律、医学、金融、产品对比等 10 个领域。每题按大约 39 项加权标准打分,答错会扣分,所以灌水、写长并不能刷高分。

    他们强调过一件方法论细节:第一次给 panel 开网页搜索时,模型开始在网上翻到 DRACO 评分标准。他们用 OpenRouter web search 的配置把相关域名排除掉,然后全部重跑。公开数字都来自这份干净设置。

    核心结论有三条:

  • 模型小组 consistently 超过单个模型。
  • 前沿模型组成的 panel,可以打出超前沿成绩。
  • 便宜模型组成的 panel,也能超过单个前沿模型,而且便宜很多。
  • 对应数字(DRACO,越高越好):

    配置分数
    Fusion:Fable 5 + GPT-5.5(Opus 4.8 合成) 69.0%
    Fusion:Opus 4.8 + GPT-5.5 + Gemini 3.1 Pro 68.3%
    Fusion:Opus 4.8 + GPT-5.5 67.6%
    Fusion:Opus 4.8 + Opus 4.8(自己和自己) 65.5%
    单独 Claude Fable 5 65.3%
    Fusion 预算组:Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro 64.7%
    单独 DeepSeek V4 Pro 60.3%
    单独 GPT-5.5 60.0%
    单独 Claude Opus 4.8 58.8%

    最打市场的一组是预算 panel:Flash + Kimi + DeepSeek,合成后 64.7%。它直接超过单独的 GPT-5.5 和 Opus 4.8,离 Fable 5 只差约 1 个百分点,成本大约是 Fable 的一半。

    最强的一组是 Fable 5 + GPT-5.5,69.0%,超过所有单独模型,包括 Fable 自己。

    有两个必须一起读的脚注:

    • Fable 5 有 7/100 题因内容过滤没跑完,Fable 相关分数是按 93 题算的。
    • 换 judge 模型,绝对分会漂 10–25 分。OpenRouter 用的 judge 和原 DRACO 论文不同,所以不能直接拿去跟论文里的分数比,只能看他们内部的相对排序。

    三、增益从哪来:四分之三是合成,四分之一是多样性

    他们测过多组组合后给出一个很具体的拆分:

    Fusion 带来的提升,大约 3/4 来自 synthesis(把多份答案做成一份更好的答案),1/4 来自 diversity(不同模型各有所长)。

    这不是口号。最硬的对照是:把 Opus 4.8 和自己再跑一遍,再合成,分数从 58.8% 到 65.5%,涨了 6.7 分。模型没变,只是多了一轮并行作答和综合。多样性当然有用——Fable + GPT-5.5 比「Opus 自己和自己」更高——但真正的杠杆是合成这一步。

    换句话说,OpenRouter 的技术判断是:下一代能力不一定来自「再训练一个更强的单模型」,而来自把已有模型当委员会用。


    四、他们自己把话说回来了

    如果只看主帖,市场听到的是「半价 Fable」。OpenRouter 自己的回复,是在防止这句话被过度外推。

    限定有三层:

    1. 只评过一种任务。 DRACO 是深度研究:检索、核对、综合、引用。它不是编码基准,也不是长程 agent 基准。

    2. 不含 long-horizon。 多步、长时间、要自己规划、要在很长链条里不崩——这正是他们承认 Fable「extremely impressive」的地方。在这项上,Fusion 还没有对打数据。

    3. 因此不是替代品。 深度研究上可以逼近甚至超过 Fable;需要长程能力的工作流,Fable 短期内仍可能更强。Fusion 也更慢(大约 2–3 倍),适合难问题,不适合当所有请求的默认模型。

    所以完整说法应该是:

    Fusion 证明了:在深度研究上,复合系统已经能用更低成本打到前沿附近,甚至越过单模型天花板。 它没有证明:复合系统已经在智能的所有维度上取代最强单模型。 尤其没有证明:它在长程任务上赢了 Fable。

    主帖负责占领市场位置;补充帖负责守住科学边界。两段必须一起读。


    五、这套说法真正改变了什么

    如果接受 OpenRouter 的证据和他们自己的限定,结论不是「模型竞赛结束了」,而是竞赛的单位变了。

    • 能力:前沿不再只等于「某一个最大的模型」,也可以等于「一组模型和一个好的合成器」。
    • 成本:要接近 Fable 级深度研究,不一定要付 Fable 的价格;一组中档模型就可能够用。
    • 韧性:单模型被过滤、限速、下线或出口管制卡住时,panel 仍然能出活。这在 Fable 相关限制出现后,格外有现实意义。
    • 产品形态:开发者可以继续调一个 slug,不必自己编排多模型路由。

    但边界也很清楚:这是 deep research 上的复合智能,不是通用智能的终局声明。OpenRouter 自己都说,下一步必须把 Fusion 和 Fable 一起放到 long-horizon 基准上打。在那之前,「半价 Fable」只在 DRACO 这类深度研究任务上成立。


    一句话版本: OpenRouter 认为,AI 的下一步是模型委员会而不是单模型霸权;他们用 DRACO 证明了这一点,又用自己的补充把范围锁死——现在赢的是深度研究,还没轮到长程任务。

    赞(0)
    未经允许不得转载:171主机测评 » 复合模型能逼近前沿,但还不能替代
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址