OpenRouter 这条帖本身是产品发布,几小时后的补充才是真正的限定条件。合在一起,他们的说法其实是下面这套。 
Fusion:复合模型能逼近前沿,但还不能替代 Fable
OpenRouter 在 2026 年 6 月发布 Fusion API 时,用了一句很冲的话:「市场上最聪明的复合模型。Fusion 以一半价格达到 Fable 级智力。」
几小时后,他们自己补了一句更重要的话:
目前只评过一项深度研究基准,而且不含长程任务。Fable 的长程能力非常强,两边都还需要专门评测。
把这两段合在一起,OpenRouter 真正的主张不是「Fusion 已经赢了 Fable」,而是:
在深度研究这类任务上,一组模型并行作答再合成,可以打到接近甚至超过单模型前沿的水平,成本更低;但这不等于在所有维度上取代 Fable,尤其不是长程任务。
他们后来说得更直白:Fusion 不是 Fable 的即插即用替代品。
一、他们到底在卖什么
Fusion 不是新训练出来的大模型,而是一套服务端复合系统。
流程很清楚:
对开发者来说,它看起来仍像一个模型:
- 直接当模型调:"openrouter/fusion"
- 或者塞进 tools,让外层模型自己决定何时调用:{"type": "openrouter:fusion"}
也可以自己指定参与模型和合成器。OpenRouter 把它叫成 「模型的神经多样性」:不是一个更强的脑子,而是一屋子不同的脑子,再有人负责综合。
二、他们用什么证据说话
评测用的是 Perplexity 的 DRACO:100 道深度研究题,覆盖法律、医学、金融、产品对比等 10 个领域。每题按大约 39 项加权标准打分,答错会扣分,所以灌水、写长并不能刷高分。
他们强调过一件方法论细节:第一次给 panel 开网页搜索时,模型开始在网上翻到 DRACO 评分标准。他们用 OpenRouter web search 的配置把相关域名排除掉,然后全部重跑。公开数字都来自这份干净设置。
核心结论有三条:
对应数字(DRACO,越高越好):
| Fusion:Fable 5 + GPT-5.5(Opus 4.8 合成) | 69.0% |
| Fusion:Opus 4.8 + GPT-5.5 + Gemini 3.1 Pro | 68.3% |
| Fusion:Opus 4.8 + GPT-5.5 | 67.6% |
| Fusion:Opus 4.8 + Opus 4.8(自己和自己) | 65.5% |
| 单独 Claude Fable 5 | 65.3% |
| Fusion 预算组:Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro | 64.7% |
| 单独 DeepSeek V4 Pro | 60.3% |
| 单独 GPT-5.5 | 60.0% |
| 单独 Claude Opus 4.8 | 58.8% |
最打市场的一组是预算 panel:Flash + Kimi + DeepSeek,合成后 64.7%。它直接超过单独的 GPT-5.5 和 Opus 4.8,离 Fable 5 只差约 1 个百分点,成本大约是 Fable 的一半。
最强的一组是 Fable 5 + GPT-5.5,69.0%,超过所有单独模型,包括 Fable 自己。
有两个必须一起读的脚注:
- Fable 5 有 7/100 题因内容过滤没跑完,Fable 相关分数是按 93 题算的。
- 换 judge 模型,绝对分会漂 10–25 分。OpenRouter 用的 judge 和原 DRACO 论文不同,所以不能直接拿去跟论文里的分数比,只能看他们内部的相对排序。
三、增益从哪来:四分之三是合成,四分之一是多样性
他们测过多组组合后给出一个很具体的拆分:
Fusion 带来的提升,大约 3/4 来自 synthesis(把多份答案做成一份更好的答案),1/4 来自 diversity(不同模型各有所长)。
这不是口号。最硬的对照是:把 Opus 4.8 和自己再跑一遍,再合成,分数从 58.8% 到 65.5%,涨了 6.7 分。模型没变,只是多了一轮并行作答和综合。多样性当然有用——Fable + GPT-5.5 比「Opus 自己和自己」更高——但真正的杠杆是合成这一步。
换句话说,OpenRouter 的技术判断是:下一代能力不一定来自「再训练一个更强的单模型」,而来自把已有模型当委员会用。
四、他们自己把话说回来了
如果只看主帖,市场听到的是「半价 Fable」。OpenRouter 自己的回复,是在防止这句话被过度外推。
限定有三层:
1. 只评过一种任务。 DRACO 是深度研究:检索、核对、综合、引用。它不是编码基准,也不是长程 agent 基准。
2. 不含 long-horizon。 多步、长时间、要自己规划、要在很长链条里不崩——这正是他们承认 Fable「extremely impressive」的地方。在这项上,Fusion 还没有对打数据。
3. 因此不是替代品。 深度研究上可以逼近甚至超过 Fable;需要长程能力的工作流,Fable 短期内仍可能更强。Fusion 也更慢(大约 2–3 倍),适合难问题,不适合当所有请求的默认模型。
所以完整说法应该是:
Fusion 证明了:在深度研究上,复合系统已经能用更低成本打到前沿附近,甚至越过单模型天花板。 它没有证明:复合系统已经在智能的所有维度上取代最强单模型。 尤其没有证明:它在长程任务上赢了 Fable。
主帖负责占领市场位置;补充帖负责守住科学边界。两段必须一起读。
五、这套说法真正改变了什么
如果接受 OpenRouter 的证据和他们自己的限定,结论不是「模型竞赛结束了」,而是竞赛的单位变了。
- 能力:前沿不再只等于「某一个最大的模型」,也可以等于「一组模型和一个好的合成器」。
- 成本:要接近 Fable 级深度研究,不一定要付 Fable 的价格;一组中档模型就可能够用。
- 韧性:单模型被过滤、限速、下线或出口管制卡住时,panel 仍然能出活。这在 Fable 相关限制出现后,格外有现实意义。
- 产品形态:开发者可以继续调一个 slug,不必自己编排多模型路由。
但边界也很清楚:这是 deep research 上的复合智能,不是通用智能的终局声明。OpenRouter 自己都说,下一步必须把 Fusion 和 Fable 一起放到 long-horizon 基准上打。在那之前,「半价 Fable」只在 DRACO 这类深度研究任务上成立。
一句话版本: OpenRouter 认为,AI 的下一步是模型委员会而不是单模型霸权;他们用 DRACO 证明了这一点,又用自己的补充把范围锁死——现在赢的是深度研究,还没轮到长程任务。




