1 三个便宜模型凑在一起「开了个会」,把贵一倍的顶级模型打平了。
#1 三个便宜模型凑在一起「开了个会」,把贵一倍的顶级模型打平了。
Fable 5 被限制访问?没关系。
OpenRouter 刚公布的实测:用一半价格,表现几乎一样。
这不是理论。
#2 具体三人组是:
Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro
Fusion 的做法是让它们并行接同一道题,各自带工具跑完。
然后 judge 模型把所有回答摊开,抓共识、矛盾、盲点,最后合成最终答案。
#3 在 DRACO 这个硬核 benchmark 上(100 道深度研究题,10 个领域,39 项加权评分,答错还扣分):
这个平价三人组 fused 之后,成绩和 Claude Fable 5 差不到 1%。
直接把单飞的 GPT-5.5 和 Opus 4.8 甩在后面。
#4 最妙的是 timing。
Fable 5 现在因为美国出口管制,访问经常失败或不稳定。
想用最顶尖模型的人,突然发现让几个便宜模型「开会」,可能比等单一巨头发力更靠谱。
这事真正戳破的是过去两年的默认假设:
「多花钱、用更大单模型」就能拿到更好结果。
现在看来,模型的「神经多样性」加上强制合成,往往比单一最强模型更有效。
#5 这事真正戳破的是过去两年的默认假设:
「多花钱、用更大单模型」就能拿到更好结果。
现在看来,模型的「神经多样性」加上强制合成,往往比单一最强模型更有效。
#6 OpenRouter 自己拆过数据:
四分之三的提升来自 judge 的「开会总结」(强迫不同视角互相补位)
四分之一来自模型本身的多样性。
不是简单投票,是结构化的互纠和合成。
#7 以后的 frontier 可能不再是「谁的单一模型最猛」。
而是「谁最会让不同模型互相纠错、补盲点」。
单一大模型 + 无脑 scaling 的故事,开始出现裂缝。