OctoNews

1 三个便宜模型凑在一起「开了个会」,把贵一倍的顶级模型打平了。

技术和认知提升大模型认知提升

#1 三个便宜模型凑在一起「开了个会」,把贵一倍的顶级模型打平了。

Fable 5 被限制访问?没关系。

OpenRouter 刚公布的实测:用一半价格,表现几乎一样。

这不是理论。

#2 具体三人组是:

Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro

Fusion 的做法是让它们并行接同一道题,各自带工具跑完。

然后 judge 模型把所有回答摊开,抓共识、矛盾、盲点,最后合成最终答案。

#3 在 DRACO 这个硬核 benchmark 上(100 道深度研究题,10 个领域,39 项加权评分,答错还扣分):

这个平价三人组 fused 之后,成绩和 Claude Fable 5 差不到 1%。

直接把单飞的 GPT-5.5 和 Opus 4.8 甩在后面。

#4 最妙的是 timing。

Fable 5 现在因为美国出口管制,访问经常失败或不稳定。

想用最顶尖模型的人,突然发现让几个便宜模型「开会」,可能比等单一巨头发力更靠谱。
这事真正戳破的是过去两年的默认假设:

「多花钱、用更大单模型」就能拿到更好结果。

现在看来,模型的「神经多样性」加上强制合成,往往比单一最强模型更有效。

#5 这事真正戳破的是过去两年的默认假设:

「多花钱、用更大单模型」就能拿到更好结果。

现在看来,模型的「神经多样性」加上强制合成,往往比单一最强模型更有效。

#6 OpenRouter 自己拆过数据:

四分之三的提升来自 judge 的「开会总结」(强迫不同视角互相补位)

四分之一来自模型本身的多样性。

不是简单投票,是结构化的互纠和合成。

#7 以后的 frontier 可能不再是「谁的单一模型最猛」。

而是「谁最会让不同模型互相纠错、补盲点」。

单一大模型 + 无脑 scaling 的故事,开始出现裂缝。