一项涵盖67个前沿模型的研究表明,多模型系统的性能上限由所有模型共同失败的联合区域决定,而非模型数量或成对多样性。
AI translation, not an official translation. Refer to the original for technical details.
Adapted from @BetaTomorrow该论文表明,多模型系统的性能由失败的高阶联合结构所决定,尤其是所有模型共同失败的区域,而非模型数量或平均成对多样性。其共失败率β衡量了仅能从现有模型答案中进行选择的系统中这一不可消除区域的大小,而成对相关性是不充分的,因为它们无法还原高阶共模失败。
从深度流形的视角来看,这一共享的共失败区域可以被解读为未被模型组合不动点吸引域所覆盖的区域:在给定提示的边界条件下,没有任何成员模型包含通向正确答案的可行内在路径。
多项选择与开放式回答之间的对比结果尤其具有揭示意义:选项提供了强烈、离散的边界条件,从而缩小了解空间;而开放式回答则削弱了边界,暴露出共享的缺失不动点类别。静态路由器性能不佳同样契合这一观点:路由器必须在看到某条路径是否收敛之前就选定模型,因此仅凭提示进行路由往往是欠定的。
更强大的联邦机制应当是迭代式的:尝试一条路径、检查残差或验证证据、修改边界、切换模型或工具,然后继续推进。因此,该论文支持流形联邦的理念(深度流形第二部分:神经网络数学),但前提是各模型具有真正互补的收敛吸引域,且智能体能够检测失败并在它们之间切换。