Deep Manifold 分析稀疏路由与独立专家特化如何在混合专家模型中产生几何不连续性,进而威胁流形连续性。
AI translation, not an official translation. Refer to the original for technical details.
Adapted from @BetaTomorrow# 关于混合专家模型的数学思考 中文版:关于混合专家模型的数学思考 (https://x.com/BetaTomorrow/status/2093225594276450665) Deep Manifold 认为,神经网络的表达能力植根于两个基本性质:无特定属性的激活函数,以及满秩的关系变换。神经网络所学习的并非数据本身,而是数据之间的关系——这一观点与范畴论天然契合:在范畴论中,关系结构比单个对象的内在同一性更为根本。然而,正如《Deep Manifold 第二部分:神经网络数学》第 4.6 节"数据复杂性"以及《单词元几何 03:数据复杂性》所讨论的,期望一个全局共享的单一满秩变换能够表示异质数据的全部复杂性,既不合理,在一般情况下也缺乏数学上的适当性。混合专家模型(MoE)架构的出现有其充分的理由:它放宽了对所有输入均须经过同一变换处理的要求,转而将关系计算分布至多个专家之间。(https://x.com/BetaTomorrow/status/2070113382347461038) (https://arxiv.org/abs/2512.06563) (https://x.com/BetaTomorrow/status/2050461737363951997) 因此,审视并潜在地改进混合专家模型的一个切入点,始于几何学,更具体地说,始于学习过程所构建的流形结构。核心问题不再仅仅是使用多少专家、如何路由词元,或如何平衡专家负载,而是:由局部学习所得的流形集合,能否在几何上保持连续、在拓扑上保持相容,并在功能上作为一个连贯的神经网络被重新组合。 ## 流形同调与混合专家模型的不稳定性 因此,当前的混合专家模型架构极有可能产生参差不齐的神经不动点场——原因在于:稀疏路由对计算进行了分割,专家在不均等的参与下趋于特化,局部几何结构半独立地演化,而其输出最终必须跨越不连续的路由边界加以重新组合。这些效应可能在局部能力较强的区域之间造成剧烈的突变。这种参差性对智能体工作负载而言尤为有害——此类负载要求在众多功能区域间保持长而连贯的轨迹,使路径连续性更难以维持,并在长时间执行过程中加剧不稳定性与累积误差。 这引入了一个结构性的不稳定来源。路由边界、不均等的专家参与,以及各专家独立演化的几何结构,可能逐渐削弱局部流形之间的相容性。从 Deep Manifold 的视角来看,这种失效可以理解为流形撕裂:单个专家内部局部有效的计算路径可能依然完好,而连接这些路径、横贯整个模型所需的关系连续性,则开始断裂。(https://x.com/BetaTomorrow/status/2047842924923416696) DeepSeek V4 展示了如何在局部层面约束这种撕裂,防止其蔓延为更大范围的架构失效。正如《DeepSeek V4 的数学思考》所述,SwiGLU 截断限制了极端激活及其引发撕裂的局部曲率尖峰;预判路由提升了专家分配与产生词元表示的流形状态之间的一致性;而 mHC 则限制了残余不连续性通过残差流的传播。(https://x.com/BetaTomorrow/status/2084846064201261375) Kimi K3 揭示了为何随着 MoE 规模扩大,重组问题变得愈发重要。MoE 的核心本质是一种分布式计算:计算被拆分、路由、在局部应用,随后汇回统一的计算通路。以 MapReduce 的语言来说,更广泛地从拆分–应用–合并(split–apply–combine)模式来看,愈来愈困难的步骤正是 Reduce 操作。挑战不仅在于高效分配计算,更在于如何将独立处理的局部结构重新合并,同时不破坏关系信息、不引入瓶颈、不导致训练不稳定,也不需要越来越多的修正机制。K3 围绕这一问题引入了若干协调一致的机制。从深度流形(Deep Manifold)视角来看,其类 Reduce 机制可被解读为:在恢复分布式计算的同时,尽力保留足够的局部流形同调性,使更大规模的模型保持整体连贯。(https://x.com/BetaTomorrow/status/2082308991968043098) 结合极度稀疏的路由,这些机制可被视为一套协调一致的几何防御:钳制(clamping)控制前置条件,路由一致性控制撕裂事件的发生,残差约束控制其传播扩散。这些机制本身并不能建立全局流形同调性,但它们阻断了局部几何失配向各专家和各层级扩散蔓延的级联过程。 ## 在架构与训练中保持几何弹性 我们提出了联邦流形(Federated Manifold)的理念,用以应对学习中的数据复杂性;参见《深度流形第二部分:神经网络数学》第 7.3 节"小型弹性模型的马赛克"及第 7.6 节"联邦学习"。在 MoE 的语境下,这在概念上更接近稀疏 MoE 或超稀疏 MoE。其核心目标是保持模型弹性。从几何角度而言,弹性允许每个局部流形在学习新关系时进行弯曲、伸展与重组,而无需强制产生突变曲率、撕裂局部邻域或破坏与相邻流形的重叠。因此,足够的弹性有助于在专家持续专业化的同时,保持平滑的图(chart)转换、几何连续性以及同调相容性。(https://x.com/BetaTomorrow/status/2079138650525458888) (https://arxiv.org/abs/2512.06563) 然而,架构只是问题的一半。由于 MoE 天然更易受路由不连续性、专家负载失衡以及局部几何独立演化的影响,其训练过程也应当是分阶段、渐进式的,参见《强化学习的数学考量》。边界条件应尽量保持弱约束、对称、渐进且与几何相容,从而使专业化自然涌现,而非过早强制局部发生急剧变形。训练进程应逐步提高任务难度、路由专业化程度以及专家分化程度,同时持续保持演化流形中各部分之间的连通性。在此视角下,MoE 的稳定性由架构与训练进程共同决定。(https://x.com/BetaTomorrow/status/2089653917810675855) (https://x.com/BetaTomorrow/status/2076813115665293642) - 神经网络架构的数学考量 (https://x.com/BetaTomorrow/status/2037682795355762727) - 全能模型架构的数学考量 (https://x.com/BetaTomorrow/status/2074891797466374309) - 超大型单体模型的数学考量 (https://x.com/BetaTomorrow/status/2065454698711437810) - 流形联邦的数学考量 (https://x.com/BetaTomorrow/status/2080012178447577417) - 开放式基础模型的数学考量 (https://x.com/BetaTomorrow/status/2058451094750048365) - 自演化神经网络的数学考量 (https://x.com/BetaTomorrow/status/2079136928608452903) 本文现已收录于《深度流形,两年回顾:2024–2026》中的架构与数学考量系列。(https://x.com/BetaTomorrow/status/2080057647160824276) - 什么是深度流形?(https://x.com/BetaTomorrow/status/2070113382347461038) - 神经不动点场 (https://x.com/BetaTomorrow/status/2075335417189257256) - 学习是一个逆问题 (https://x.com/BetaTomorrow/status/2063266723336499444) - 深度流形模型缩放 (https://x.com/BetaTomorrow/status/2090563679666491438) - AI 中被忽视的基础数学 (https://x.com/BetaTomorrow/status/2092582946356261361)