四个数学原则——无属性计算、早期边界耦合、弹性内部架构与下游任务分离——构成全模态神经网络设计的基础。
AI translation, not an official translation. Refer to the original for technical details.
Adapted from @BetaTomorrow# 关于全模态架构的数学思考 English Edition: Mathematical Considerations for Omni-Model Architectures (https://x.com/BetaTomorrow/status/2074891797466374309) 无属性神经计算、早期边界耦合、灵活的内部架构与下游任务分离 全模态(Omni-Model)通常被讨论为一个架构问题:如何将图像单标化,如何将文本与音频结合,如何路由不同模态,或者如何在一个系统中生成多种形式的输出。Chameleon 将图像离散化为单标。Transfusion 将自回归文本生成与连续的扩散式图像建模结合起来。Mixture-of-Transformers 架构在保持跨模态受控交互的同时,保留了模态特定的参数。 这些都是重要的工程选择,但它们是在一个更基本的问题已经被回答之后才开始的: 为什么一个神经网络能够同时处理文本、图像、音频、视频和物理信号? 从深度流形的角度看,在选择具体的全模态架构之前,应该先考虑四个数学问题: - 神经网络是无属性的。 - 不同模态应当被耦合在同一个边界条件之下。 - 内部计算架构可以保持灵活。 - 图像生成和视频更适合作为下游任务来处理。 ## 无属性计算使全模态成为可能 神经激活并不是天然视觉的、语言的、声学的或物理的。它只是一个数值状态。网络本身并不知道一个数值来自一个词、一个图像块、一段声波,还是一个传感器。模态不是激活的内在属性;意义是由数据、关系、学习到的参数和边界条件共同赋予的。 这就是我们说神经网络是无属性的含义。它提供了一个通用的数值基底,可以变换、累积、比较、计数和迭代,而不会给计算单元预先分配永久的语义身份。因此,同一套计算机制可以参与非常不同的学习空间。 无属性是全模态成为可能的根本原因。如果神经计算天然绑定于某一种特定媒介,那么多模态统一就需要在不同计算实体之间进行僵硬的翻译。神经网络避免了这个限制,因为它的激活并不会被永久分配给某一个物理或语义类别。 但是,无属性并不意味着表示上的统一化。图像、音频、语言和物理传感器信号仍然具有不同的结构,并且可能需要模态特定的单标化器、编码器、投影、注意力模式或局部路径。 重点不是这些媒介是相同的。重点是,它们不同的物理结构可以在同一个无属性的数值基底中被计算。真正的问题是:这些模态在学习和推理过程中应当如何被表示、耦合和约束。 ## 同一边界,同一学习空间 将不同模态置于同一个边界条件之下,是为了在它们之间保持流形同调。在《Deep Manifold Part 1: Anatomy of Neural Network Manifold》中,我们引入了学习空间的概念。按照这个定义,将不同模态置于同一个边界条件之下,意味着所有模态的数据都在同一个学习空间中被训练。 (https://arxiv.org/abs/2409.17592) (https://x.com/BetaTomorrow/status/2076814518383235331) 当文本、图像、音频和其他信号受同一个任务边界约束时,它们的内部表示会朝向同一个预测结果被塑造。它们可能起源于不同的物理结构,并使用不同的局部编码,但共享边界会使它们的路径在一个相互约束的学习空间中发展。因此,随着演化,它们的表示更有可能保持同调。 传统的潜空间方法通常采用相反的顺序。每一种模态先形成自己的表示,通常通过不同的编码器、架构、训练历史或坐标系统。然后,这些表示再被投影、对齐、拼接,或通过注意力连接起来。但是,在不同空间中生成的表示并不会自动共享同一种几何。数值上的对齐并不能保证邻域、路径、边界或高阶关系被保留下来。 这使得潜空间耦合在结构上很脆弱。对齐可能在训练分布的局部范围内有效,但在新的提示、任务或扰动之下,拼接后的表示可能会沿着原始模态空间中的隐藏不兼容性发生分离。用深度流形的话说,这就是流形撕裂的风险。 早期边界耦合反转了这个构造顺序。它不是先独立形成各模态表示,再事后协调它们,而是在各模态的内在表示仍在形成时,就把它们置于同一个任务边界之下。共享预测和联合评估的损失值,使跨模态关系成为表示形成过程本身的一部分。 其目的不是强迫所有模态进入相同坐标。图像、语言、音频和物理信号仍然应当保留各自不同的局部结构。真正的目的,是让这些结构在同一个共同约束下演化,从而使跨模态流形同调成为学习出来的结果,而不是事后重构出来的结果。 在训练过程中,共享边界可以表现为一个联合评估的损失值。在推理时,它可以由提示、指令、请求输出、物理约束、控制目标或环境条件建立。其数学作用是相同的:它定义了各模态必须在其中相互作用的任务空间。 局部保留,共同条件化,整体收敛。 ## 弹性架构 一旦不同模态被耦合在同一个边界条件之下,内部架构就不必只有一种固定形式。它可以是稠密的、稀疏的、基于 MoE 的、模块化的,或者联邦化的。 稠密全模态使用大体共享的参数空间。这有助于跨模态迁移,但当不同学习空间竞争同一容量时,也可能产生干扰。 Mixture-of-Experts 架构提供了一种隐式联邦。不同单标、模态或任务被路由到不同专家,同时所有专家仍然在一个联合训练的系统内部被协调。 模块化架构提供了一种显式联邦。文本、视觉、音频、物理推理或领域特定模型可以保留各自不同的参数空间,并且只在共享任务需要时进行通信。 这些架构以不同方式分配计算,但服务于同一个目的:协调模态特定路径,并产生一个由共同任务边界评估的联合预测值。 这区分了两个问题:边界定义学习问题,而架构定义计算如何在其中被组织。 因此,全模态可能不存在唯一自然的架构。稠密模型适合高度共享的结构;MoE 适合在一个全局系统内部进行专业化;模块化联邦适合那些学习空间差异较大的模态或领域,因为强行把它们放入同一个参数空间,可能会造成干扰、容量浪费或刚性。 异步训练也符合这一观点。一个成熟的文本组件可以被冻结,同时训练新的视觉或音频路径;只要新的路径能够连贯地贡献于共同预测,并满足共享边界即可。 ## 基础之外的任务 图像生成、视频生成、目标检测、语音生成和机器人控制,应当被看作全模态基础之外的下游任务;每一种任务都由其自身的任务特定边界条件所支配。 从深度流形的角度看,图像生成和视频不应自动被视为全模态预训练空间中的等价组成部分。它们更适合被理解为建立在已学习多模态基础之上的下游任务。 图像生成作为下游任务 图像可以作为输入模态参与预训练,为共享流形提供视觉结构、空间关系、对象信息和物理证据。 但是,图像生成是下游任务,而不是另一种输入模态。它要求模型在特定边界条件下构造视觉输出。一个模型可以理解图像而不生成像素;图像生成本身也不能保证模型拥有适合推理、物理理解或控制的连贯跨模态流形。 离散图像单标、扩散、流匹配或自回归解码,都是附着在已学习基础之上的输出求解器。它们不应定义全模态本身的数学结构,图像生成损失也不应自动主导基础预训练。 视频是下游时间任务 视频携带显式时间戳。静态图像描述的是空间状态,而视频描述的是状态随时间的演化。 每一帧都不是独立的图像单标。它的意义取决于运动、对象持续性、因果交互和时间连续性。因此,时间戳是视频边界结构的一部分,而不仅仅是元数据。 因此,视频不应被简单放入与文本、静态图像或音频相同的静态几何空间。视频序列占据的是不断变化的时空流形。将其压平成普通单标,可能保留局部帧外观,却丢失对象身份、运动、因果性或物理连续性。 这使视频容易发生流形撕裂。因此,视频更适合作为建立在全模态基础之上的下游时间任务,并可能需要自己的时间求解器、记忆结构、扩散过程、世界模型或时间条件化流形。 将基础与任务求解器分开 全模态应当被理解为一个共享的多模态计算基础,而不是一个必须直接实现所有可能输出过程的单一架构。 它的基础目的,是在理解任务所需的各模态之间建立流形同调。不同模态被耦合在共享边界条件之下,使它们的内在表示在一个相互约束的学习空间中发展。 下游任务求解器随后可以在这个基础之上运行: - 图像生成施加视觉输出边界。 - 视频生成施加时空演化边界。 - 语音生成施加声学输出边界。 - 机器人控制施加物理动作边界。 - 预测施加未来状态边界。 每一种任务都可能需要不同的解码器、数值求解器、损失、时间结构或专门模块。这种分离保留了架构的灵活性。核心 全模态可以保持稠密,也可以是基于 MoE 的隐式联邦,或模块化的显式联邦。图像和视频生成器可以作为下游模块连接上去,而不必把它们专门的输出几何强行纳入基础表示空间。 全模态应当在共同边界条件下建立一个同调的多模态基础。生成和时间演化应当被视为由各自输出边界条件支配的下游任务 ## 结论 全模态成为可能,始于神经计算的无属性本质。由于神经激活没有内在的媒介身份,文本、图像、音频和物理信号都可以在同一个数值基底中被处理。 但是,无属性并不意味着表示上的统一化。不同模态仍然需要不同的局部编码、路径和计算结构。它们的内在表示并不只由媒介类型决定,而是由任务边界塑造。 当各模态的表示仍在形成时,将它们耦合在同一个边界条件之下,有助于保持跨模态流形同调。相比之下,潜空间耦合试图协调那些已经在不同坐标系统中形成的表示,使拼接后的流形更容易发生撕裂。 在共享边界之内,架构可以保持灵活:可以是稠密的,也可以是基于 MoE 的隐式联邦,或模块化的显式联邦。图像生成、视频、动作和其他输出,则应当被看作由额外边界条件支配的下游任务求解器。 未来的全模态可能不是一个巨大的同质网络,而是一个由不同计算路径组成的协调流形。它们连接在一起,不是因为具有相同的表示,而是因为共享一个共同边界条件和任务级评估。 - 关于神经网络架构的数学思考 (https://x.com/BetaTomorrow/status/2076323776518906204) - 关于巨型单体模型的数学思考 (https://x.com/BetaTomorrow/status/2065452701950046255) - 关于流形联邦的数学思考 (https://x.com/BetaTomorrow/status/2079138650525458888) - 关于开放式基础模型的数学思考 (https://x.com/BetaTomorrow/status/2076075694547939373) - 关于自我演化神经网络的数学思考 (https://x.com/BetaTomorrow/status/2079138650525458888) 本文现已收录于 Deep Manifold 两周年回顾:2024–2026 的架构与数学思考系列之中。(https://x.com/BetaTomorrow/status/2080057647160824276) - What is Deep Manifold ? (https://x.com/BetaTomorrow/status/2070113382347461038) - Neural Network Fixed-Point Field (https://x.com/BetaTomorrow/status/2075335417189257256) - Learning Is an Inverse Problem (https://x.com/BetaTomorrow/status/2063266723336499444) - Early Validations of Deep Manifold (https://x.com/BetaTomorrow/status/2081606689506447748) - Deep Manifold in the Real World (https://x.com/BetaTomorrow/status/2072044191023329753)