Two overlooked mathematical starting points—learning as an inverse problem and neural networks as numerical computation—reveal the deep structure of AI.
Adapted from @BetaTomorrow# AI在数学上不是黑箱 English Edition: AI Is Not a Mathematical Black Box (https://x.com/BetaTomorrow/status/2096949913062101401) AI 常常被描述为一个黑箱,但从数学上看,它并不是。神经网络中的每一个操作,都是明确的数值计算。真正尚未厘清的是:如何理解学习过程中逐渐形成的数学结构。过去两年,我们在 Deep Manifold Part 1: Anatomy of Neural Network Manifold 和 Deep Manifold Part 2: Neural Network Mathematics 中逐步发展了这一观点。深度流形从两个长期被忽视的基本事实出发:学习是一个反问题,以及神经网络是一种可学习的数值计算(Deep Manifold Part 2,第 3 节)。一旦这两个数学盲点被看见,神经网络的几何结构、不动点结构、能力来源以及自身局限,也就开始逐渐显现出来。 (https://x.com/BetaTomorrow/status/2063264416871944401) ## 盲点一:学习是一个反问题 第一个数学盲点是:学习是一个反问题。我们能够观察到数据、样本、奖励以及期望行为,但能够产生这些结果的内部结构却是未知的。反问题往往具有病态性:解可能不唯一、不稳定,甚至无法仅根据现有观测确定。这是一个长期存在的数学难题。 第二次世界大战之后,苏联曾在国家层面和学术层面对反问题投入大量力量,并逐步建立起广泛的数学框架: 可观测数据 → 推断不可观测的内部对象 然而,反问题至今仍没有一个普适性的统一解法。回头来看,这也可以被视为现代“隐藏内部结构”思想的一种早期数学先声。这段历史对于理解 AI 很重要。 (https://x.com/BetaTomorrow/status/2063805702746120507) 这解释了: - 为什么今天的 前沿模型智能仍然是犬牙交错的; (https://x.com/BetaTomorrow/status/2076115712129823036) - 为什么大模型规模 和 过度参数化是必要的,因为学习问题所需要的自由度在训练之前并不知道; (https://x.com/BetaTomorrow/status/2065452701950046255) (https://x.com/BetaTomorrow/status/2094835598884552806) - 为什么在已有数以万计的优化论文之后,我们对于学习本身仍然没有坚实的数学答案。 (https://x.com/BetaTomorrow/status/2079014802358448452) ## 盲点二:神经网络是数值计算 第二个数学盲点是:神经网络是数值计算。一个模型并不仅仅是对数据进行拟合的统计函数;它是一个大型数值系统,其方程在训练和推理过程中被反复计算。一旦从这个角度来看,架构、稳定性、收敛性、数值误差以及计算效率,就不再只是工程实现细节,而成为数学问题本身。 这解释了: - 为什么我们会有如此多不同的神经网络架构,而且似乎都能够工作:不同的数值计算形式,可以逼近同一个底层学习问题; (https://x.com/BetaTomorrow/status/2076323776518906204) - 为什么模型训练在稳定性和效率方面如此困难:大型非线性数值系统可能具有高度敏感性、刚性以及较差的条件性; (https://x.com/BetaTomorrow/status/2083601371660787835) - 为什么即使是世界上最伟大的数学家,也没有发展出神经网络的数学:像陈省身(现代微分几何之父)以及他的学生丘成桐(卡拉比猜想)这样的数学家,在几何与微分方程领域达到了最高水平,但数值计算并不是他们工作的核心范畴。在经典数学中,建立一个方程、证明解的存在性,或者揭示几何结构,本身就可以是主要的数学成果。 (https://en.wikipedia.org/wiki/Shiing-Shen_Chern) (https://en.wikipedia.org/wiki/Shing-Tung_Yau) (https://en.wikipedia.org/wiki/Calabi_conjecture) 神经网络则不同:产生解的数值计算过程,本身就是数学的一部分。当数学之美在 AI 中变得有用 (https://x.com/BetaTomorrow/status/2093625998361387417) ## 几何、不动点、能力与对齐 一旦这两个数学盲点被认识到,神经网络更深层的数学结构就开始显现出来。学习是一个反问题,意味着模型必须构造自己的内部解结构;神经网络是数值计算,意味着这一结构必须通过计算被形成,并在推理过程中被实际经过。在深度流形中,这自然导向可学习几何 以及神经不动点场。 (https://x.com/BetaTomorrow/status/2076405302602420624) (https://x.com/BetaTomorrow/status/2063264416871944401) 这也帮助解释了为什么 AI 如此强大。它的激活是无属性的:不携带固定的内在物理意义或语义意义。同时,它的变换还可以保持满秩,从而保留一个巨大的可能关系空间。两者结合,使模型拥有极大的自由度,可以构造几何、形成不动点类,并跨不同领域进行学习。 但同样的自由,也使 AI 对齐从根本上变得困难。在计算内部,并不存在某种天然的意义或价值,可以让对齐直接锚定其上。因此,对齐只能通过数据、反馈、损失、提示以及其他边界条件来施加。 (https://x.com/BetaTomorrow/status/2076115712129823036) 这些思想已经不只是用于解释今天的神经网络,也指向一个更广阔的数学方向。在《深度流形的数学展望》中,我们进一步追踪了这一数学脉络:从微分几何与不动点类理论,走向可学习几何、可学习数值计算,并最终探索正问题与反问题可能的统一。 (https://x.com/BetaTomorrow/status/2094232361907241189) ## 用前沿模型验证这两个论点 这两个论点是深度流形所采用的两个基础出发点,但它们并不等于深度流形本身。它们发生在深度流形之前。即使你并不接受深度流形这个框架,也完全可以把这两个问题独立拿出来检验: 1. 如果同时参考对应的正问题,AI 学习是否可以被看作一个反问题? 1. 神经网络是否可以被看作一种数值计算框架? 如果你不相信本文的这两个基本论点,有一个非常简单的办法:直接去问今天的前沿模型。 我测试了 ChatGPT、Claude、Gemini、Muse、Grok,以及开源模型 DeepSeek、GLM 和 Kimi,使用的就是下面这两个原始问题: 1. “Can you independently confirm AI is an inverse problem with reference to the forward problem? Short answer, yes or no, followed by a short explanation.” (你能独立确认相对于正向问题,AI 是一个反问题吗?简短回答“是”或“否”,并附上简要解释。) 1. “Can you independently confirm a neural network is a numerical computation framework? Short answer, yes or no, followed by a short explanation.” (你能否独立确认神经网络是一个数值计算框架?请简要回答‘是’或‘否’,随后附上简短解释) 这里的目的,并不是把前沿模型当作数学权威,而是让这两个出发点在接受深度流形之前,就可以被独立检验。你可以去问不同的模型,比较它们的解释,然后自己判断其中的数学是否成立。 这里也有一个值得警惕的问题。如果这两个问题得到的回答都稳定地是“是”,那么我们就应该进一步追问:为什么这样两个如此基础的数学出发点,却长期没有成为 AI 主流讨论中的核心框架? 如果最基础的数学框架本身存在偏差或缺失,那么建立在这些框架之上的一些结论,又有多少需要重新审视? 这并不意味着 AI 研究是错误的。它意味着:AI 研究中的一些数学前提,可能远比我们想象中更值得重新检查。如果你仍然不相信这篇文章,或者不相信深度流形,就自己运行这两个问题。 ## AI 在数学上不是黑箱 AI 在数学上之所以显得神秘,并不是因为它的方程被隐藏了。方程本身是明确的。真正的困难在于,我们往往从错误的数学框架出发去理解它。 一旦我们认识到:学习是一个反问题,而神经网络是数值计算,许多原本看似彼此无关的现象就开始连接起来:模型规模、过度参数化、犬牙交错的智能、架构多样性、训练不稳定性、可学习几何、不动点结构,以及 AI 对齐。 深度流形试图从最基础的层面重新建立这套数学。它的目标并不仅仅是在事后描述神经网络,而是建立一个统一框架,使训练、推理、几何、不动点以及边界条件,都可以被理解为同一个计算系统中的组成部分。 黑箱并不是 AI 本身。真正的盲点,一直是我们的数学。 This article is now listed under Core in Deep Manifold, Two Years Later: 2024–2026. (https://x.com/BetaTomorrow/status/2080057647160824276) 1. 什么是深度流形? (https://x.com/BetaTomorrow/status/2070115181699723647) 1. 神经不动点场 (https://x.com/BetaTomorrow/status/2075337832827355535) 1. 学习是一个反问题 (https://x.com/BetaTomorrow/status/2063264416871944401) 1. 深度流形的数学展望 (https://x.com/BetaTomorrow/status/2094232361907241189)