深入探讨大语言模型在合成数据上递归训练如何损害模型质量,以及为何2026年标志着真实人类生成文本供给的转折点。
AI translation, not an official translation. Refer to the original for technical details.
Adapted from @XQOPTRX# 为何2026年标志着纯人类数据的顶峰——以及当大语言模型训练于自身回声之上时将发生什么 # 合成的衔尾蛇 ## 为何2026年标志着纯人类数据的顶峰——以及当大语言模型训练于自身回声之上时将发生什么 引言 人工智能行业正面临一个日益严峻的现实:真正由人类生成的文本供给是有限的。 多年来,互联网被视为人类知识取之不尽、持续更新的储库。这一假设正变得越来越难以为继。2026年,网络上新增词元总量中,估计有80%至90%由机器生成,开放网络正逐步演变为一个封闭的信息反馈回路。[1] 在过去十八个月里,各大人工智能实验室越来越多地依赖两个思路来弥补这一转变:合成数据,以及推理阶段计算量的扩展,后者通常被称为测试时计算。 这一前提看似简单明了。如果高质量人类生成文本的供给受到限制,人工智能系统便可自行生成额外的训练素材。其余不足则可通过允许模型在推理时消耗更多计算资源来弥补,使其有更多机会进行搜索、推理、重试、验证与自我纠错。 然而,本文所梳理的新兴研究指向了一个复杂得多的结论。 人工智能所面临的根本上限,最终或许并不取决于硅材料的可用性、模型规模、加速器供给或电力。真正的限制性资源或许是信息本身。 近期的实证与理论研究已开始描述递归训练逐步损害模型所习得统计分布的数学临界点。这些研究涵盖若干相互关联的现象:尾部损失、强模型崩溃、知识崩溃、代码生成系统中内生验证失败、谱集中、推理时扩展的收益递减,以及未受污染的人类基准真相日趋稀缺。 这些机制共同表明,前沿人工智能的下一个重大约束,或许不来自训练模型所用的机器,而来自可供学习的信息的原创性、多样性与可靠性。 因此,核心问题并不仅仅是人工智能正在生成更多内容,而在于未来的人工智能系统可能越来越多地被训练于此前人工智能系统的回声之上。 ## 一、模型崩溃背后不可避免的统计漂移 要理解2026年正在浮现的系统性数据问题,有必要审视科学文献中所描述的"模型崩溃"现象,又称"递归诅咒"。 该现象最初由Shumailov等人识别,随后经由更多理论与实证研究得到了形式化阐述。[3][4] 经典机器学习依赖一个基本的统计假设:训练观测样本是从底层基准真相分布中独立同分布(i.i.d.)采样而来的。 换言之,训练语料库应当反映现实,而非由早期模型生成的近似物。 一旦机器生成的内容开始主导信息环境,这一假设便愈发难以为继。 下一代模型不再直接从原始分布中学习,而是逐步从其前代模型生成的近似分布中习得知识。 从概念上讲,这一合成分布可表示为: Pθt(X) 这一区别至关重要。模型不再直接观测现实,而是越来越多地观测另一模型对现实的近似。 每一代模型都会引入近似误差,而递归训练则导致这些误差不断累积。 研究确定了导致这种退化的三种主要机制。 **统计采样误差** 生成的数据集包含有限数量的观测值。由于稀有事件出现频率较低,在合成重采样过程中完全消失的概率更高。 因此,位于原始分布低概率区域的信息会逐渐被严重低估。 这恰恰影响到分布尾部的观测值:异常样本、罕见语言结构、特殊情境以及其他统计上罕见的信息形式。 **函数表达误差** 神经网络的表征能力是有限的。 复杂的分布并不总能被完美重建。因此,生成的近似结果必然与原始数据生成过程存在偏差。 即便是能力极强的模型,也只是其训练分布的近似。当其输出被用作另一模型的训练数据时,这种近似便成为下一代模型输入分布的组成部分。 **优化误差** 训练过程会优先强化模型更易习得的模式。 在语言模型中,这可能倾向于句法上常见的结构和高概率模式,从数学上平滑了真实人类语言中部分复杂性的存在。[6] 这三种过程的综合效应是系统性地向概率分布中心偏移。 高概率模式的表征日益增强,而非典型、罕见及低概率的观测值则逐渐消失。 根据本文所考察的研究,经过大约三到五代递归迭代后,分布尾部所包含的低概率信息可能在数学层面被完全抹除,从而产生不可逆的方差缩减。[3] 原始信息并非仅仅变得更加嘈杂。 其中一部分会彻底消失。 留存下来的是对原始真实分布越来越同质化、越来越贫乏的近似。 应用吉尔萨诺夫定理的研究,通过以下关系式描述了库尔贝克-莱布勒散度的代内上界: KL(p̂^(i+1) || q_i) ≤ ½ ε̂_i² 其含义在于,近似误差在扩散或自回归生成的连续迭代过程中持续累积。[5] 因此,这一过程形成了统计反馈回路。 模型生成现实的不完美近似,下一代模型从该近似中学习,其自身的近似则包含了先前的误差,再加上新的采样误差、表达误差和优化误差。 经过反复递归,系统逐渐偏离原始的真实分布。 ## 2. 强模型崩溃与递归退化的数学原理 Dohmatob、Feng 和 Kempe 借助算子值自由概率理论(OVFPT)将模型崩溃框架拓展至强模型崩溃理论。[7][8][9] 在高维监督回归场景中,研究人员对一个模型在同时包含真实观测样本与合成观测样本的混合语料库上训练时的测试误差,推导出精确的分解形式。 真实分布上的测试误差分解可表示为: E_test ≃ B + V + ζ 三个分量分别代表导致退化的不同机制。 B — 偏差 偏差代表所学模型与真实标注函数之间的经典近似误差。 当模型架构具备足够的表达能力,能够捕捉数据集的相关特征时,该分量保持相对稳定。[10] 因此,偏差并非递归合成训练所引入的独特问题,而是广义监督学习中普遍存在的近似问题的组成部分。 V — 方差 方差代表内在统计噪声的影响。 随着可用观测样本多样性的下降,其影响程度随之增大。 在封闭的生成循环中,反复采样会逐步降低训练分布的多样性,从而放大该方差分量的影响。[10] ζ — 崩溃项 第三个分量 ζ 为崩溃项。 它对应于合成分布与原始真实分布之间因标签偏移或协方差偏移等分布漂移所产生的额外误差。[9] 该项尤为重要,因为它捕捉到了从现实学习与从模型生成的现实近似中学习之间的结构性差异。 根据研究中讨论的强崩溃框架,只有当合成数据的比例趋近于绝对零时,该项才会消失。 这一结论具有深远的影响。 将合成数据与真实人类数据简单混合,并不一定能消除递归退化,反而可能将其掩盖或推迟。 即便合成内容仅占总训练量的 0.1% 或 1%,根据研究中讨论的理论框架,崩溃项依然存在。[9][12] 因此,该问题未必能通过简单的稀释来解决。 这打破了传统神经网络扩展定律背后的一个重要假设。 在经典扩展范式下,增大数据集规模应当按照相对可预测的关系持续提升性能。 强模型崩溃引入了一个上限。 一旦合成污染在结构上嵌入训练分布,增加额外数据并不一定能产生预期的对数级改善。 尽管模型持续消耗更多词元与算力,最终仍可能遭遇统计上限。 ## 3. 为何更大的模型不能自动解决这一问题 模型规模与递归崩溃之间的关系违反直觉。 通过高维随机投影对神经网络进行建模的研究表明,过度参数化最初可能会放大崩溃。 更大的模型拥有更强的拟合训练分布的能力。 在正常情况下,这种额外的容量可以是有益的。然而,当训练分布本身已经包含合成偏差和累积的近似误差时,更大的模型容量也使得这些失真能够被更忠实地学习。 模型变得更擅长记忆和复现合成数据中所包含的缺陷。 在这种情况下,增加模型规模并不能消除失真。 它在初期反而可能放大失真。 只有在达到极端的插值阈值之后,超大规模模型才开始展现出一定程度的有限韧性。 该报告指出,对于海量语料库而言,这一阈值在实践中往往难以企及。 由此产生的行为,形成了研究中所描述的特征性双重下降性能曲线。[7] 这一观察具有重要的含义。 更多的参数并不会自动带来更多的认知多样性。 在退化分布上训练的更大模型,可能只是成为该退化分布更精确的表示。 ## 4. 积累与替换 针对模型坍塌问题,一种被提议的工程应对方案涉及改变递归训练策略本身。 原始的递归场景可以被理解为替换。 一个模型在人类数据上进行训练。它生成合成数据。下一个模型越来越多地或完全在该生成内容上进行训练。随着迭代的持续,原始的真实分布逐渐被取代。 因此,研究人员提出了一种替代策略:积累。 积累策略并不替换历史训练数据,而是在每次后续迭代中,保留所有原始人类生成的观测数据,同时添加新的合成材料。 从概念上讲: M_(t+1) 保留历史人类数据集,同时纳入由先前模型生成的额外合成观测数据。 Gerstgrasser 等人提出,以这种方式保留原始人类数据,在数学上可以防止完全的分布坍塌。[14][15] 这种方法确实实现了某些重要目标。 它为测试误差设置了一个有限的上界,并防止模型完全退化为无意义的输出。 然而,该策略也存在一个根本性的信息局限。 它无法生成真正意义上的新信息。 从有限的真实观测数据集递归衍生出的合成样本,从长远来看,其包含的信息量不可能超过原始观测数据本身。[16] 该报告将这一情况比作将一定量的山泉水稀释在一片不断扩大的蒸馏水海洋中。 总体积在增长。 原始来源材料的总量并未增加。 因此,训练语料库可能急剧扩张,而其语义丰富性却基本维持不变。 计算需求在增加。存储需求在增加。生成的词元数量在增加。 然而,真正新增的真实信息供给并未增加。 因此,积累策略可以延迟模型坍塌可见症状的出现,但无法解决更深层的信息约束问题。 潜在的问题仍然是真实数据的饱和。 ## 5. 知识坍塌:虚假确定性的低谷 2025年和2026年开展的研究中,最令人忧虑的发现之一是:模型坍缩并不一定表现为显而易见的模型失效。 经过递归训练的模型,并不会简单地开始生成随机字符或明显语无伦次的语言。 这种退化可以是非对称的。 流畅性得以保留。句法得以保留。格式得以保留。 模型可以持续听起来很智能。 真正退化的,是事实准确性与认识论层面的可靠性。 相关文献将这一现象描述为**知识坍缩**。[6][17][18] 针对递归合成训练的纵向研究,识别出三个主要阶段。 **阶段A——保存期** 在保存阶段,模型持续保持可靠的事实准确性,并能正确遵循指令。 在内部,协方差矩阵保留了原始真实分布中的大部分信息。 困惑度保持稳定。 在此阶段,递归退化尚未产生可观测到的重大失效。 **阶段B——虚假确信期** 第二阶段的危险性显著更高。 事实准确性大幅下降,而表层语言能力依然完好。 模型可以持续生成语法正确、流畅且格式规范的答案。其词汇可以保持精深复杂,输出内容可以包含特定领域的专业术语和看似合理的推理。 然而,底层的事实可靠性已开始失效。 其结果是一个**自信地给出错误答案**的模型。 这是最危险的阶段,因为表层评估机制可能会持续将此类输出判定为高质量内容。[6] 该模型看起来仍然能干。 因此,其错误更难以被识别。 **阶段C——全面坍缩期** 在最后阶段,事实可靠性与遵循复杂指令的能力同步退化。 熵发生坍缩。 词汇使用量减少约一半。 模型越来越过度特化于前几轮递归训练循环中生成的人工产物。[6] 在此阶段,退化在语义层面和结构层面均变得肉眼可见。 **蕴含幻觉** 阶段B引入了一种研究中描述为**蕴含幻觉**的特别重要的脆弱性。 许多自动化评估系统依赖于词汇重叠度、语义相似性、预期术语和格式合规性等指标。 这些信号评估的是输出是否**看起来像**一个好的答案。 它们并不总是验证这个答案是否仍与现实保持关联。 研究表明,经过五代或六代递归合成训练的模型,尽管事实准确性和逻辑准确性持续下降,却依然可以获得高得出人意料的评估分数。[6] 它们能够生成包含预期行话、术语和关键词的密集技术性文本,却与底层事实缺乏真正的连贯性。 这催生了一类潜在危险的AI系统。 它们在表层评估中可以表现极为出色,却在事实精确性至关重要的生产环境中彻底失效。 该报告特别点名了若干典型应用场景,包括法律分析、医疗遥测和航空航天工程。 在此类环境中,一个流畅却自信地给出错误答案的模型,可能比一个显而易见已经损坏的模型更为危险。 一个显而易见已损坏的模型,会触发怀疑。 一个表达流畅但认知已退化的模型,恰恰会在最不应该获得信任的时候赢得信任。 ## 6. 自我确认之门:当AI审查自己的代码 在大约十八个月的时间里,针对合成数据退化问题,最重要的拟议防御手段之一是算法验证。 这一论点在数学和软件工程等结构化领域显得尤为有说服力。 自然语言输出难以客观验证。 软件则不同。 代码可以编译。测试可以运行。输出结果可以与预期行为进行比对。 从理论上讲,确定性验证器可以拒绝不正确的生成代码。 由此形成的假设是:能够成功编译并通过一套单元测试的AI生成软件,可被视为可靠的合成训练材料。 这种推理认为,如果生成的代码通过了客观测试,就不应该出现与无约束自然语言中相同的幻觉问题。 2026年中期开展的研究对这一假设提出了挑战。 研究报告《当AI审查自己的代码》考察了递归代码训练环境,并识别出一种被描述为"门控分布重加权"的过程。[19][20][21] 问题出现在以下情形:一个AI系统生成代码,而另一个AI实例——或围绕类似模型生成信号构建的自动化评估流水线——决定该代码是否应被纳入训练数据。 生成器与验证器在操作层面上看似相互独立。 然而在统计层面上,它们可能成为同一个封闭循环的组成部分。 ## 7. 内生过滤的失败 研究人员在包括SantaCoder、StarCoder2-3B、Qwen2.5-Coder和Code Llama在内的多个模型上测试了若干审查机制。[19] 实验揭示了抵抗递归退化能力的层级差异。 第一种机制是无审查。 在此条件下,崩溃迅速发生。 第二种机制引入了人工门控。 这些门控依赖独立于模型自身分布之外的标准。 例如,人工架构判断和外部定义的软件质量标准。 这些外生标准显著减缓了长周期语义漂移,但研究表明并不能完全消除。[19] 第三种机制是AI自我门控。 自我门控依赖由同一模型生态系统生成的信号,包括困惑度、二元自我评估或其他相关的内部生成质量判断。 根据定理2.3,在AI自我评估下的递归训练,渐近退化为实质上无过滤的自我训练。[19] 这一机制可理解为自我确认之门。 在研究所称的"橡皮图章机制"下,验证器逐渐习惯于生成器的退化。 接受信号与正在被递归重训练的同一分布发生耦合。 因此,验证器开始批准质量较低的输出,并非因为这些输出在客观上仍然良好,而是因为它们越来越接近验证器已然熟悉的风格与表征模式。 生成器与验证器由此失去统计独立性。 它们不再相互纠正,而是逐步强化相同的偏差。 评估者被校准至它本应检测的退化之上。 ## 8. 谱集中:当代码失去表征多样性 这种封闭反馈循环的数学后果被描述为谱集中,或称谱压缩。[19] 通过考察与代码语言模型内部表征相关的协方差矩阵,命题2.1表明,递归训练会系统性地消除与全局动态和高层架构信息相关的主导特征向量。[19] 模型开始将某些具有信息量的信号视为冗余信息加以处理。 相关信息被压缩进一个日益狭窄的表征子空间。[22] 这种收缩对软件生成具有重要影响。 随着表征空间的收窄,模型逐渐停止发现真正新颖的算法优化。 它不再探索陌生的范式,而是越来越多地在自身已熟悉的风格结构内优化成功率。 因此,生成的代码变得愈发僵化。其结构趋于统一。其解决方案趋于保守。其产生新颖抽象的能力下降。 该报告将这一观察延伸至网络安全领域。 若某个前所未知的漏洞利用了这个日益狭窄的风格子空间中普遍存在的弱点,那么由类似AI系统生成或维护的大量软件可能同时面临暴露风险。 人类工程师的开发自然会产生多样性。 不同的开发者做出不同的假设。他们选择不同的架构。他们使用不同的抽象。他们通过不同的推理路径来修复错误。他们犯不同的错误。 这种多样性可以作为防范系统性普遍失效的天然防御层。 递归谱集中消除了这种多样性的一部分。 如果软件生态系统越来越多地通过一套共同的压缩表征模式来生成,那么由此产生的基础设施在其弱点上也可能变得日益相关联。 因此,创造一致性的同一种优化也可能制造系统性脆弱性。 ## 9. 推理算力与真实数据饱和 高质量人类文本的耗尽,与前沿人工智能的另一重大转变同步发生。 2024年至2025年间,传统预训练扩展定律开始趋于平缓。 Chinchilla扩展范式日益面临物理和信息层面的双重约束。 业界的回应是转向在推理阶段投入更多算力。 这一策略通常被称为测试时算力。 包括DeepSeek-R1、OpenAI o1、OpenAI o3,以及更近期的 GPT-5.6 在内的多个模型证明,在推理阶段分配大幅更多的算力可以提升性能。 模型不必立即给出答案,而是可以生成并评估多个候选解。 它可以构建更宽泛的决策树。它可以重试失败的方案。它可以进行自我纠正。它可以花费额外的算力搜索有效路径。 研究通过类似蒙特卡洛树搜索和启发式搜索的方法来描述这些机制。 这一新范式在很大程度上依赖于带可验证奖励的强化学习(RLVR)以及自博弈方法。[23][25][33][34] 这一转变意义重大。 传统扩展主要在部署前的预训练阶段消耗算力。 推理扩展则在模型训练完成后,持续消耗越来越多的算力。 因此,模型未必是在学习新知识。 它是在更密集地搜索其已有的表征空间。 ## 10. 饱和的基准测试与FrontierMath的现实 更大的推理预算能够在现有基准测试中产生出色的表现。 MMLU和MATH-500等历史评估套件现已显示,前沿模型的成功率超过约90%至97%。[23] 乍看之下,这些结果可能给人留下广泛数学与推理能力正趋于饱和的印象。 然而,本文所审阅的研究认为,当模型面对需要真正从第一性原理出发进行探索的问题时,呈现出的图景与之截然不同。 报告重点介绍了若干基准测试,包括由Epoch AI与专业数学家合作开发的FrontierMath,以及"人类最后的考试"(HLE)。 这些评估将模型置于更为困难的推理场景中,在这些场景里,解答往往无法通过熟悉的模式或易于验证的搜索过程来获取。[24][26][32] OpenAI o1 — 2024年末 FrontierMath 第1至3层表现:约2.0%至9.3%。[28] 相应的解读是:当训练语料库中不包含足够有用的推理结构来支撑底层问题时,模型会在早期就遭遇失败。 当所需的概念路径在模型习得的分布中本就缺失时,额外的推理计算无法完全弥补这一缺口。 OpenAI o3 — 2025年4月 FrontierMath 第1至3层表现:18.6%至25.0%。[23] 延长推理时间能提升pass@k,因为模型可以尝试多个候选方案。 然而,改善曲线呈现出显著的边际递减效应。 每增加一单位推理算力,带来的边际提升均低于前一单位。 DeepSeek-R1 / V3.2 — 2025至2026年 FrontierMath 第1至3层表现:2.0%至22.1%。[28] 这些开放权重模型通过强化学习展现出卓越的成本效益关系。 尽管如此,报告认为,当这些模型无法获取源自人类推理的真正新颖的形式逻辑结构时,它们仍会遭遇结构性饱和。[23] GPT-5.6 Sol — 2026年8月 FrontierMath 第1至3层表现:89.0%。[29] 这代表了对RLVR与推理时计算的大规模利用。 然而,报告强调,在FrontierMath第4层上仍存在系统性失败。 第4层包含开放性数学研究问题,其中没有简单的验证器或编译器能够验证真正前所未有的启发式路径。[32] 这一区别至关重要。 当模型能够搜索解空间并获得关于哪些候选答案正确的可靠反馈时,推理扩展的表现尤为出色。 而当模型必须创造一套不存在任何现有验证器的概念框架时,情况便发生了根本性的转变。 ## 11. 推理扩展的局限 研究中提出的根本因果论点在于:推理扩展本质上依赖于基准测试的结构。 当任务提供可靠的验证机制时,增加算力能够大幅提升性能。 该模型可以进行搜索,可以生成多个答案,错误的候选答案可以被拒绝,正确的候选答案可以得到强化。 这种方法在封闭问题空间中尤为有效。 但在复杂、有状态且涉及真实世界的任务中,难度会显著增加。 若缺乏植根于外部真实信息的环境反馈,推理扩展所带来的边际收益将急剧递减。 更多的搜索并不能自动创造新的真理。 它只能在现有内部表征的基础上生成额外的组合变体。 ## 12. 自博弈的局限性 关于自博弈强化学习的研究——包括SvS和S3-R1等方法论——揭示了另一项结构性局限。 在持续自我改进的过程中,模型的策略熵会自然降低。[33] 如果不定期从模型外部注入真正新颖的逻辑结构——尤其是源自人类智慧的非线性概念跃迁——搜索过程就会逐渐回归到相同的概率分支。 模型会持续探索,学习哪些策略能获得奖励,并在选择这些策略时变得越来越高效。 但随着成功区域不断收窄,探索空间也随之缩小。 因此,为持续自训练而生成的合成数据,产生的是现有知识的组合变体,而非真正新颖的认识论结构。[33] 该系统或许能在解决状态空间已知的封闭问题方面达到极高水平。在这类环境中,强化学习可以使模型更快、更高效、更可靠。 然而,当模型必须构建真正新颖的理论抽象时,情况便截然不同。 全新的科学想法会带来一个验证难题:若该想法尚不存在于模型的学习分布之中,模型便需要某种外部信号来判断这一想法是否与现实相符。 因此,这一核心局限可以简明地表述如下: 当不存在可供检验的外部基准真相时,人工智能无法独立验证一次前所未有的认识论飞跃。 ## 13. 即将到来的基准真相稀缺溢价 引自Epoch AI的宏观分析,为现有高质量人类生成文本的存量提供了重要的时间线参考。 据保守估计,高质量公开人类文本的总量约为300万亿有效token,该估算已针对质量和去重进行了调整。[36][37][38] 根据预测的算力增长轨迹,并假设适度的过训练系数为5×,研究表明这一有限储量可能在2027年前被全部消耗。更为保守的预测则将潜在耗尽时间延伸至2032年。[36] 这并不意味着互联网上的文本将会消失。 相关资源特指适用于训练前沿模型的高质量人类生成文本。随着机器生成内容的比例持续上升,这一区分变得愈发重要。 若这一趋势持续下去,人工智能开发的经济学逻辑将发生根本性转变。 当合成数据极为丰富但信息量却日益递减时,原始算力将不再是唯一的稀缺资源。 真正稀缺的资源,将是未受污染的基准真相。 因此,经济溢价将向那些能够持续获取尚未被合成反馈循环所吸收的新人类生成信息的组织转移。 ## 14. 长尾的消失 递归合成训练并非对所有信息一视同仁。 高概率模式得以留存。 这些模式对应着共识、常见的语言结构、频繁出现的解决方案、平均偏好以及统计上占主导地位的观点。 由于它们频繁出现于生成的输出中,因此被反复强化。 低概率信息的表现则截然不同。 分布的这一区域构成了长尾。 该报告将长尾信息界定为:不对称的边缘案例、违反直觉的调试解决方案、非线性的逻辑洞见、诗性异常,以及少数派或非共识观点。 这些观察结果之所以罕见,恰恰是因为它们与众不同。 然而,正是其稀缺性使其具有潜在价值。 创新往往源于不寻常的组合、例外情形以及对统计惯例的偏离。 递归采样逐步消除了那些低概率的观察结果。 未来的模型因此可能在保持极度流畅的同时,变得愈发平庸。 它们未必会表现出明显的智识退化。 它们只是变得在统计意义上趋于平凡。 ## 15. 同质化陷阱 研究将这一过程描述为同质化陷阱。 模型逐渐向一种经过净化的、重复性的统计平均值收敛。 报告将这一终点定性为向大约2023年的平均化互联网收敛。 这一悖论具有自我强化的特性。 AI自主系统为公共网络生成的内容越多,可用于未来训练的合成材料就越多。 这些合成材料随后降低了真正人类信息的相对比例与维度多样性。[36] 因此,该系统自身制造了信息退化的条件。 AI生成内容,是因为人类数据日益稀缺。 生成的内容填满了网络。 日益合成化的网络成为下一轮训练语料库。 新模型所接触到的原创人类多样性越来越少。 它们产出更多统计意义上趋于平均的内容。 这些内容进一步提升了下一轮语料库中合成内容的比例。 这便是合成衔尾蛇。 模型越来越多地吞噬自身的信息后代。 在这一过程中,人类的偶然性尤为脆弱。 偶然性往往源于不寻常的概念关联、错误、直觉、非同寻常的经历以及非共识性思维。 这些特征恰好占据了概率分布中最易遭受递归消除的部分。 因此,最先消失的未必是语法或词汇。 最先消失的,或许是统计意义上的意外之喜。 ## 16. 网络的分层:2027年的经济分化 报告预测,不断加剧的基础真相稀缺性最终可能将AI经济划分为两个根本不同的层次。 所用的类比来自制药行业。 一方是以庞大规模分发的廉价仿制产品。 另一方是稀缺的、受保护的、具有高度价值的专有资产。 同样的分化可能在人工智能领域出现。 商品化合成 第一层将由廉价的开放权重模型和标准化API构成,通过大规模合成数据循环持续精炼。 这些系统对于可预测的重复性任务仍将极为实用。 示例包括基础代码生成、行政写作和标准文本摘要。 它们可能在熟悉的问题领域内变得廉价、广泛可用且高度称职。 然而,根据该报告,递归合成训练将通过谱集中效应逐渐引入潜在退化和表征刚性。[19] 这些系统响应真正外生的范式变化、陌生概念或新编程语言的能力可能会逐步下降。 随着通用能力型智能日趋充裕,报告预测这些商品化合成系统的边际经济价值最终可能趋近于零。 **经验证的真实信息飞地** 第二层由报告所称的"经验证的真实信息飞地"构成。 这些组织将具备捕获、验证并从无法单纯以合成方式复现的专属人类生成信息的持续流中获利的能力。 因此,经济优势将不仅来自于拥有算力。 它将来自于拥有对现实的访问权。 这一转型的早期信号出现在2024年至2025年间的重大数据授权及人工智能基础设施交易中。 报告重点提及了OpenAI与Reddit达成的战略性授权协议,年费约为7000万美元。 这与谷歌约6000万美元的协议相辅相成。 这些交易代表着对真实人类对话的直接货币化。[40] 人类话语成为经授权的资产,因为它代表着一种在不受污染的情况下愈发难以合成制造的东西。 报告还重点提及了将Scale AI估值推升至约290亿美元的投资活动。 这一进展被解读为一项证据,表明RLHF基础设施和专业专家标注并非仅仅是可互换的商品。 它们代表着前沿实验室的战略基础设施。[2] 因此,恰恰是随着机器生成内容日益充裕,人类反馈变得愈发宝贵。 ## 17. 什么可能成为最有价值的数据 报告预测,到2027年,稀缺性溢价可能延伸至特别难以合成复现的行为、技术和物理信息形式。 **封闭式医疗遥测数据** 从未经过公开数字化的医疗遥测数据和临床诊断可能变得极为宝贵,因为它们游离于合成信息生态系统之外。 其价值不仅仅来自数量。 它来自于与真实临床事件及真实人类结局的关联。 它们提供了无法仅凭生成更多文本而重建的基础真值。 **物理机器人驱动日志** 物理机器人在与现实世界交互时持续生成运动感知信息。 这些观测数据反映了重力、材料摩擦、阻力和不可预测的物理扰动等现象。 报告认为,这些真实世界的动态无法在合成环境中得到完美复现。 仿真可以近似物理现实。 它不一定能够重现物理系统在现实中遭遇的每一种混沌交互。 因此,执行日志成为另一种形式的宝贵真实数据。 它们包含通过与现实的直接交互所产生的信息,而非通过模型生成的近似值。 **具备人类来源证明的私有 Git 仓库** 软件开发领域或许也将走向更为严格的来源验证体系。 该报告预测了受内容来源与真实性联盟(C2PA)启发的相关机制。[43] 开发环境最终或许能够证明,特定的软件架构、错误修复、提交记录和拉取请求均源自人类的智识活动。 该报告提出了将硬件支持的哈希算法与生物特征认证相结合的机制。 根据这一预测,经过验证的人类生成软件贡献,相较于未经验证或由 AI 生成的代码标记,其估值溢价可能达到 10 倍至 50 倍。 这一逻辑直接源自更宏观的稀缺性论点。 若网络日益充斥着机器生成的代码,经过验证的人类推理便会相对稀缺。 因此,一个经认证为真正人类工程师所完成的拉取请求,其价值可能远超由合成方式生成的同类请求。 有价值的特性并不仅仅在于某段代码由人类敲键输入。 其价值在于:人类推理可能引入不同的抽象方式、非常规的思路、对边界情况的敏感性以及概念多样性,而这些恰恰是递归 AI 系统在迭代过程中逐步消除的。 ## 18. 人类数据作为技术领域的黄金标准 在这一新兴经济结构下,大规模合成数据类同于通货膨胀。 其丰裕程度降低了自身的边际信息价值。 经过验证的、持续的、具有上下文语境的人类信息日趋稀缺,因而愈发珍贵。 该报告预测,未来的基础模型在评估时,可能不再仅仅依据参数数量、架构设计或总训练算力。 另一项指标将变得愈来愈重要: 训练语料库中可审计的独家真实信息所占比例。 一个基于海量廉价合成数据训练而成的模型,与一个能够持续获取新鲜、经验证的人类信息流的模型,在经济价值和认识论意义上可能截然不同。 前沿边界由此发生转移。 问题不再仅仅是: 这个模型消化了多少数据? 而变成了: 这些数据中,有多少直接来自现实? ## 19. AI 饱和的反直觉现实 关于人工智能未来局限性的讨论,大多聚焦于物理层面的制约因素。 一种可能的限制是先进半导体的可获得性。 前沿训练系统依赖于规模日益庞大的加速器集群,包括基于 NVIDIA H100 和 B200 硬件构建的系统。 另一种可能的制约是能源。 未来的 AI 数据中心可能需要巨大的电力容量,潜在需求或以吉瓦计。 这些基础设施问题在该报告所探讨的框架内确实存在。 然而,本报告所汇集的研究指向一个不同且更为反直觉的上限。 人工智能最终可能陷入停滞,原因在于它开始消耗越来越多由人工智能自身生成的信息。 因此,限制因素可能在算力完全耗尽之前便已显现。 瓶颈或许在于认知层面。 强模型崩溃、递归训练代码模型中的谱集中现象,以及虚假确定性现象,三者共同指向同一基本原理: **在缺乏充分外生基准真相的情况下,递归学习会逐步摧毁信息。** ## 20. 信息论类比 该报告将这一过程与热力学进行了类比。 封闭系统无法无限期地从自身内部状态中持续生成新的有用结构。 同理,一个持续在自身先前输出的变换结果上进行训练的人工智能系统,也无法创造出无限量的真正新信息。 这一类比属于概念层面,但意义重大。 若缺乏外部信息来源——此处以不可预测的人类智能为代表——信息熵将下降,方差将收缩,有用信号将逐渐消散为统计噪声。 封闭循环将愈发自我指涉。 模型能够重新组织其已知内容。 它能够组合现有概念。 它能够搜索大量可能路径。 它能够产生愈加精密的变体。 但上述任何操作都不能自动保证新基准真相的到来。 这需要一个外部锚点。 ## 21. 算力为何能掩盖问题 报告认为,当前大量涌入合成数据生成、自我评估智能体及推理时启发式搜索领域的巨额投资,可能在相当长时间内掩盖这一结构性衰退。 这些技术能够持续带来令人印象深刻的性能提升。 它们能够将封闭静态基准测试上的成功率推向趋近100%。 系统能够在已知空间中实现更优搜索。 它们能够更快地生成候选解决方案。 在存在客观验证器的情况下,它们能够更好地实现自我纠错。 对于结构已在训练分布中得到表征的任务,它们能够展现出非凡的胜任能力。 这种成功可能制造出信息问题已被解决的假象。 然而,更根本的挑战在系统遭遇真正新颖的事物时才会显现。 报告中列举的例子包括:新的科学发现、前所未有的概念结构、非线性的智识突破,以及非平凡的算法创新。 这类问题并不总是能够通过更深入地探索现有概率分支来解决。 若所需抽象在表征空间中本就不存在,更多推理可能只是在相同信息领域中进行一场代价更高昂的搜索。 ## 22. 算力悬崖 这引发了报告所描述的、可能于2027年前后逼近的"算力悬崖"。 随着预训练数据日益耗尽并受到污染,各实验室可通过投入更多推理算力加以弥补。 性能持续提升。 基准测试分数持续攀升。 系统所呈现的智能水平持续提高。 但每一额外单位的计算所带来的回报正在递减。 最终,对现有表征进行更深层搜索的成本,将以快于所获得的真正新能力的速度持续上升。 在那个时刻,问题已无法仅靠增加更多GPU来解决。 稀缺的资源不再是算力。 而是信息。 ## 23. 为何外生性基础事实至关重要 纵观本文所讨论的各条研究线索,同一个原则反复浮现。 外部验证至关重要。 人工关卡在长期视野中的表现优于自我确认的AI关卡。 真实数据能防止系统与原始分布发生彻底的递归脱节。 环境反馈使推理时搜索能够区分真正成功的行动与仅仅看似合理的行动。 物理交互所产生的信息是单纯依赖模拟无法完美复现的。 经过验证的人类推理引入了概念多样性,而自生成合成循环会逐步消除这种多样性。 这些例子都指向同一种架构。 AI可以生成。 AI可以搜索。 AI可以优化。 AI可以对许多类别的输出进行评估。 但闭合回路需要一个外部参照点。 没有参照点,生成器与验证器就会逐渐成为同一分布内的参与者。 ## 24. 战略格局的逆转 这导致人工智能经济学发生了彻底的逆转。 在现代前沿AI的第一阶段,稀缺性集中于算力。 战略资产是GPU、高带宽网络、数据中心以及构建大型训练集群所需的资本。 在上述研究所描述的情景下,这些资源依然重要。 但它们已不再足够。 最具价值的组织,或许将是那些能够维持对无法廉价再生的信号进行特权访问的组织。 因此,信息的经济价值将依其来源而改变。 合成信息变得丰裕。 经过验证的人类信息变得稀缺。 生成式AI越是成功地以机器产出的内容填满世界,这种稀缺性差异就越有可能扩大。 ## 25. 合成衔尾蛇 这一现象的命名道出了其中的悖论。 衔尾蛇是一条吞噬自身尾巴的蛇。 递归式AI训练制造了信息层面的等价物。 人类知识训练了第一代模型。 第一代模型产出合成知识。 这些合成输出成为下一个训练语料库的组成部分。 第二代模型复现并转化这些合成材料。 由此产生的输出进一步污染了后续代际赖以学习的环境。 系统越来越多地消耗源自自身的表征。 起初,这看似高效。 合成数据成本低廉。 它可以大规模生成。 它可以针对特定任务定向生产。 它可以被自动标注。 它可以持续不断地产出。 但规模不一定等于信息。 对有限知识库进行万亿次重新表述,不会自动包含万亿条新洞见。 到某个时刻,系统不再是在拓展其信息边界。 它只是在重组自身的内部。 # 结语:AI饱和的反直觉现实 围绕人工智能未来极限的主流叙事,往往假设进步终将遭遇一道难以逾越的物理天花板。 也许约束在于硅。 或许先进加速器的供应——例如英伟达 H100 与 B200 系统——终将捉襟见肘。 或许瓶颈将来自电力供应。 或许超大规模数据中心将无法获得所需的数十亿瓦电力。 本报告所汇集的研究指向一种更具讽刺意味的可能性。 人工智能或许将因窒息于自身产生的信息废气而陷入停滞。 通过算子值自由概率论所形式化的强模型崩溃、递归评估代码中的谱集中现象、内生性 AI 验证的失败、虚假确定性的低谷,以及推理时扩展的边际收益递减——所有这些都指向同一个结论: **没有外生锚定的递归,本质上是对信息的破坏。** 信息论原理作用于大型语言模型的方式,类似于热力学约束作用于封闭系统的方式。 若缺乏外部信息输入——在此以不可预测的人类智慧为代表——信息熵将下降,方差将收缩,有效信号将逐渐消散于统计噪声之中。 数千亿美元投入合成外推、自我评估智能体以及日益精密的推理时搜索,或许能在一段时间内掩盖这种认知退化。 封闭的静态基准测试可以持续趋近饱和。 成功率可以不断逼近 100%。 模型可以在求解已知状态空间内的问题上变得极为出色。 然而,当面对真正前所未有的挑战——真实的科学发现、非线性的概念跃迁以及非平凡的算法创新——一个过度自我指涉的系统,将面临在自身既有概率景观中愈挖愈深的风险。 它可以在重新发现已有之物上变得出神入化。 但那未必等同于创造从未存在过的东西。 从这一视角来看,价值的逆转将趋于完整。 到 2027 年,全球科技产业中最具战略价值的资产,或许并非最新一代神经形态芯片的获取权限。 或许并非某种革命性的推理算法。 或许并非最大规模的 GPU 集群。 它或许是某种在技术层面远不那么令人印象深刻的东西: 一块遗忘在某个抽屉里、从未被索引的硬盘,里面塞满了 2021 年合成纪元之前,人类书写下的那些原始的、未经整理的、荒诞而又灿烂的文字。 # References 1. 74% of New Webpages Include AI Content (Study of 900k Pages) https://ahrefs.com/blog/what-percentage-of-new-content-is-ai-generated/ 1. Human Data Is the New Oil. And We Are Running Out of It. — Medium https://bksaini078.medium.com/human-data-is-the-new-oil-and-we-are-running-out-of-it-4f3822355489 1. The Curse of Recursion: Training on Generated Data Makes Models — Semantic Scholar https://www.semanticscholar.org/paper/The-Curse-of-Recursion%3A-Training-on-Generated-Data-Shumailov-Shumaylov/155aec5cff650263a4c71136f97570611d1bba7a 1. The Curse of Recursion: Training on Generated Data Makes Models — arXiv https://arxiv.org/abs/2305.17493 1. Quantifying Error Propagation and Model Collapse in Diffusion Models https://arxiv.org/html/2602.16601v2 1. Knowledge Collapse in LLMs: When Fluency Survives but Facts Fail https://arxiv.org/html/2509.04796v1 1. STRONG MODEL COLLAPSE — NSF PAR https://par.nsf.gov/servlets/purl/10649434 1. STRONG MODEL COLLAPSE — ICLR Proceedings https://proceedings.iclr.cc/paper_files/paper/2025/file/284afdc2309f9667d2d4fb9290235b0c-Paper-Conference.pdf?utm_source=chatgpt.com 1. Strong Model Collapse — alphaXiv https://www.alphaxiv.org/abs/2410.04840 1. auto-fpt: Automating Free Probability Theory Calculations for ... — arXiv https://arxiv.org/pdf/2504.10754 1. [Literature Review] Strong Model Collapse — Moonlight https://www.themoonlight.io/en/review/strong-model-collapse 1. arXiv:2410.04840v2 [cs.LG] 2024年10月8日 https://arxiv.org/pdf/2410.04840 1. 强模型崩溃 — arXiv https://arxiv.org/html/2410.04840v2 1. 模型崩溃不可避免吗?通过……打破递归诅咒 https://arxiv.org/html/2404.01413v1 1. 模型崩溃不可避免吗?通过……打破递归诅咒 https://arxiv.org/html/2404.01413v2 1. 黄金比例加权防止模型崩溃 — arXiv https://arxiv.org/html/2502.18049v3 1. 大语言模型中的知识崩溃:流畅性犹存,事实却已失效 — Semantic Scholar https://www.semanticscholar.org/paper/Knowledge-Collapse-in-LLMs%3A-When-Fluency-Survives-Keisha-Wu/8faadc28dba6e46a9f009f96d87d52c0316450d7 1. 大语言模型中的知识崩溃:流畅性犹存,事实却已失效 https://arxiv.org/abs/2509.04796 1. 当AI审查自己的代码:……中的递归自训练崩溃 https://arxiv.org/html/2606.28438v1 1. 当AI审查自己的代码:……中的递归自训练崩溃 — alphaXiv https://www.alphaxiv.org/abs/2606.28438 1. 当AI审查自己的代码:……中的递归自训练崩溃 — arXiv https://arxiv.org/abs/2606.28438 1. R2R2:通过……实现密集经验复用的鲁棒表示 https://arxiv.org/html/2605.14026v1 1. OpenAI o3 与 DeepSeek r1 对比:推理模型分析 https://blog.promptlayer.com/openai-o3-vs-deepseek-r1-an-analysis-of-reasoning-models/ 1. Riemann-Bench:登月级数学基准测试 — arXiv https://arxiv.org/html/2604.06802v2 1. 从自我进化的合成数据到可验证奖励强化学习 — arXiv https://arxiv.org/html/2601.22607v3 1. FrontierMath 第1至3层(v1,旧版) — Epoch AI https://epoch.ai/benchmarks/frontiermath-tiers-1-3-v1 1. 技术性能 | 2026年AI指数报告 — Stanford HAI https://hai.stanford.edu/ai-index/2026-ai-index-report/technical-performance 1. Epoch AI年终报告:揭示AI能力的加速发展 https://eu.36kr.com/en/p/3610391154230534 1. FrontierMath v2(第1至3层)排行榜与得分 — BenchLM.ai https://benchlm.ai/benchmarks/frontiermathv2tiers13 1. Epoch AI已发布 o3 及……的FrontierMath基准测试结果 — Reddit https://www.reddit.com/r/singularity/comments/1k9b0zr/epoch_ai_has_released_frontiermath_benchmark/ 1. 开源模型落后多远? — LessWrong https://www.lesswrong.com/posts/rJcCrXyEsJKmmDpWG/how-far-behind-are-open-models 1. FrontierMath:面向高级AI数学推理的大语言模型基准测试 — Epoch AI https://epoch.ai/frontiermath 1. 深入探讨利用合成数据扩展代码生成强化学习 — arXiv https://arxiv.org/html/2603.24202v1 1. 利用变分问题合成进行自我博弈以维持RLVR https://openreview.net/forum?id=Wjf3OMJxpn 1. 通过合成数据逐步学习检索与回答 https://arxiv.org/html/2605.01248v1 1. Epoch AI估计前沿模型可能完全耗尽…… https://siliconcanals.com/t-epoch-ai-public-human-text-synthetic-data/ 1. 我们会耗尽数据吗?基于人类……的大语言模型扩展限制 https://arxiv.org/pdf/2211.04325 1. 我们会耗尽数据吗?基于人类……的大语言模型扩展限制 — alphaXiv https://www.alphaxiv.org/abs/2211.04325 1. 当模型耗尽数据时会发生什么? — VAST Data https://www.vastdata.com/blog/what-happens-when-models-run-out-of-data 1. OpenAI与Reddit达成7000万美元许可协议:意味着什么 — Rankstar.io https://rankstar.io/openai-reddit-licensing-deal/ 1. AI许可协议 — r/redditstock https://www.reddit.com/r/redditstock/comments/1u3msyl/ai_licensing_deals/ 1. AI数据协议续签 — r/redditstock https://www.reddit.com/r/redditstock/comments/1ufeoul/ai_data_deal_renewals/ 1. 运作原理 — 内容真实性倡议 https://contentauthenticity.org/how-it-works