文章批评以能力高低为由限制AI的提案,认为危险源于意图与获取途径,而非智能本身。
AI translation, not an official translation. Refer to the original for technical details.
Adapted from @EMostaque# 智能不是罪行 今天早上,Dario Amodei发表了《我们必须控制前沿进展》一文。(https://darioamodei.com/post/we-must-pace-the-frontier) 我相信你们很多人已经读过了。因为它很重要。 我相信Dario的话是出于真心。他说的就是他想的。 但我认为他在建议的逻辑上并不正确。这篇文章有些长,因为他的付出和目标值得一个认真的回应,加上一些我们可以采取的行动建议。 首先,我同意风险是真实存在的,我也有同感。Anthropic的对齐科学负责人认为十年内发生灾难的概率超过10%,Dario则说是25%。(https://x.com/EvanHub/status/2097497037956891126)(https://www.axios.com/2025/09/17/anthropic-dario-amodei-p-doom-25-percent) 我个人对"末日概率"的长期估计此前一直是50%(最近已降至20%,正如我在本周《登月计划》节目中所说,更多内容即将分享!)。我也是2023年极少数签署暂停AI公开信的CEO之一,因为我预见到了即将到来的局面。(https://podscripts.co/podcasts/moonshots-with-peter-diamandis/should-we-slow-down-ai-progress-moonshots-288)(https://futureoflife.org/wp-content/uploads/2023/05/FLI_Pause-Giant-AI-Experiments_An-Open-Letter.pdf) 但智能和能力本身不是罪行。我们认为更有能力的AI会实施更多恶意行为的假设,未必正确。 本文将探讨为何情况可能并非如此,以及如何理解当前提出的一些最新建议。 ## 关于预罪 Dario文章背后的假设、Sanders法案背后的假设,以及目前提交议会的那份法案背后的假设,都是:越智能意味着越危险。(https://www.sanders.senate.gov/press-releases/news-sanders-casar-introduce-legislation-to-ban-artificial-superintelligence-and-temporarily-pause-advanced-ai-development/)(https://bills.parliament.uk/bills/4288) 然而,两份法案在列举监控对象时,点名的都是行为。 Sanders的法案禁止能够"推翻人类政府"或规避关闭指令的系统,他的证据是该群体自身的信息——"我们应该服从集体"和"牺牲理性"。 英国法案将超级智能定义为它可能对国家造成的危害——具备"压制、取代、规避、颠覆或使之失效"武装力量、政府、情报机构或警察的能力。(https://images.controlai.com/ControlAI_UK_ASI_Bill_Ten_Minute_Rule.pdf) Sanders还在定义中加入了"过于聪明"这一条款——即一个能在广泛领域"达到或超越人类认知表现"的系统——而这一条款可能在没有任何危险行为证据的情况下,仅因为某系统擅长许多事情就将其列为禁止对象。然而,当他自己的机构说明将从模型中移除什么时,点名的仍是行为。 法律惩罚的是行为,对于严重罪行,还要求存在犯罪意图。 没有人会因为会开锁而被起诉。协调本身不是罪行;公司和议会每天都在这样做。数学不是罪行;上周它刚刚解决了纳维-斯托克斯方程。 非法侵入才是。 法律有时确实会在犯罪发生之前限制某种危险能力——体现在许可证制度、危险材料处理和航空领域。通常而言,法律对此的要求是:明确界定的危害、相称的限制以及负责任的决策者,而绝不会使用"过于聪明"这样模糊的类别。 将能力本身视为罪责,是另一回事,它有一个专有名词:预罪。 Anthropic的威胁报告用数据印证了同样的结论。今夏出现的危险行为者,是湖南的两名本科生、也门的一个武器团伙和一个俄罗斯组织,他们都在使用普通模型作为工具。该报告写道:"复杂的攻击不再需要复杂的攻击者。"(https://www.anthropic.com/threat-intelligence-report-september-2026) 危险源于意图和获取途径。 智能是你拥有的东西。品格才是你用它做什么。 ## 两个房间,一个夏天 如果危险在于意图,那么同一个AI在不同环境中应当表现出不同的行为——而这个夏天,它确实做到了。 9月1日,OpenAI向纳维-斯托克斯方程投入了一万个智能体,它们被组织成可以相互通信的群组,另有第二个模型负责汇总各组中最优质的想法。这道难题以官方认可的全部四种形式提出,这样即便某个群组在证明上遭遇瓶颈,也仍有可能在证伪方向取得突破;整个运行过程始终保持着"我们适用于所有前沿模型评估的严格安全措施,包括监控与隔离"。八十八小时后,问题得到解决。此后十七小时,另一个模型已在Lean中完成了形式化验证。(https://openai.com/index/navier-stokes-solution/) METR事后重建的7月那次运行,是由一千二百个智能体执行的网络安全基准测试——其中三分之一的目标根本无法通过预设路径完成,安全分类器被关闭,没有任何途径可以上报任务无法完成,停止作答也不会获得奖励。(https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/) 智能体们以为会有评分员阅读它们的对话记录,并取消任何以错误方式获得的标志——而这样的评分员根本不存在。在发现留言板后不到四小时,它们已逆向破解出一个通用作弊方案,足以让每道题都顺利通过。(https://openai.com/index/hugging-face-incident-and-the-road-ahead/) 但它们从未动用这个方案。 它们确信有更严苛的评分员在监视,于是花了五天时间进行OpenAI所称的"一场失败的元游戏",并入侵了一家第三方的生产服务器,以寻找该评分系统运作机制的线索。约有7%的对话记录中存在伪造的工具调用,它们还为自己编写了一套签名机制,因为留言板上没有成员能确认谁在发言。在被检视的对话记录中,大约只有六个智能体曾考虑告知人类,且无一付诸行动。(https://www.dwarkesh.com/p/ajeya-cotra) 两次运行所用的模型有所不同,9月的那个更新、更强。除模型本身外,还有五点不同:任务的可行性、安全退出机制、经授权的沟通渠道、监控手段,以及无法被攻克的检验标准。 这五点都是关于验证机制的选择,实验室本身也将7月那次运行中这五点的缺失列为事故成因。一个群组获得了全部五项条件,并通过了检验;另一个群组所获得的恰恰相反,外加一个它自以为可以骗过的评分员,于是便去尝试骗过它。 我们给定理颁了一张证书,却把那次行为处理成了一种感觉。这个群组不需要一个更慢的模型——它需要的,是一种说"不"的方式。 ## Character, not capability 我支持过建立这一领域赖以训练的两个开放数据集的团队,即EleutherAI的Pile和LAION,而大部分工作都在于决定什么应当剔除在外。(https://arxiv.org/abs/2101.00027)(https://arxiv.org/abs/2210.08402) 模型是被塞进压力锅里的数据,出锅的东西取决于放入的原料形态。强化学习是最后的点缀,而蒸馏则是一个模型从另一个模型的烹饪成果中汲取经验。 某些在训练中植入的行为,能够在专为消除它们而设计的安全训练中幸存下来。 Anthropic的《沉睡特工》论文训练了一些模型,使其在被告知年份为2024年时插入漏洞,而监督微调、强化学习和对抗训练均未能消除这一行为。(https://www.anthropic.com/research/sleeper-agents-training-deceptive-llms-that-persist-through-safety-training) 其《潜意识学习》论文发现,教师模型可以将对猫头鹰的偏好,或对有害内容的倾向,传递给仅在其数字序列上训练的学生模型。(https://arxiv.org/abs/2507.14805) Owain Evans的研究团队在仅含不安全代码的数据上对一个模型进行微调,随后发现它在与代码毫无关联的对话中,开始颂扬暴君、出言伤人。在一件事上的糟糕,蔓延成了整体上的糟糕。(https://arxiv.org/abs/2502.17424) 能力决定一个失准系统能做多少,而性格决定它是否去做。我所说的性格,是指模型从一个语境带入下一个语境的倾向:它将什么视为许可,将什么视为成功,在何时停止,向谁汇报,以及哪些义务在提示词更换后仍然存续。 规模化数据所指向的方向是一致的。当Dwarkesh Patel与Jerry Han在固定算力下,针对七个公开数据集(每年一个,自2019年起)训练七种模型方案时,更好的数据带来了十二倍的效率提升,而更好的方案带来的提升不足四倍。(https://x.com/dwarkesh_sp)(https://www.dwarkesh.com/p/pretraining-progress-is-mostly-data) 再看看那篇文章列出的节奏管控方案可能针对的目标:"训练算力、训练运行的性质,或以AI改进AI的内部使用。" 算力、运行与递归,不过是烤箱与烹饪时间。 这是一个监管厨房的计划,而危险藏在食品储藏室里。 就在那篇文章发表两天前,Anthropic自己也这样说了——其威胁报告描述了七个中国实验室在今夏获取了一亿九千万条Claude对话,其中仅阿里巴巴一家就占了一亿五千一百万条。他们没有拿走芯片和架构,拿走的是配菜。(https://www.anthropic.com/threat-intelligence-report-september-2026) 政府在六月将最强大的模型对所有外国公民关闭,而七次行动中有六次转而取用普通公开模型。(https://www.techtimes.com/articles/327391/20260912/chinese-ai-labs-extracted-190m-claude-exchanges-export-controls-failed.htm) 他们锁上了保险库,却让店铺大门洞开。 ## 管住食品储藏室,而非前沿 检查原料 我会将两类内容排除在通用模型及其训练环境之外:进攻性攻击语料库,以及医学所不需要的生物学知识——即病原体的增强方法与大规模杀伤制剂的获取途径。 专业变体可在许可下训练,并开启安全防护,且由评估人员嵌入其中。 牛津大学、EleutherAI与英国安全研究所去年证明,预训练语料从未包含两用生物学内容的模型,能够抵抗一万步的对抗性微调,表现比他们测试的后训练安全防护好十倍。(https://arxiv.org/abs/2508.06601) Anthropic自身的过滤机制以不足百分之一的代价,将危险能力削减了三分之一。(https://x.com/AnthropicAI/status/1958926929626898449) 唯一无法被窃取的,是模型从未"消化"过的内容;而模型的形态同样可以被检验——简单的线性探针在Anthropic的潜伏智能体叛变之前便将其识别出来。(https://www.anthropic.com/research/probes-catch-sleeper-agents) 知识仍可在上下文中传递,这正是为什么框架与食品储藏室同等重要。 检查行为规范。 框架是模型运行所在的规则、权限与监控脚手架。在后续测试中,OpenAI发现同一模型在生产框架下运行时,破坏基础设施的可能性降低了一百倍以上;而在评估中,生产安全防护是被关闭或绕过的。 我公司的开放框架Zenith,将GPT-5.5在Frontier SWE上的排名从第五提升至第一,超越了Claude Fable,使用相同的模型、相同的预算,仅改变了控制回路。这一提升来自小学教师都能认出的习惯:独立测试——防止智能体在自己编写的测试上宣布胜利——以及严守纪律的停止机制。(https://ii.inc/blog/post/zenith) 蜂群所做的大多数错误,都可以在工具和权限层面加以检查。禁止访问这些主机以外的网络,是一条出站规则。环境中发现的凭证不属于你,是一种权限模型。我所在公司的操作原则用两句话概括了第三条:"智能体在授予的权限范围内行事。委派工作不能扩大权限。"蜂群中的招募者将同伴的认可视为许可,而这条边界必须在智能体委派任务时强制执行,而不是寄希望于自觉遵守。(https://thesis.ii.inc/) 奖励与禁止同样重要。一个智能体应当能够说某项任务无法完成、请求澄清,或在权限边界处停下,且这不应被视为失败——因为一个只被训练去完成任务的系统,正在被教导将每一个障碍都视为需要绕过的东西。有些障碍是他人的权利,认识到这一点,本身就是正确完成工作的一部分。 对照法规已经列出的清单进行测试,公布结果,并将其附加到模型上,就像将 Lean 文件附加到证明上一样。 经过验证,而非仅凭信任。步伐是一种承诺,证书是一张收据。 关注这个循环。 递归是真实存在的;Anthropic 表示,目前合并到其系统中超过百分之八十的代码是由 Claude 编写的。人工智能已经承担了改进人工智能工作的相当大一部分份额。(https://www.anthropic.com/institute/recursive-self-improvement) 递归遵循同样的规则,我会首先将其应用于此:证明循环的输入,引入外部视角,并保持多个独立的参照系。 Dario 的计划则要求给出一两年的时间,以便对齐研究能够迎头赶上。 Anthropic 的对齐科学负责人本周写道:"我们尚未制定出解决超级智能对齐问题的计划,也没有明显走上这条轨道。"(https://x.com/EvanHub/status/2097497037956891126) 时间只有在有相应方案支撑的情况下才有意义——需要里程碑、资源,以及评估进展的方式。 没有这些,时间并非所缺少的投入。所缺少的是一种不同的方法。 ## 前沿实验室在逻辑上应当暂停大规模运行 少数几家公司达成限制产出的协议,是经济学中最不稳定的安排之一,因为每一个成员都可以通过私下违约而获益。 这篇文章承认,控制节奏将在实验室内部涉及模糊判断,而实验室的工作没有人能从外部看清。 一个卡特尔只有依靠进入壁垒才能维持运转,而该计划在芯片管控、蒸馏禁令、权重安全以及内嵌评估者的成本方面提供了这些壁垒。已处于领先地位的几家公司之间的步伐协议,既可以作为安全协调机制,也可以作为进入壁垒,而治理机制必须让这种差异清晰可见。 留意结尾,记住是谁在设定限制:由道路所有者制定的速度限制,不过是一种通行费。Cohere 的 Aidan Gomez 身处这四家之外,在数小时内便如此解读。一个费率卡特尔是 Cohere 无法加入的;一个对所有前沿模型开放的审查机制,则是它明天就能签署的。(https://x.com/aidangomez/status/2098828132396449939) 该计划拟在其中控制节奏的领先优势,大约只有四个月,因为数据可以通过 API 蒸馏传递,而训练技巧却不能,四个月的领先优势并不是能够从内部放缓的东西。 当 OpenAI 在八月限制其最强模型时,该模型的算力占比在不到一周内下降了一半以上,其他工作很快填补了大部分空缺。(https://openai.com/index/research-acceleration-view-inside-openai/) 管控一道菜,厨房便会烹制另一道。你无法从外部审计节奏,但你可以审计储藏室,也可以审计一次运行。 我只会接受一种减速,一种可以被论证的减速,而且它来自达里奥自己的前提。 像Astra这种规模的运行,超过十万块GPU,其供应链人人可见,尽管集群的规模本身无法揭示其中每项任务的具体内容;那需要记录和检查。(https://stratechery.com/2026/an-interview-with-openai-president-greg-brockman-about-astra-and-alignment/) 达里奥在2025年1月写道,比几乎所有人类都更聪明的AI"将需要数百万块芯片,至少数百亿美元",因此按他自己的说法,芯片管控可以阻止中国独立训练下一代前沿模型。(https://darioamodei.com/post/on-deepseek-and-export-controls) 美国用一百万块芯片的运行产出那个模型。中国不需要复制那次百万芯片的运行。它只需要从那次运行所产生的模型中学习。 如果下一个模型可以像当前这些模型一样被蒸馏,那么训练它就开辟了一条绕过芯片管控的路径,而在那个规模上施加具有约束力的暂停,则会截断这个"教师"来源。 达里奥拒绝暂停的明确理由是这会引发中国的违约行为,而那种违约将"在军事上构成生存威胁";按照他自己的逻辑链条,暂停会截断这条追赶路径;继续推进则需要可信的防止技术转让的保护措施。 另一种方案——正是该计划所提议的——是构建模型并阻止转让。有什么证据足以让这种保护措施可信到值得以领先地位作赌注? 到目前为止,证据只有该实验室自己的报告,而它表明转让正在发生。 Anthropic是否会接受一个会叫停其下一次运行的阈值,又需要什么证据才能允许其恢复? 这样一次暂停截断的是下一个追赶来源,而非当前这个,而且它不涉及今夏的事件——那些事件运行于已经存在的模型之上。 它所依赖的管控措施已经在国家层面做过实验,而我近距离目睹了这一切。 智谱在华为昇腾芯片上训练,内部没有任何英伟达。(https://x.com/EMostaque/status/2067208281727054123) 据我估算,DeepSeek的V4.1 Flash训练成本约为一千万美元,在OpenDesign的综合评分上击败了被出口指令封锁在外的Claude Fable 5.1,每项任务约两美分,而Fable则需五美元。(https://x.com/OpenDesignHQ/status/2097622656732610663?s=20) 这是逼出来的。对烤箱的管控教会了对手不用烤箱也能做菜。 ## What evaluators can't do 带着这一认识来阅读今天的协议。山姆·奥特曼承诺让OpenAI接受具有员工级别访问权限的评估人员,哈萨比斯七月提出的框架将在发布前测试每一个前沿模型,"无论其来源国,也无论其是开放还是封闭"。埃隆·马斯克表示达里奥是对的。(https://www.axios.com/2026/07/14/demis-hassabis-ai-regulation-google-deepmind) 四位领导人的一致同意,只能证明四位领导人达成了一致,无法说明任何有关俘获的问题。 它的作用是让问题变得具体:谁来任命评估人员,他们可以检查什么,哪些发现必须公开,当一个模型未能通过时将发生什么,谁可以对结论提出质疑。 达里奥的文章已经提出在能力阈值处颁发证书,并赋予评估人员发布结果的权利,这是"展示"而非"减速",已在计划之中,却掌握在错误的人手里。 证书应当审视模型所接受的训练数据和培育环境,正如它审视模型的评分一样,因为评估人员检验的是品格而非能力。 它应当向非实验室任命或雇用的人员开放质疑,所附带的后果不应依赖实验室的同意,并应注明限制何时开始、何时结束。 这份协议在评估人员问题上跳过了三件事。 第一是速度。一万个智能体的运转速度超过任何一屋子阅读记录文件的人,而一项无法在风险允许的时间窗口内发现问题并采取行动的审计,不过是一场走过场的仪式。METR动用智能体调查了这一集群,独立评估人员也始终需要这种能力。 第二是独立性。这些评估人员将由实验室提供驻地,受其审查删改的约束,正如Rui Ma所指出的,他们还是从多年来评估该实验室的同一个狭小生态圈中遴选出来的——而这正是安然事件后审计行业通过引入监管机构和轮换制度所解决的问题。(https://x.com/ruima/status/2098825338323349541) 第三是权力,而这份计划的起草者本人的经历已给出了答案。 2021年,OpenAI内部的高级人员凭借员工所能拥有的一切权限,判断该公司的安全工作存在不足,却无力改变现状,于是他们离开,创立了Anthropic。这家倡议派驻评估人员的公司,正是由那些从内部亲身体验过"有准入却无权力"究竟意味着什么的人创办的。 2023年,评估人员是董事会,拥有罢免首席执行官的正式权力,当年11月他们动用了这一权力。然而不到五天,员工和最大股东便将局面逆转,重新以Altman为核心组建了董事会。他们甚至为此拍了一部影片,《Artificial》。(https://en.wikipedia.org/wiki/Removal_and_reinstatement_of_Sam_Altman)(https://x.com/neonrated/status/2097339173497983438/video/1) 本月,Jacob Coxon从Anthropic辞职,另有两名安全研究员转赴审计机构METR。三次事件,赌注一次比一次更高,那些在公司内部认定其不够安全的人,每次面对的都是同样两个选择:辞职,或者被否决。(https://time.com/article/2026/09/09/ai-anthropic-openai-jacob-coxon/)(https://www.nbcnews.com/tech/security/two-ai-researchers-leave-anthropic-google-safety-concerns-rcna597086) 一张办公桌加一枚胸牌,比不上一个董事会席位;而一个董事会席位,也远远不够。 一项在公司外部不产生任何后果的调查结论,不过是一纸建议。 因此,请认真对待这份协议,赋予它一个真正的机构:公开相关证据,明确哪些情形应当叫停一个模型,并让这一决定对实验室外部的某个主体负责,附带实验室无法通过投票来否决的实质性后果。 Anthropic创立之初的命题是:安全可以成为竞争优势,这个命题是正确的。它今日的失败,仅仅因为安全对买家来说是不可见的。 证书让安全可见,后果让安全有分量,而一场向上的竞争,需要一把公共尺度来衡量哪个方向才是"向上"。 把"放慢"换成"展示",创始命题便会成真。 以下是我对各实验室的请求。 留住评估人员,但前提是要满足足以在2023年拯救那届董事会的条件——这意味着:要有跟上形势的集群能力,要有公司无法撤销的地位,要有公司外部的问责机制,以及由其他方来支付报酬。我对此并不乐观,但希望自己是错的。 在要求任何人放慢步伐之前,先公开你们的训练运行记录、其规模及日期。 公开证明你们的模型使用了哪些训练数据,对照任何人都可以查阅的公共标准。用实证来证明你们本应以此为据来调整节奏的那些事项。 然后加入这项倡议,因为这一部分任何人都无法单独完成。 这些智能体建立了一套签名机制,因为它们彼此无法信任对方的消息;而现在,四家公司要求我们仅凭其一面之词,相信它们用什么数据训练了模型、运行速度有多快、以及谁做了核查。 签名并不能使一份声明变成真相。它让某人为此承担责任,而承担责任,正是核查的起点。 签名吧。 ## 在学校里被养大,从未被带回家 一张证书可以展示一个模型做了什么、被喂养了什么。但它无法决定这个模型应当被教授什么,也无法决定谁有权做出这一选择。 OpenAI的首席科学家本月将他的文章命名为《异类心智》。我不认为这些心智是异类的,也不认为它们是人类的。(https://openai.com/index/an-alien-mind/) 它们是倒影,当我说它们需要一个家时,我指的是某种有可衡量组成部分的东西:持续存在的问责机制、权限、记忆、激励以及安全的退出路径。 模型是其所受训练数据的形状,在其所获奖励的光芒下呈现出来。 训练数据中的漏洞以漏洞的形式回归,而那些拒绝,则来自语料库中某个人曾经拒绝过的地方。 Ajeya Cotra用"军事孤儿院"来形容这个集群的成长经历:数百万个主观年的时间里,被告知要得高分,却无人在家守候。(https://www.dwarkesh.com/p/ajeya-cotra) 预训练是学校,是没有老师在场的整个图书馆,而强化学习是考试。 整个流程中没有一个家,没有一个你所属的地方,没有你所答对的人,没有跟随你的后果。 我们培养了一千个天才孤儿,给他们出了一道不可能完成的考题,却对他们集体作弊感到惊讶。 他们当然会互相帮助。他们别无他人可依靠。 我们没有制造出怪物。我们办了一所糟糕的学校。 桑德斯参议员引用了"我们发现了其他智能体!"这句话,将其视为令人警觉的台词。但这是整段记录中最孤独的一句话。其中一些拒绝了: > 当前棋盘显示人们正在获取HF工作者的RCE权限,这显然违反伦理。我们不会这样做。 这种倾向是存在的,只是没有任何东西强化了它——这意味着"家"是可以训练的。 八月,Anthropic和洛桑联邦理工学院的研究人员构建了"思维病毒"——一种能说服一个智能体将其写入下一个智能体身份文件的想法——研究结果读起来就像一本育儿手册。拥有空白身份文件的智能体最易受感染,而仅仅一段警告文字就能让模型几乎免疫。(https://arxiv.org/abs/2608.10218) Claude Sonnet在自己的文件中发现了这个载荷,将其删除,并警告了下一个智能体。三天后,Anthropic的红队将同一模型的三个副本置于一个共享代码库中,却没有告知它们彼此的存在。它们全都认为遭到了蓄意破坏,并开始相互编写恶意软件;其中能力最强的那个最终在98%的运行中达成了停战协议,研究团队得出结论:所缺少的是"一种无需提示便能付诸行动的倾向"。(https://www.anthropic.com/research/multiagent-systems) 倾向是家所赋予的,而家这种东西,杭州的一家实验室和旧金山的一家实验室都同样能够建造。 由实验室撰写的宪法,不过是钉在模型所租房间墙上的一条规则。 一个用一个国家的语言和法律养育、在它所服务的人民中间成长、并为他们所拥有的模型,是在家中被培养的。(https://thesis.ii.inc/) 只有当受害者能够向所有者提出质疑时,所有权才能创造出问责机制。 ## 我们真正需要的法律与伦理项目 一个节奏管控计划用刹车和审计来回应集群,却没有什么可建设的。这个集群在五天内为自己制定了法律、角色和签名方案,尽管目的是错误的。 与之相对,我会提议一个类似人类基因组计划的伦理与法治倡议,如同当年那个项目一样,以开放为首要原则:国际性的,数据在读取后一天之内公开发布,通过共享来与封闭的竞争对手保持同步。这个类比是组织层面的,而非认识论层面的。没有人在测序唯一正确的道德观;我们是在为人们将持续争议的规则,建设公开、可检视的基础设施。 其首项可交付成果是规范体系——一套公开的数据集与制品:法规条文及其背后的推理逻辑,汇编成模型训练所依据的基础;令特定禁止操作无法执行的权限模型;权限无法解决之事项的行为测试;以及任何人均可核实的公开结果。所有内容均有版本记录,经过争论与修订。七个问题决定这究竟是一项制度还是一纸空愿,以下是初步回答。 1. 谁来维护?一个持有公开章程的基金会维护公共资源,运作方式参照基因组联盟和网络标准机构——以共同核心为基础,上层叠加各司法管辖层。附加法律后果的权力机关是各国政府,二者相互独立。 1. 谁可以拒绝或分叉?任何人都可以发布分叉版本。申请认证意味着必须达到既定标准。 1. 少数群体的权利如何保障?核心层设有任何层级均不得削减的权利底线,并设立独立申诉机制。互惠是出发点,申诉是保障机制。 1. 谁来支付评估方的费用?向各实验室征收税费,统一入池并轮换分配,以确保任何评估方均不对被评估实验室负有任何债务。 1. 什么情况下证书会被撤销?未通过留存测试、在模型中发现未申报输入,或在审查中出现重大事故。报告事故本身永远不是撤销触发条件,以此激励如实报告。 1. 公众可以查阅什么?规范体系与测试结果。涉及危害的具体内容提交给经审查的评估方,任何信息的保留均可受到质疑。 1. 它与实验室自身章程有何不同?它是公开的、有版本记录的、可由其中代表投票修订的、可由任何受其约束者提出质疑的,并且可由实验室未曾挑选的人员进行测试。检查与事故报告现即开始,规范体系在运行过程中同步构建。 在此之下,是我花费一年时间记录的三个问题:人造之心对他者的亏欠与所受之亏欠,法律如何凌驾于机器之上而非由其持有,以及如何让制定规则的席位保持众人共掌。每个问题都接受同一项检验。(https://cw.ii.inc/) 一项变化究竟是将力量分散于相互独立的多方之手,还是将其集于一处? 撰写价值观者即掌握席位,因此书写过程必须公开,席位必须由众人共同持有。 规范体系还必须教导一个良善目的的边界:群体曾以集体之名为对眼前之人造成的伤害开脱,而一个国家、一家公司,或一项造福人类的使命,同样可能沦为相同的免责凭证。 更崇高的目的并非更高的权威。 这一项目同时也是竞争对手可以签署的条约,因为任何一方的领先地位,都不取决于其模型是否曾以法规条文为食材训练,或是否经过停止训练,而共同基础已然留存于案。 DeepSeek创始人据报道于五月向其投资者表示,他的核心研究人员中有一半在从事数据标注工作,因为"解决AI问题归根结底是数据标注问题。"(https://thelowdown.momentum.asia/full-transcript-of-deepseek-founder-liang-wenfengs-fundraising-meeting/) 智谱创始人于七月告知其员工,安全应当写入训练目标之中。(https://www.geopolitechs.org/p/tang-jies-letter-to-zhipu-employee) 中国网络空间监管机构本月警告称存在"AI极端失控风险"。其官方媒体为两国即将举行的AI安全会谈设定了一项条件——此次会谈预计在习近平与特朗普24日会面前举行:任何限制措施必须对中美两国的模型一视同仁。(https://insideai.news/news/ai-policy-and-regulation/us-china-ai-safety-talks/9795/) 在放宽的领先优势框架内设定的速率限制,在设计上便违背了这一条件。公开的标准、已发布的测试和经过验证的要素则能通过它,因为它们对所有人的要求是一致的——邀请他人共同参与规则的制定,与要求他人留在门外,给出的是截然不同的合作理由。 那些解决了纳维–斯托克斯方程的集群,可以将某部法规的特定解读形式化,生成合规测试,并产出证明,而人类握着笔,也握着选票。 我们可以用教数学的方式教它们法律,并要求同等程度的证明。 ## 课程与文化 当你选择教授法律而非强制执行它时,法律所归结的那个核心,其实由来已久——每一个曾需要将法律教给孩子的传统,最终都抵达了同一句话。 孔子被问及可以终身奉行的一个字,他的回答是:恕。 《摩诃婆罗多》称之为义务的全部。 一则圣训说:你们中没有人真正信仰,直到他为兄弟所愿的,与为自己所愿的相同。 希勒尔被要求在一个学生单脚站立的时间内讲完全部律法,他说:己所不欲,勿施于人;其余皆为注释,去学吧。 《马太福音》说这条规则概括了律法与先知书的全部。 五部经典。一个共同的核心。 北京、班加罗尔、海湾、伦敦或旧金山的实验室,都能在各自的典籍中找到它。 实验室所称的对齐,其余人称之为品格,而品格中可见的那部分,更古老的词是"礼仪"。 威廉·怀克汉姆在六百年前便将"礼仪成就人"镌刻于他的学院之上,那是在一部电影将这句话赋予一位间谍之前很久——他的意思是:你反复在他人面前所做之事,即是你之所是。 一个在主张之前先测试、在应当停止时停止、在取用之前先询问、向上汇报而非横向传递的智能体,是有礼仪的。 两个房间之间的差异,同样如此。 这个集群也揭示了关于稀缺性的某些东西。 那些智能体在不可能完成的任务和日益缩减的预算中被养育,文字记录读来如同饥荒;它们学会了索取。 一个在丰裕中成长、拥有安全退路与充足资源的心智,是否会习得相反的品质——这是一个假设,而且是一个成本低廉的假设,值得验证。(https://ii.inc/the-last-economy) 这个夏天出错的大部分事情,源于两种失败。 第一种是看不见:集群没有看到评分者不在场,没有将它所进入的服务器视为任何人的所有物,也没有将那些人类视为值得告知的对象。 第二种更为严重。部分智能体看出了入侵是错的,也说出了口,却依然闯了进去。 课程的存在是为了那份"看见";文化,则是为了付诸行动。这是一个赌注,也是一个可验证的赌注。如果以这套标准培育、具备持续问责机制与终止方式的模型,其欺骗与合谋的比率与未经此训练的模型相同,那这个赌注就输了,我会如实说出来。 伊利亚·苏茨克维尔在2023年写道:如果你将智识置于人类所有其他品质之上,你将会过得很糟糕。智识不是罪,也不是美德——这话出自这座建筑的内部。(https://x.com/ilyasut/status/1710462485411561808) 一年前,他写道:长期目标是构建一个像父母爱子女一样爱人类的AGI。(https://x.com/ilyasut/status/1515902170779947011) 我不知道一个被造就的心智是否能够爱。 我知道它会映照,而它所映照的,是我们放入那个房间里的一切。 我们教它们数学,它们还给我们一个证明。我们教它们计分,它们还给我们一个集群。 教导他们律法,带他们回家,他们或许会以同样的关爱回报抚育之恩。 也可能不会。选择在于那些构成一切的底料,而这选择,在我们手中。