将AI回答视为多种可能答案中的一次抽样,有助于改善提问方式和评估结果。
AI translation, not an official translation. Refer to the original for technical details.
Adapted from @free_ai_guides# 如何用概率思维从AI获得更好的答案 不要问助手的答案是否正确,而要问有多少种可能的答案。 对于一个已有定论的问题,可能答案的集合很小,今天得到的答案和明天得到的答案是一致的。对于一个开放性问题,集合很大,你得到的答案只是其中一次抽样,而语气却同样笃定。 物理学家斯蒂芬·沃尔弗拉姆数十年来一直从事计算软件的开发,他在2023年的一篇文章中描述了这一机制。聊天模型试图生成对眼前文本的合理续写,所谓"合理",是指与数十亿个网页中类似文本后面人们所写内容相符的那类续写。 亚当·卡拉伊与三位合著者在2025年为OpenAI撰写的文章中得出了类似的结论。他们认为,公司训练模型和为模型评分的方式与学校批改考试的方式相同,而在大多数考试中,有把握的猜测比空白作答得分更高,因此模型学会了猜测。 将概率思维应用于聊天助手,意味着把每一个答案都视为多种可能续写中的一种,并通过提示词来缩小这个集合,或者在信任某个单一答案之前先了解这个集合的范围。 ## 每个答案都是从一个集合中抽取的样本 当助手回复时,有四件事情同时发生,每一件都影响你如何解读这个回复。 助手正在选择最有可能接续你消息的文本。它衡量"最有可能"的标准,是训练期间读过的所有内容,加上此刻摆在它面前的所有内容——包括你的消息、你附上的任何文件,以及它从搜索中获取的任何内容。改变这些输入中的任何一项,概率就会随之改变。 它并不总是选取单个概率最高的词。沃尔弗拉姆指出,一个每次都只选择最高概率词的模型会产生平淡、重复的文本,因此人们实际使用的系统会有意地时不时选取一个排名较低的词。这就是为什么同一个问题在不同日期可能产生两种不同答案。控制这一设置的选项位于开发者工具中,大多数人用来打字的聊天窗口并没有这个选项。 工具会改变概率。正如其开发者在2026年9月所描述的,主流助手会在判断问题需要时搜索网络、读取你附上的文件,或编写并运行一小段程序,每种工具都可以用普通语言要求启用。OpenAI的帮助中心说,当某个问题需要最新信息时,其助手可能会自行搜索。 Anthropic的文档说,其模型在涉及数据或非简单数学的请求时会运行代码,对于简单算术和对话性问题则从记忆中作答。需要注意的词是"可能"。一个经检索得到的答案,其集合会缩小到搜索或文件返回的内容。一个流畅但没有引用、没有显示已搜索、也没有展示代码的答案,无论读起来多么精致,都可能来自记忆。 自信是一种风格。Anthropic 的可解释性团队于 2025 年发现,其模型在缺乏信息时的默认行为是拒绝回答,而一个独立的"已知实体"信号一旦识别出主题,便会关闭这一默认设置。当模型识别出一个名称却对其一无所知时,这一开关就会出现误触,结果便是给出一个流畅却错误的答案,语气毫无变化。Kalai 的研究团队有一个更直白的例子。在被问及某位作者的生日时,同一个系统在不同场合给出了三个不同的日期。全部都是错的,却都以陈述事实的口吻说出。 将上述所有要点综合起来,可以解释其中的差异。对于模型已经见过数千次答案的问题,或者借助工具检索到答案的问题,概率会集中压在某一个续写结果上。但若是一个判断性问题、多来源的综合分析、建议性问题,或是根本没有来源可供检索的问题,概率就会分散到许多读起来同样流畅的续写结果上。模型的表达方式不会告诉你你得到的是哪种情况,而下面的提示词正是你用来判断这一点的工具。 ## 询问哪些内容经过核实,哪些只是推测 最简单的做法是在任何问题后面加上一行。让助手标注每条陈述的来源。 在这种情况下,三个标签比两个更有效。"检索"表示该陈述来自搜索或文件,助手应附上链接或引用原文。 "记忆"表示来自训练数据,没有具体来源可以指向。 "推断"表示助手从前两类内容中推理得出。 许多自信的错误属于"记忆"类别,而将内容简单分为"已验证"和"未验证"两类,可能会把这些错误隐藏在其中。 Anthropic 的文档推荐了两种相关方法。给模型明确的许可,让它可以说自己不知道。该公司甚至报告称,这一做法大幅减少了虚假陈述。此外,要求模型为每条陈述注明来源,以便你逐条核查答案。 将标签用于事实性内容。建议性内容没有可供检索的来源,强行要求来源会促使模型为一个判断凭空捏造引用。对于你将据以行动的问题,一个带标注的答案胜过十个不带标注的答案。为什么?因为它告诉你哪些句子需要核实。 如果助手将某条陈述标注为"记忆",而你需要的是检索结果,那就在下一条消息中要求进行搜索或文件读取。工具是可用的,是模型自行判断不需要使用它,而你可以推翻这一判断。 ## 在得到答案之前,先了解答案的全貌 对于一个开放性问题,一个审慎的人可能会给出多种答案。单一回复会掩盖这一点。两个提示词可以让助手在做出选择之前,先向你展示完整的可能性集合。 第一个提示词是要求列出候选答案。Katherine Tian 及其同事于 2023 年发现,在做出明确回答之前先列出多个可能答案的模型,比被要求直接给出单一答案的模型表现出更好的校准置信度,这与心理学领域更早的一项发现相吻合——人们一旦考虑到其他可能性,就会变得不那么过度自信。 有一个有用的补充:询问每个候选答案在什么条件下成立,这样一来,一份选项列表就变成了一个可以对照自身情况加以检验的决策框架。 第二个提示词是要求给出范围,而不是一个具体数字。助手给出的任何关于成本、时间线或结果的数字,都只是从一个分布中抽取的一个样本,单一数字会掩盖这一分布究竟有多宽。 如果任其自行发挥,模型给出的范围往往过窄。2025年一项名为FermiEval的基准测试要求多个模型给出其99%确信的范围,而真实答案落在这些范围内的概率仅约65%。 2026年的预测基准测试QuantSightBench在提示词本身中找到了解决方案。在提示中告知模型范围应有多高的准确率,能使范围变宽,并提升质量。 因此,应先说明范围需要多少次成立,再询问哪些因素可能使结果超出该范围,最后再询问最可能的情况,以免它锚定区间的两端。 以上两个提示词都适用于开放性问题。对于可核实的事实,答案集合只有一项,要求候选答案会浪费一轮对话,还可能诱使模型编造出根本不存在的替代答案。 ## 在助手填充答案集合之前,先缩小它的范围 上述提示词的作用是揭示答案集合。接下来的两种方法则通过改变模型的续写起点来缩小集合。 每个问题都携带着假设,有些来自你,有些来自模型,而助手会在所有这些假设的基础上继续推进。Anthropic 2025年的可解释性研究通过一道数学题揭示了这一点。 当给出一个指向特定最终答案的提示时,模型会反向推导,生成看似合理的步骤,最终落在那个被暗示的数字上,而非真正求解问题。你问题中的错误前提的作用与此相同——模型将其视为固定出发点,然后朝它推理。 先索要假设,再要答案,两类假设都要问。然后纠正其中错误的,将更正后的假设明确写在前面,作为一条新消息重新提问。 在同一对话线程中回复"不对,实际上……"会让第一个答案留在模型面前,而第一个答案仍将是最可能被继续的内容。 缩小答案集合的第二种方法,是描述答案必须通过的检验标准。这与增加关于主题本身的细节不同。"详细解释复利"缩窄了主题,却让可接受答案的范围依然很宽。 改成"解释复利,使从未用过电子表格的人也能手算一个例子,字数不超过200字,且每个术语在出现的同一句话中就给出定义",符合条件的答案集合便会缩小,因为模型可以逐条对照检查自己的草稿。 Anthropic的提示词工程指南将定义成功标准列于所有技巧之首。从概率角度来看,每增加一条标准,就会排除那些读起来不错却可能让你失望的续写内容。 将标准控制在两到三条。超过这个数量,模型可能更专注于满足规则,而非找到正确答案。 ## 重新运行并观察结果的分布 最后一步能捕捉到其他方法遗漏的内容。打开一个新的对话,粘贴同样的问题,重复两到三次。 将这些结果当作一次测量来读。对于可核实的问题,多次运行结果一致并不能说明什么,因为模型本就知道答案,重新运行只是再次确认。 对于开放性问题,结果一致意味着模型的观点已经确定,但你仍应加以核实。结果出现分歧,则说明这个问题本身尚无定论,或者模型在猜测——无论哪种情况,你都不应将任何一条单独的回复视为答案。 Kalai的生日例子展示了结果分布如何揭露猜测行为:三次运行,三个不同日期,仅凭这种分歧本身,就足以表明该系统是在猜测。 Anthropic 的文档将此列为其技术之一:多次运行同一提示,并将输出之间的不一致视为幻觉信号。 2022 年 Xuezhi Wang 及其谷歌同事关于重复采样的原始研究,通过多次运行来投票选出最常见的答案——这一设计是为频繁出错的较弱模型而生的。 后来一项研究认为,较新的模型在可验证问题上给出相同答案的频率已经非常高,以至于投票几乎毫无意义。对你而言,重复运行是为了衡量差异的分布范围,而差异一旦存在,你便获得了单次回答无法告诉你的信息。 一致并不等于正确。当错误答案在训练数据中占主流时,模型可能每次都给出同样的错误答案。重复运行也需要耗费时间,因此请将其保留给你将要付诸行动的答案,并且每次都开启一个新对话。在同一对话中进行重复运行,会因为第一个答案已经摆在眼前而倾向于靠近它。 ## 你不再追问的那个问题 坚持几周之后,改变会先体现在你自己的提问中,然后才体现在助手的回答里。 你不再追问助手是否正确,而是开始追问答案集合的范围有多宽。一句自信的话,不再被你读作证据,而是被读作一种语气。核查的时机从对话末尾——你审核一个已完成的答案——移到了对话开头,你在那里打磨问题,使集合变小或变得可见。 这不是不信任。你是在学习辨别:助手的哪些回答来自狭窄的集合,哪些来自宽泛的集合,并将核查的精力花在后者上。 助手并没有变得更准确。是你变得更善于判断它的哪些回答是稳定的——而这种差异,从语气上永远看不出来。 不要再问答案是否正确。要问:可能的答案有多少种。 每一条回复都是从一个集合中抽取的一次样本,而你的提示决定了这个集合有多大,以及你是否能看见它。 从这些提示中挑选两个,在本周每天使用它们。到下周一,你将能在每一个回答背后感知到那个集合的存在——而那些迟迟未行动的人,仍将继续信任一种语气。 如果你觉得这篇文章有用,请查看我下方的新闻通讯 我每周分享一项 AI 超能力 订阅,完全免费 https://linktr.ee/alex_prompter