通过明确目标、环境、预算与交接测试,以满负荷状态运行 Fable 5.1 的实用指南。
AI translation, not an official translation. Refer to the original for technical details.
Adapted from @a1exstone# 如何充分释放 Fable 5.1 的全部潜力 大多数人使用 Fable 5.1 的方式,只发挥了它实际能力的十分之一。有一种更快的方法,而且比看起来更不需要技术门槛。 这就是在聊天窗口里完成一项任务,与拥有一套能在你睡觉时完成四十项任务的系统之间的区别。 2026 年 9 月 1 日,一切发生了改变。Anthropic 发布了 Fable 5.1,此次真正的变化不在于原始智能,而在于记忆的成本。缓存读取费用从每百万 token 1 美元降至 0.25 美元,在 Anthropic 的智能体编程基准测试中,得分从 42.0% 跃升至 55.8%。过去那个逼着所有人写短小、廉价、一次性提示词的约束已经消失,但没有人更新自己的使用习惯。 读完这篇文章,你对 Fable 5.1 的掌握程度将超过你关注的绝大多数人:全力运行究竟意味着什么(分三部分讲解)、找出你当前设置中所有浪费运行的那个测试、一个能自我回本的单一模式、它在生产环境中会在哪三个地方出问题、什么情况下这个模型完全不是正确的工具,以及今晚如何交给它一项真正的端到端任务。 在正式开始之前,请在 X 上关注我,我刚创建了账号,每天在那里发布更多 AI 内容。 X - https://x.com/a1exstone ## 1. 这一切的起源。 上面那行字是 Anthropic 在发布当周从官方账号发出的。一个月前,大家争论的还是哪个模型推理能力更强。现在,一个不同的问题取而代之:一个模型在没有你介入的情况下,能保持多久的有效性。 上下文窗口为 100 万 token,最大输出为 12.8 万 token,在科学终端基准测试中,得分从 24.7% 直接翻倍至 52.6%。 随后,反弹来了。没过几天,开发者们最集中的抱怨就是几分钟内就把一天的使用限额烧光。Every 团队眼看着它针对一个要求 8 到 12 条引语的请求,返回了 43 条。 他们说得对,而这正是好消息。一个会一直运行直到被什么东西叫停的模型,只有在你从未写清楚在哪里停下时才会危险。那是一个写作问题。 ## 2. 全力运行究竟是什么。 全力运行是三件事,而且没有一件是更好的提示词。 **简报**是以完成品形态陈述的结果,而不是一条指令。"所有未解决的 p2 级 bug 都有一个失败的复现测试"是一份简报。"请写一些测试"是一个愿望。 **环境**是它在你离开时能够访问和修改的内容——文件、Shell、浏览器、搜索工具。一个拥有 100 万 token 窗口却没有任何工具的模型,不过是一个昂贵的阅读器。 **预算**是上限与停止条件,在运行开始之前就写好——token 上限、文件上限,以及任务结束的那个时刻。 用一句话概括:简报说明"完成"是什么样子,环境说明它能触及什么,预算说明什么时候该停下。 注意缺少了什么——没有步骤,只有完成的样子和边界在哪里。 ## 3. 找出浪费运行的测试。 这就是交接测试。四分钟,无需任何新工具。打开你上一条长提示词,遮住它上方的对话历史,逐句阅读,同时问自己:一个从未见过我的承包商,能否在不向我提问的情况下执行这条指令? 如果不能,就标记出来。那就是一个空缺,而 Fable 5.1 不会让空缺空着,它会悄无声息、信心十足地用自己的判断填满它。 来看一个真实案例。"整理一下引导流程,让它感觉更现代。"一个承包商会在三处卡住:"整理"、"引导流程"和"现代"——十一个字里藏着三个空缺。修改后的版本会指明文件夹名称、删除规则、需要保留的内容,以及任务结束的条件。 数一数这些空档。每一个大约消耗十分钟的运行时间,花在你从未主动选择的地方。 ## 4. 你的提示词本身就是一种委托。 你早已在委托 Fable 5.1,只是方式极为糟糕:一行简报,没有环境,没有上限,靠人工轮询来获取输出。 一次 40 轮的对话,会把上下文重新发送 40 次,并向你索要 40 次决策。这不是监督,而是在一个已经不需要瓶颈的系统里,亲手成为那个瓶颈。另一种方式是:一份简报,在热缓存上完整运行一次,最后审阅一次。 模型从来不是极限,极限在于你交给它的任务有多小。 ## 5. 唯一值得掌握的模式:常备简报。 有一个模式值得深入学习,其余的都是它的变体。这就是**常备简报**,分三个阶段:界定范围、执行、验证。 **界定范围**只发生一次,在任何执行开始之前,此后不再重复。**执行**是附带真实工具的单次调用,刻意拉长。**验证**是在全新上下文中进行的第二次调用,这个上下文从未见证过工作的发生过程。它将两件人们常常混为一谈的事拆开来:做工作需要长记忆,评判工作需要短记忆。 读一遍,整个方法的脉络便一览无余:在任何执行之前写好的契约,在工作所在处将努力程度调高,在检查所在处将其调低,验证环节只看差异,别无其他。努力程度默认为高,所以关键动作是在检查器上将其调低。 ## 6. 停止条件才是全部的诀窍。 人人都会复制简报,几乎没有人写停止条件——而这条线,正是那些只是读过长时运行文章的人,与真正能将其落地的人之间的分野。 省略它,以下是团队在最高努力设置下反映的情况:它会衍生出没人要求的子智能体。Every 的一位测试者曾要求它停下,却眼睁睁看着它"直接无视我,继续运行"。失败从来不是崩溃,而是一次成功完成了比你的任务更大的工作的运行。 有一条规则要牢记:永远不要让做了这件工作的模型来决定工作何时结束。 检查器永远不修复任何东西。一旦它可以编辑,它就开始自我辩护,而非进行判断。 ## 7. Fable 5.1 真正会出问题的地方。 1. **强制工具使用已被移除。** 如果你的智能体循环将模型绑定到某个工具,它会返回 400 错误。`tool_choice` 的 `type any` 和 `type tool` 在 5.1 中均已被移除,因此为 Fable 5 编写的循环在第一次调用时就会中断。 修复方法:使用严格工具调用,或使用结构化输出。 注意缺少了什么——没有步骤,只有完成后的样子,以及边界在哪里。注意缺少了什么——没有步骤,只有完成后的样子,以及边界在哪里。注意缺少了什么——没有步骤,只有完成后的样子,以及边界在哪里。注意缺少了什么——没有步骤,只有完成后的样子,以及边界在哪里。2. **它不再批量处理工具调用。** Fable 5.1 通常每轮只发出一次工具调用,而 Fable 5 会一次发出多个。在 bash 与编辑器的组合环境中,这会把一个快速循环变成一个缓慢的循环,努力程度越高,情况越差。 2. **它不再批量处理工具调用。** Fable 5.1 通常每轮只发出一次工具调用,而 Fable 5 会一次发出多个。在 bash 与编辑器的组合环境中,这会把一个快速循环变成一个缓慢的循环,努力程度越高,情况越差。 修复方法:一句话,限定在当前轮次范围内。 3. **思考块绑定于对话前缀。** 如果你编辑了较早的消息、对轮次重新排序,或在请求之间重建系统提示,就会收到 400 错误,提示该块绑定于不同的对话。在每个请求上加一个时间戳就足够了。 修复方法:保持历史记录仅追加,让不匹配降级而非失败。 ## 8. 你真的需要它吗? 按我写文章的惯例,让我们诚实地想清楚,这对谁才真正有用。 持续性任务简报能买到无人值守的广度。它买不到更好的判断力,而且对于小任务来说,它比直接输入问题还要慢。 以下情况请跳过 Fable 5.1: - 手动完成不超过十分钟。签约的时间比完成工作的时间还长。 - 输出是一个答案,而非一件成品。你为从未用到的工具付了钱。 - 你无法用一句可核查的话描述"完成"。目标模糊、运行时间长、账单巨大。 - 没有人会仔细阅读结果。未经审查的输出是一张附有收据的责任单。 - 你上一次的提示通过了交接测试,而且只用了一轮。那从来都不是模型的问题。 ## 9. 没人想听的部分:禁止清单。 即便你把上述每一步都做对了,结果依然可能偏离方向。Fable 5.1 遇到模糊性不会停下来,它会直接解决。每一个空白都会得到一个决定,每一个决定单独来看都有其道理。当被要求在 Blender 中建一个角色模型时,它交出了一个圆润、简化的构建,并坦然解释道:"我做了一个你从未要求的风格决定。" 把这个乘以四个小时。四十个合理的选择层层叠加,最终凝聚成某种连贯的东西——但那不是你想要的。没有任何东西失败了,所以没有任何错误可供阅读。 解药是禁止清单。一套写下来的、禁止模型独自做出的决策,与结果一起保存在同一份合约旁边。不包括风格。不包括架构。不包括范围。 一切都被决定了。没有任何东西是被选择的。 ## 10 - 在 Claude Code 中自己构建一个。 在真实的代码仓库中打开 Claude Code,将模型设置为 Fable 5.1,然后将下面的代码块作为你的第一条消息粘贴进去。它会读取合约、制定计划,并在触碰任何文件之前请你审批。从那以后,协调工作存在于文件系统而非对话中,因此长时间运行永远不会重复消耗你的上下文窗口。 你将看到计划、审批提示、一段漫长的安静期,然后是表格。看 CAP 那一行。四十个文件是刻意设置得很小的,第 12 节解释了原因。 ## 11. 可以立即粘贴使用的现成简报。 积压工作清扫,用来替代一周的工单苦役。上限让第一次运行保持诚实,同时让你了解你的代码仓库的代价。 研究助理台,用来替代三十个打开的标签页和一个周日。附上搜索工具,否则你为回忆能力支付的是前沿价格。 文档重建,用来替代你一直在拖延的改写。给它设一个严格的字数上限,因为字数是这个模型最先超出的地方。 ## 12. 成本与监督。 这是账单。输入每百万 token 10 美元,输出每百万 token 50 美元。缓存读取每百万 token 0.25 美元,较之前的 1 美元大幅下降。Opus 5 的价格是 5 美元和 25 美元。 Anthropic 估计典型节省约为 25%,在长时间自主运行中最高可达 45%,测试人员发现它使用的 token 约为 Opus 5 的一半,实际运行时间约为 Opus 5 的 60%。 现在看另一面。Every 的一位工程师在单日内以最高努力设置推送了约 18 亿个 token,所以你自己做这道乘法吧。第一周最大的抱怨是订阅限额在几分钟内耗尽。努力程度默认为高,而几乎没有人将其调低。 所以从小处开始。用 40 个文件的上限运行一个简报,看看它花了多少钱,然后再扩大一次。 ## 13. 这对你究竟意味着什么。 这就是全貌。你现在明白了"全力运行"意味着什么,承载它的模式,它在哪里崩溃,以及即使把一切都做对了依然存在的陷阱,还有哪些人应该跳过它。 它换来的是无人值守的广度。它换不来更好的判断力——这就是为什么验证环节不是可选项,也是为什么排除清单必须存在。 所以,正确的做法不是把所有事情都跑成长流程。而是要知道:哪项任务值得一份契约,以及有时候在对话窗口里问一个问题,就已经是答案了。 我的建议:今晚就做交接测试。拿出你最近一次写的长提示词,遮住上下文历史,把每一句陌生人无法据此行动的话都标记出来。然后写出你一直缺失的那三行:上限、终止条件、排除清单。 大多数人会继续敲提示词,盯着光标闪动。少数学会写契约的人,会把任务交出去,然后读报告。 如果你想随时了解 AI 领域的一切动态,请在 X 上关注我: X - https://x.com/a1exstone 注意缺少了什么。没有步骤,只有完成后的样子,以及边界在哪里。