基于 Anthropic 官方文档,逐一核查 Claude Pro 减少 token 消耗的实用建议。
AI translation, not an official translation. Refer to the original for technical details.
Adapted from @alex_prompter# 如何充分利用 Claude 的 20 美元套餐 每周都会有一份关于 Claude 省 token 习惯的清单疯狂传播:十条习惯、精确的 token 数量,却没有任何来源。 其中有些建议直接源自 Anthropic 的官方文档,有些不过是某个人的猜测,只是披上了数字的外衣。从那些帖子里根本无从分辨。于是我花了一天时间阅读 Anthropic 的帮助中心和开发者文档,逐一核查那些被反复引用的建议。 以下是经过验证的内容、未能通过验证的内容,以及贯穿两者的核心机制。每一条说法都附有来源页面的链接。 ## 帮助中心的一个页面解释了大部分问题 标题中提到的套餐是 Claude Pro——Anthropic 面向个人用户推出的付费方案,在美国定价为每月 20 美元。我首先想弄清楚的是消息数量,也就是 20 美元能买到多少条消息。 Anthropic 没有公布这个数字,因为根本不存在一个固定数字。帮助中心列出的是影响额度消耗的因素:消息长度、附件文件大小、当前对话长度、工具使用情况、模型选择、响应级别,以及 artifact 的生成。不同的工作会以不同的速度消耗额度,而那些广泛传播的帖子通通跳过了这份清单。 这份清单中消耗最大的因素是对话长度,开发者文档解释了原因。一次请求中的所有内容都计入上下文窗口:系统提示、之前的每一条消息、每个文件、每个工具调用结果,以及正在生成的回复。每次你发送消息,Claude 都会从头处理整段对话,因此你发送的第 30 条消息,实际上携带着前 29 轮对话的内容。 在介绍具体建议之前,有两个量化参考:一个 token 约等于 3.5 个英文字符,大约是四分之三个单词,因此一篇 1000 词的文档大约相当于 1300 个 token。此外,额度消耗内置了一个缓冲机制——Anthropic 会缓存项目内容,甚至对频繁重复的提示进行部分缓存,因此相同的内容第二次发送时消耗更少。 牢记这份因素清单,因为它可以直接转化为使用效率的提升。缩减清单上的任何一项,同样的 20 美元在触达任何限制之前就能支撑更多工作。我核查的每一条建议,要么是在缩减清单上的某项因素,要么是在宣称一种这套系统根本无法提供的精确度。 ## 最像民间传说的建议,反而第一个得到了验证 我原本以为"把所有问题放在一条消息里发送"只是一种迷信。结果文档里几乎原话就是这么说的。 Anthropic 的最佳实践页面建议你:将类似的请求合并为一条消息,在开始对话前做好规划,并在发送前检查提示,以减少后续补充的需要。原因就在于上面提到的机制——三次单独的追问会让 Claude 将整段对话处理三遍;而一条完整的简报只需要对历史记录进行一次遍历。 同一页面详细说明了一条好的第一条消息应包含哪些内容,读起来就像一份清单:你需要的具体结果、所有相关问题的合并,以及预先提供的背景上下文。Anthropic 自己的例子言简意赅:把所有数学题放在一条消息里发送,而不是一题一条。 实际效果如下所示。较弱的开场白:"你能帮我优化一下我的落地页吗?"较强的开场白:"请为面向自由设计师的落地页重新撰写文案,控制在 300 词以内,语气与下方两个示例保持一致,并标注任何需要我核实的说法。"第二种版本只需一次对话。第一种则会引出一场由五条消息组成的反复问询,而你要为每一行都付费。 节省效果在整个工作日中持续累积。每一次你省去的追问,都意味着少进行一次完整的聊天记录扫描。 ## 后来我发现了 Anthropic 特意内置的折扣 Projects(项目)是定价向你倾斜的唯一场所,官方文档对此直言不讳。 项目中的内容会被缓存,重复使用时不计入你的用量限制。文档以一篇研究论文为例:只需加载一次参考资料,之后反复针对它提问,消耗的消息条数远少于每次重新上传的开销。对于你的用量预算而言,这意味着最重的参考资料只需一次性付出成本,而非每次对话都要重复计费。 大型项目还享有第二重机制。一旦项目知识量接近或超过上下文窗口限制,Claude 会自动开启检索增强生成(RAG),无需任何配置。 Claude 不再一次性加载所有项目内容,而是检索文档并提取与问题最相关的片段——Anthropic 表示,这让单个项目的存储容量最高可达原来的 10 倍。低于该阈值时,项目内容仍以普通的上下文内嵌方式加载。 文档还补充了两个大多数帖子都会略过的维护习惯:项目说明要简短,因为冗长的说明会随该项目的每次对话一同加载进来;不再使用的文件要及时删除,因为冗余内容会占用上下文空间。Anthropic 建议将项目说明定位为角色设定和通用准则,而具体任务的要求则放在对话本身中提出。 有一个广泛流传的说法需要单独辨析。你可能会看到帖子提到某个具体的项目文件数量上限,据称超过这个数字 Claude 的表现就会下降。这个数字在 Anthropic 的任何官方文档中均未出现。保持项目整洁是有据可查的建议,但具体的上限数字不过是某人的个人经验之谈。 ## 文档明确建议你关掉某些功能,原话如此 我没想到一家厂商会建议少用自己的功能,但 Anthropic 的帮助中心确实这么做了。 文档将工具和连接器称为"token 密集型",并建议在对话不需要时暂时关闭网页搜索、Research(深度研究)和 MCP 连接器。努力等级和扩展思考也在同一份成本清单上,文档建议对常规任务使用较低的努力等级,不需要深度推理时关闭扩展思考。 文档还指出,管理工具可带来双重收益:开启的工具会消耗用量配额,同时也会占用原本可以承载你实际工作的上下文窗口空间。因此,同样是花 60 秒做一次检查,既能扩展你的每周预算,又能在长对话中腾出更多空间。 具体操作如下:编辑已粘贴的文本时关闭网页搜索;格式化和整理清理时关闭扩展思考;常规请求时降低努力等级;在用到连接器的对话中开启,其他地方一律关闭。你是在将计费方式与任务需求精准匹配,每一个关掉的功能,都是把配额还给真正有价值的工作。 ## Anthropic 对自家的长对话发出了警告 文档在这一点上措辞坦率。 对话长度正式列入成本清单,帮助中心的建议也直截了当:如果你在一段较长的对话中接近用量上限,就开启一个新对话。同一篇文章解释了不这样做的后果:对话一旦长到触发自动上下文管理——即 Claude 通过总结早期消息来继续运行——就会消耗更多的用量限额。 窗口大小取决于具体模型,Anthropic 公开了各模型的详细参数。在付费计划的对话中,Opus 5 和 Sonnet 5 支持 100 万 token 的上下文窗口,Opus 4.8、4.7、4.6 以及 Sonnet 4.6 支持 50 万 token,其他模型支持 20 万 token,其中一部分窗口空间保留给 Claude 的回复。更大的窗口提高了对话所能容纳内容的上限,但不会改变计费逻辑——因为窗口中的所有内容都会在你发送下一条消息时被重新处理。这条预算规则在任何模型上都适用。新开对话能让消息成本保持低廉。 一个好的使用习惯是:每个对话只聚焦一个主题,完成后就关闭。如果把三项不相关的任务混在同一个对话线程里,那么每条新消息都会连带处理其他两项任务的历史记录。关闭对话的代价比你想象的要小,因为付费计划允许你提示 Claude 搜索你之前的对话,并将相关上下文提取到新对话中。你无需携带旧对话的完整记录,却依然能获取此前的决策内容。 ## 最昂贵的习惯藏在一份开发者文档里 我找到的最大数字出现在 PDF 文档中——一个大多数上传文件的用户都会略过的开发者页面。 上传一个 PDF 后,系统会将每一页转换为图像,并同时提取文本。Claude 会对两者进行分析。Anthropic 的定价是每页 1,500 到 3,000 个 token,具体取决于内容密度,同时还会叠加图像计费成本,因为每一页都会被转换成图像。 这种设计有其用途,了解它能帮你判断上传 PDF 是否物有所值。页面转为图像是为了让 Claude 能够识别图表、表格和版面布局,官方文档也以此作为典型使用场景,例如分析财务报告中的图表。而对于纯文字内容,你付出了图像处理的成本,却完全用不上这一功能。大多数上传文件恰恰都是纯文字内容。 以一份 10 页的纯文字报告为例算一算:一份可能只有 4,000 个词的文档,仅文本部分就需要 15,000 到 30,000 个 token,这还没算上图像成本。接下来,对话长度机制开始发挥作用,这些重量会随着对话中每一条后续消息一路传递下去。 廉价的替代方案乏味,但管用。只需要两段话?直接粘贴这两段。需要整份文档?先将其转换为纯文本或 Markdown 格式——Claude 会以文本方式读取这些格式,无需任何页面图像处理。如果 PDF 确实物有所值,比如你需要分析其中的图表,官方文档建议将大文件拆分,只发送相关章节。 在 Anthropic 列出的所有影响因素中,文件权重是你无需改变工作方式就能削减最深的成本。这也是本文中实用价值最高的一个习惯。 ## 那些经不起验证的说法 调查的另一半同样重要。以下三种说法流传最广,但我在 Anthropic 的官方页面上一条都找不到。 **对话大小的精确 token 数字。** 有帖子精确引用了 20 条或 30 条消息对话的成本,精确到千位。Anthropic 明确表示,配额因消息长度、文件、模型、功能和需求而异,并未公布任何单次对话的数据。那些给出具体数字的人,不过是在用自己账户、自己的设置进行测量。 **行为断崖。** 所谓 Claude 在超过某个固定轮次后会出现能力下降或自相矛盾的说法,在任何官方文档中都找不到依据。长上下文下的行为表现确实是一个真实的研究课题,但把它说成一个固定数字,不过是把个例经验上升为普遍规律。 重置游戏排程。围绕5小时时钟构建的会话排程系统,假设你的配额每天表现相同。Anthropic表示配额会随需求变化,而这恰恰是固定排程无法纳入考量的那个变量。 这些说法不一定都是错的。它们从Anthropic外部根本无从证实,这与"已知"是截然不同的两回事。 一个针对未来任何技巧的十秒测试:问问自己,这个数字能否出现在供应商的产品页面上。价格、限制和机制可以。"所有人的账户在发送40条消息后Claude就会变笨"则不能——因为Anthropic本身就表示这些变量因账户和日期而异。如果这个数字无法被公开发布,它就只是来自某个人的一次个人体验。 这个测试保护的是你的时间,和你的令牌额度同样重要。跳过那些虚假的优化,把精力投入到供应商白纸黑字确认的五个习惯上。 ## 在一切之前,先搞清楚你碰到了哪堵墙 这些习惯解决的是不同的问题,所以先做一个诊断。 你的付费计划同时运行两个限制:每五小时重置一次的会话限制,以及单独的每周限制。它们按各自独立的时钟消耗,这就是为什么有时短暂等待后问题依然存在。如果会话额度已重置但你仍被阻止,说明你触碰的是每周上限,没有任何习惯能救回当前这周。这些习惯保护的是下一周。 在抱怨计划之前,还有三个值得了解的事实。通过claude.ai、Claude Code和Claude Desktop产生的使用量计入同一限制,所以早上在Code中的大量使用,可以解释为何下午聊天时额度所剩无几。设置 > 使用情况会显示两个进度条及其重置时间,这能让"Claude又把我截断了"变成一个可诊断的问题。如果截止日期不允许等待重置,付费计划可以启用使用额度积分,在包含的限制用尽后继续工作——这是一个有据可查的解决方案,比慌乱中升级套餐要明智得多。(http://claude.ai/) ## 简而言之 Claude Pro会权衡你的消息所承载的内容,而这些重量大部分是你在不知不觉中装载进去的。真正值得保持的习惯,来自仔细阅读供应商的使用手册——而这份手册是免费的。 大语言模型不会思考;思考的是你。 如果你觉得这篇文章有用,请订阅我下方的通讯 我每周分享一个AI超能力 订阅,免费👇 https://linktr.ee/alex_prompter