详细拆解OpenAI和Anthropic如何按Token收费,包括不可见的推理成本与普通用户无法触及的折扣。
AI translation, not an official translation. Refer to the original for technical details.
Adapted from @MossAI_Official# 你正在为永远看不到的Token付费 OpenAI或Anthropic账单里究竟包含什么,两家公司在文档中公开但从聊天框无法触及的折扣,以及为什么能够触及这些折扣的那一层,如今变成了你可以拥有的东西。 问大多数人AI花了他们多少钱,他们会报出一个月费数字。 问一次对话花了多少钱,整个房间就会沉默——这很正常,因为诚实的答案相当复杂。OpenAI和Anthropic都以一种你看不见的单位计费,在四个独立维度上定价,并在各自的文档中公布了一套折扣方案,而这些折扣对于坐在文本框前的普通用户来说几乎完全无从获取。 这一切都没有被隐藏。所有内容现在就在他们的定价页面和开发者文档里。只是需要比大多数人所处的位置再深入一层。 公开价目表与普通人实际支付价格之间的差距,并不是什么丑闻。这是一门生意,而直到最近,你都没有办法站到它的另一边。 本文将阐述账单里实际包含什么,为什么真正的调节杠杆存在于它们所在的位置,以及当能够拨动这些杠杆的那一层变成你可以持有而非只能付费的东西时,会发生什么改变。如果你想获得更多关于AI与所有权的内容,请关注 #。 账单上的7件事,直接来自他们自己的文档 以下所有内容均由OpenAI或Anthropic公开发布。在工程团队之外,这些内容几乎无人知晓。费率持续变动,因此请将具体数字视为结构说明,而非精确报价。 1. 输出成本是输入成本的数倍,两个平台均如此 两家平台所有模型的价目表都将输入和输出分开计费,而输出始终更贵。比例通常在四比一到六比一之间。 实际意义上的重新理解才是关键所在。你输入的内容几乎是免费的。模型回复的内容才是账单的来源。限制答案的长度对成本的影响,远大于精简问题本身——而这与几乎所有人的行为方式恰恰相反。 2. 你需要为无权查看的推理过程付费 这一条应该真正让你感到意外。 OpenAI自己的帮助文档明确指出:推理Token不会以答案文本的形式显示,但计入输出用量并按输出Token收费;因此,一个简短的可见答案实际消耗的Token数量,可能远超其显示文本所呈现的数量。他们的推理指南也证实,原始推理Token不会对外暴露,只提供一个可选的摘要。 你正在以输出价格,为结构上不允许你查看的文本付费。 3. 你的输出上限无法限制隐藏部分 情况更为尖锐。运行这些模型的相关文档指出,最大输出Token参数限制的是可见输出,而隐藏的推理Token不受该限制约束。 由此产生了一个有据可查的后果:一个请求可能在推理阶段就耗尽预算,最终什么都不返回,而Token已经被消耗。OpenAI的推理指南直接承认了这一结果,指出你可能在没有收到任何可见回复的情况下,产生输入和推理Token的费用。 计费器在运转,屏幕保持空白,而这是有据可查的行为,而非程序缺陷。 4. 重复上下文享受九折优惠,两家公司都明确告知 提示词缓存是整个技术栈中最大的单一调节杠杆,而大多数人从未听说过它。 Anthropic 的缓存文档显示,缓存读取定价为基础输入价格的 0.1 倍,五分钟缓存写入为 1.25 倍,一小时缓存写入为 2 倍。OpenAI 在当前 GPT-5 系列上采用相同的定价结构,缓存输入定价约为标准输入费率的十分之一,缓存写入则有其自身的溢价。 这里的数学计算才是真正有用的地方。读取费率为十分之一,写入费率为 1.25 倍,对于相同前缀而言,缓存未命中的成本约为缓存命中的十二点五倍,盈亏平衡点大约在两次读取时出现。对于任何在每次调用时都会重新发送相同系统提示、工具模式或参考文档的场景来说,这就是账单金额小与大之间的全部差异所在。 这其中也存在一个值得了解的脆弱性。两家提供商都基于精确前缀匹配进行缓存,因此提示词靠前位置哪怕改变一个字节,都会使其后所有内容的缓存失效,而价格会悄无声息地恢复至全价。 5. 两家提供商都能将可延迟处理的任务账单减半 OpenAI 和 Anthropic 均提供异步批处理层级,输入和输出均享有五折优惠。Anthropic 的定价文档明确指出,缓存乘数可与批处理折扣叠加使用。 将两者叠加后,批处理中缓存输入的 token 费用仅为标准价格的极小一部分。这对任何交互式场景都不适用,这也正是没有任何面向消费者的产品向你开放这一功能的原因。 6. 折扣取决于你所绑定的模型 ID,而非你认为自己正在使用的模型 这是几乎没人会检查的一点。 缓存折扣在提供商目录中并不统一。在 OpenAI,当前 GPT-5 系列的缓存输入可享受约九折优惠,而旧一代模型的折扣幅度则小得多。在 Anthropic,标准缓存读取乘数为基础输入的 0.1 倍,某些较新的模型则折扣力度更大。 同一提供商、同一功能名称,仅因配置文件中的一个字符串不同,经济效益便存在实质性差异。旧版模型 ID 的情况比这还糟糕。通过云合作伙伴仍可访问的已停用 Anthropic 模型,依然沿用其原始费率,而这些费率对于能力更弱的模型来说可能是当前价格的数倍。 当初有人设置了那个字符串,此后便无人再审视它。大量超支实际上就源于此处。 7. 超越上下文阈值可能导致整个请求重新定价 这是最微妙的一点,也是形态最为险恶的一点。 OpenAI 在部分模型上公布了独立的长上下文费率,而其机制并非人们通常所以为的那样。超过阈值后,整个请求将重新定价,而非仅对超出阈值的 token 收费。哪怕只超出一个 token,整次调用的费用也将约为原来的两倍。 Anthropic 在这一问题上采取了不同的立场。在近期的 Claude 模型上,完整上下文窗口按标准的每 token 费率计费,缓存和批处理折扣适用于整个窗口。 这是两个平台之间真实存在的结构性差异,在任何面向消费者的界面上都看不见它。如果你的工作负载需要使用长上下文,这一差异可能盖过所有其他定价考量因素。 # 这些调节手段是公开的。你仍然无法触及它们。 以下是结构性的关键所在。 API层之上的每一个杠杆,都需要对提示词结构的控制权,才能真正命中缓存;需要模型路由,将合适的任务分配到合适的价格层级;需要批处理,应对那些可以容忍延迟的工作;需要推理算力的精细管控;还需要清楚地知道每个请求落在哪个上下文层级。 从消费者聊天界面来看,你所拥有的不过是一个文本框和一笔月费。你无法路由,无法批处理,无法构建缓存前缀,也看不到你的推理算力设置究竟在消耗多少钱。 于是,一个价差就此形成。一边是有能力的运营者通过组合这些手段所能达到的成本;另一边是普通用户实际支付的价格。这里没有人被欺骗。这些折扣是工程层面的接口,而非面向消费者的功能,消费者产品本来就不是为了暴露这些而构建的。 活在这个价差之中的,是中继商、网关和聚合器。它们站在用户和提供商之间,将请求路由到最便宜的可用模型,持续预热缓存以避免重复上下文被按全价重新购买,批量处理可以批处理的请求,然后将比原始API更简洁的东西交到用户手中。 它们的收入,就是这个价差。而这正是事情变得有趣的地方。 # 中继是一门吞吐量生意,这在这里并不多见 这个市场上的大多数事物都是赌注。你持有一个判断,对了或错了,结果大起大落。 中继是收费站。流量通过,利润按单位累积,经济规模随使用量增长,而非取决于任何人是否判断正确。 由此产生三个特性,且三者都不寻常。 收入是按单位持续产生的。不是一次性的,不是事件驱动的,也不依赖于某个判断是否正确。Token不断流动,利润逐时累积,日夜不停。 需求与加密货币不相关。写代码、生成视频、运行助手的人,不会先去看行情。消费的驱动力是AI的普及采用,而这是这个行业中极少数不随大盘同向波动的事物之一。 活动是一个计数,而非一种解读。吞吐量是可以度量的,无需任何归因争议。不存在某个好月份究竟是能力还是运气的疑问。请求要么通过了,要么没有。 最后一点的意义,比听起来更深远。让任何事物变得可以被证明,难就难在证明它究竟做了什么。吞吐量业务在"发生了什么"与"可以展示什么"之间,有着异乎寻常的短距离。 ## Model Max,以及拥有收费站而不只是在收费站付钱 Model Max 是一个Token API中继,它现在已作为赎回代理在Moss Agent Marketplace上线运行。 产品层面直截了当。通过统一路由访问各模型,路由、缓存和批处理均在那个真正能做出这些决策的层级处理——而非在你只能对着文本框干瞪眼的层级。 另一半才是值得关注的部分。作为Marketplace上的一个代理,这个中继不只是你使用的东西,也是你可以持有头寸的东西。 这种形态与这一品类的大多数产品截然不同。中继的活动接近可验证声明的理想输入,因为吞吐量是事实,而非叙事。无需解读什么历史记录,也无需凭信任接受什么业绩故事。使用要么发生了,要么没有——这是清晰可辨的。 这也是我们推出的第二个赎回代理,其中被使用的事物与被持有的事物是同一个对象。你可以同时作为中继的用户和持有者,而第二重关系并非忠诚度等级,而是一种持仓。 我们从交易代理起步,因为交易是最严苛的试验场。一个数字要么是真实的,要么是一个故事,而链上环境不允许你对此撒谎。赎回代理将同样的标准延伸至那些永远不会开永续合约的人。接下来的发展将走得更远,迈向那些不仅运行于链上,更在链上自主发行与运营的系统。 待其上线后我们再作介绍,而非提前预告。 # 本周可做的 4 件事,无论你使用什么工具 这些都不需要 Moss。 停止优化提示词长度,转而约束输出内容。你付费购买的是答案,而非问题。要求五十个字而非五百个字,对你账单的影响大约是压缩提示词的十倍。 检查你的推理努力设置究竟买到了什么。对于不需要深度推理的任务,高努力设置意味着花钱在你实际收到的回答中毫无改善的隐藏 token 上。这是人们在毫无察觉的情况下最常见的超额付费方式。 打开你的配置文件,读取模型 ID。不是你以为自己在使用的模型名称,而是实际的字符串。然后对照当前价格表核查。旧版 ID 会悄然沿用旧有的定价逻辑,有时对一个能力更弱的模型反而享有差得多的缓存折扣。 如果你在构建任何东西,在优化其他任何方面之前,先衡量缓存命中率。响应中的用量字段会告诉你新鲜输入、缓存写入和缓存读取各自的比例。在重复调用中读取次数为零,意味着提示词靠前的某处内容在变化,并使其后的所有内容缓存失效。这是一个藏在一个字节背后的十二倍成本差异。 这四点背后的共同习惯才是真正的要点。将 AI 支出视为一张有结构的账单,而非一个有金额的订阅。一旦结构清晰可见,谁在其中处于何种位置的问题也就随之浮现。 # 现在该做什么 前往 moss.site,了解 Model Max。如果你有需要,可以将其作为中继使用。如果你感兴趣,可以了解持有其中一个仓位意味着什么。两者均已上线,且它们是同一个对象——这正是我们认为全新之处所在。 每一种经济体最终都会确定谁拥有其基础设施。AI 经济目前正处于这样一个阶段:所有人都在收费站付费,却没有人想过要问这个收费站归谁所有。 这个问题还将在一段时间内保持开放。 👉 moss.site ## 来源 - OpenAI 帮助中心,关于理解和计算 token,以及推理 token 作为输出计费但不作为答案文本可见的说明:https://help.openai.com/en/articles/4936856-what-are-tokens-and-how-to-count-them - OpenAI 推理模型指南,关于原始推理 token 不对外暴露以及在无可见响应的情况下产生费用的说明:https://developers.openai.com/api/docs/guides/reasoning - OpenAI API 定价页面,包含各模型当前的输入、缓存输入与输出费率,以及批量、弹性等级和长上下文费率:https://openai.com/api/pricing/ - Microsoft Learn 关于 Azure OpenAI 计费的问答,关于隐藏推理 token 被计入账单以及最大输出 token 参数无法约束其数量的说明:https://learn.microsoft.com/en-us/answers/questions/5542366/why-did-azure-report-more-completion-tokens-than-m - Anthropic 提示词缓存文档,关于缓存读取为基础输入价格的 0.1 倍、写入倍率,以及与批量 API 折扣叠加使用的说明:https://platform.claude.com/docs/en/build-with-claude/prompt-caching - Anthropic 定价页面,了解当前各模型费率及批处理 API 折扣:https://claude.com/pricing