以基准测试数据为依据,比较OpenAI Astra与DeepSeek模型,明确指出40倍价差何时合理、何时不合理。
AI translation, not an official translation. Refer to the original for technical details.
Adapted from @alex_verem# 前沿智能其实并不贵 OpenAI对GPT-6 Astra收取每百万输出token 50美元的费用,而DeepSeek对DeepSeek-V4.1-Flash收取1.20美元。在两家公司均发布了同一版本评分的唯一一项编程基准测试中,两个模型相差0.1分。价格相差40倍以上,分数却只差十分之一。 问题就在这里。如果你在为Astra付费,你究竟在为什么买单——有什么是开源模型做不到的?对大多数工作而言,答案是:没有你会察觉到的差异。例外确实存在,而且具体到可以直接点名。 本文中的每一个数字都经过同一项验证:模型开发商和OpenAI都在同一版本的基准测试上发布过评分。所有数据均来自开发商自己的model card、README和发布公告。 ## 从你自己的工作类型入手 在任何数字之前,先把你自己的工作归入以下两类之一。 第一类是:你描述任务,模型完成它。修复这个bug、从这些资料中回答这个问题、起草这份文件、重构这个模块。任务有明确的终点,你可以检查结果。这正是开源权重模型已经追上来的领域。 第二类是:你把一台电脑交给模型。模型打开应用程序、读取屏幕、点击、输入、处理各种意外情况,并在无人干预的情况下运行数小时。这是OpenAI发布了相关数字、而没有任何开源权重开发商发布可比数据的领域。 下文所有内容均按上述分类整理。如果你已经知道自己的工作属于哪一类,可以直接跳到对应章节。 ## 编程 编程是大多数人正在做出决策的场景,它分为两种情况。 对于范围明确的工作,两者数字相同。DeepSWE v1.1是一个基于真实代码仓库任务、具有明确终态的基准测试。OpenAI报告Astra得分74.1,DeepSeek报告V4.1-Flash得分74.2。在100分制下相差0.1分,无法区分两者优劣,视为平局。 唯一需要说明的是,OpenAI未披露产出该数字所用的agent框架,而DeepSeek有说明(mini-SWE-agent),因此外部人员无法精确对比两次运行。这意味着这是一个无法核实的平局,也是不宜将其判定为任何一方胜利的原因。 就你的工作而言:如果你的编程工作是处理工单、修复bug、编写测试、重构代码和代码审查——也就是那种你会给一个合同工并附上清晰说明的工作——那么你正在为基准测试检测不到的差异多付40倍的token费用。 对于长时间无人值守的任务,两者数字并不相同。Terminal-Bench 4.0给agent提供一个真实终端和一项复杂的多步骤任务,并评分其是否能完成。OpenAI报告Astra得分57.9。 DeepSeek报告V4.1-Flash得分31.2,发布于2026年9月10日,这是该4.0版本的首个开源权重评分。差距为26.7分。在一个最强模型也只能完成略超一半任务的基准测试上,这意味着:一个你可以放手不管的agent,与一个你必须全程监督的agent之间的差距。 就你的工作而言:如果是让模型独立驱动自己的环境运行数小时——例如配置基础设施、迁移数据、跨系统调试且无人逐步检查——那么Astra能完成开源模型完不成的任务,那50美元买到了真实价值。 如果你对一个权重于2026年9月10日公开发布的模型感到满意,那么在范围明确的编程工作中,首选DeepSeek-V4.1-Flash。 Kimi K3(DeepSWE v1.1 得分 67.5,输出价格 $15)和 GLM-5.3(得分 66.9,$4.40)是备选方案中公开记录较为完整的两个,与 Astra 的差距均在 7 分以内。如果价格的优先级高于最后几分的差距,GLM-5.3-Flash 在同一基准测试上得分 63.4,输出价格仅 $0.50,比 Astra 低 10.7 分,却只需百分之一的价格。 ## Research and knowledge work BrowseComp 测试模型能否通过网络搜索找到难以定位的事实。OpenAI 报告 Astra 得分 91.5,Moonshot AI 报告 Kimi K3 得分 91.2。 两家公司均援引同一第三方模型 GPT-5.6 Sol 的参考分数为 90.4,这是两家实验室测量了同一事物的最有力佐证。 在研究生级别科学问题测试 GPQA Diamond 上,OpenAI 报告 Astra 得分 96.0,Moonshot AI 报告 Kimi K3 得分 93.5,差距 2.5 分——在这项两个模型均能答对十题中九题以上的测试中,差距相当有限。 适用场景:事实查找、文献综述、研究综合、从长文档中回答问题、基于资料起草内容。 这一差距处于噪声范围之内,而 Kimi K3 的输出价格为每百万 token $15,相比 $50 不足三分之一。如果你不希望依赖单一供应商,Qwen3.8-2.4T-A95B 在同一科学测试上比 Astra 低 3.4 分。 结论?此场景下没有理由选 Astra。 ## Computer use and new environments 这是 Astra 最具优势的领域,也是开放模型证据最为缺失的领域。 OpenAI 报告其在 OSWorld 2.0(一个测试模型操控真实桌面环境的基准)上得分 72.6,在 ARC-AGI-3(模型需学习从未见过的环境规则并在其中高效行动)上得分 99.9。 OpenAI 的文章引用了 ARC Prize Foundation 的 Greg Kamradt 的话,称 Astra 在 96% 的关卡上达到了人类动作效率基线。 没有任何开放权重开发者发布 ARC-AGI-3 得分。在 OSWorld 上,Moonshot AI 发布了 Kimi K3 得分 58.3,但使用的是与 OpenAI 不同的基准版本,因此两个数字无法直接比较。 OpenAI 还报告了 ScreenSpot-Pro(测试在屏幕上定位界面元素)得分 92.7,同样没有任何开放权重开发者发布该项分数。 适用场景:如果你付费让 Astra 代为操控软件,或处理它从未遇到过的情况,目前没有公开证据表明开放模型能胜任这项工作。当然,也没有公开证据表明它不能,因为缺席不等于得分为零。 稳妥的解读是:这是唯一一个花 $50 能买到开放模型尚未证明自己可以匹敌的能力的场景,在某个开发者发布同版本数字之前,这一结论仍然成立。 结论:继续使用 Astra,或者在迁移前先用自己的任务跑一遍测试。不要假设编程测试的结论可以直接套用到这里——这是完全不同的能力。 ## What switching means in practice 开放权重提供两条路径,值得诚实地想清楚你会走哪条。 路径一是下载权重。上述所有模型(除 Qwen3.8-27B 外)参数量均达数千亿,六个模型卡均未说明所需硬件配置,而是分别指向 vLLM 或 SGLang 的部署方案。 唯一能在单张 GPU 上运行的 Qwen3.8-27B,在 DeepSWE v1.1 上比 Astra 低 32 分,已超出本次比较的范围。 路线二是开发者自己的API。DeepSeek、Moonshot AI和Z.ai均以上述价格出售上面提到的模型。在输出方面,费用便宜3到40倍,但本质上同样是租用。你的提示词会发送到他们的服务器,并适用他们的服务条款。 许可证不会成为你做出选择的原因。这六个模型全部采用MIT或MIT风格的许可证,其中的条款仅适用于收入超过2000万美元的情况。 因此,对大多数读者来说,"掌控自己的技术栈"意味着什么。先使用API。当你的token用量足以支撑一台服务器时,再迁移到自己的硬件。并随时保留这样做的选项,因为模型权重是存在的,而Astra的则没有。 这个选项才是你真正拥有的东西,也是即便你从未下载过任何文件,这一比较依然值得进行的原因。 ## 决策建议 有范围的编程、研究、写作,以及任何有明确终点且可供核查的任务。切换过去。如果需要,可以保留一个Astra密钥用于抽查。 长时间的自主终端工作。继续留在Astra。26.7分的差距是真实存在的,目前还没有任何开放权重的开发者发布过能缩小这一差距的成绩。 计算机操作和不熟悉的环境。继续留在Astra,或先在你自己的任务上进行测试。目前也没有可信赖的开放权重数据可供参考。 Astra于9月3日发布。与其编程能力持平的开放模型于9月10日发布。本文中的差距每周都在变化,因此在采取行动之前,请务必核实每个评分的日期。 如果你觉得这篇文章有用,请订阅我的下方简报 我每周分享一个AI超能力 订阅,完全免费 https://linktr.ee/alex_prompter