Fireworks 基准测试显示,DeepSeek-V4.1-Flash 以 Astra 十五分之一的成本达到同等编程精度,得益于分离激活架构与改进的 KV 缓存效率。
AI translation, not an official translation. Refer to the original for technical details.
Adapted from @FireworksAI_HQ# Fireworks 上的 DeepSeek-V4.1-Flash:以十五分之一的成本达到 Astra 级别的 DeepSWE 表现 上周,Fireworks 发布了最新的 DeepSeek-V4.1-Flash。在经过一整套基准测试之后,结果表明它在质量、速度和成本等关键权衡维度上树立了全新的帕累托前沿。在 DeepSWE 上,它以每项任务 GPT-6 Astra 级别的编码精度,实现了仅需 Astra 十五分之一价格的性能。(https://fireworks.ai/models/deepseek-ai/deepseek-v4p1-flash) 开发者常常问我们如何选择合适的模型。现实是,一个模型只是地图上的一个点,而你的应用则是一个完整的系统。AI 能力参差不齐,意味着某个模型在一项任务上表现出色,在另一项任务上却可能力不从心。由于没有任何单一模型能在所有场景中胜出,工作负载设计的关键在于将合适的模型与合适的任务相匹配,无论你需要低延迟处理还是针对复杂推理的深度计算。 以下是 DeepSeek-V4.1-Flash 在不同工作负载下的实际表现,以及它可能在你的技术栈中所处的位置。 ## DeepSeek 在 DeepSWE 帕累托前沿上的表现 我们评估了 DeepSWE 基准测试,以了解各模型如何在精度与每任务成本之间取得平衡。 在质量方面,以下四个模型属于同一档次。在 DeepSWE 上,四个模型的 pass@1 分数相差不超过 0.7 分,而我们的逐次运行波动在 1.4 到 3.2 分之间,因此这组模型中没有哪一个在质量上明显领先。差异完全体现在成本上:Fireworks 上的 DeepSeek-V4.1-Flash 以每任务 $0.43 的价格提供相同的精度范围,比 Gemini 3.8 Flash 低 5.5 倍,比 GPT-6 Astra 低 15 倍,比 Claude Opus 5 低 28 倍。 全新的 DeepSeek-V4.1-Flash 模型从根本上改变了自主软件工程任务的单位经济性。在 GPT-6 Astra 和 Opus 5 等昂贵的闭源模型上运行高迭代的 Agent 工作流、多轮缺陷扫描或大规模测试生成,会迅速消耗工程预算。以每任务 $0.43 的价格,前沿级别的 SWE Agent 得以作为持续运行的后台基础设施成为可能。使用 DeepSeek V4.1 Flash,你现在可以用一次 Astra 调用的价格运行 15 次自主编码尝试。 ## 底层解析:全新的分离激活架构 DeepSeek-V4.1-Flash 是 DeepSeek 新架构家族中最小的模型,并带来了一些全新的架构增强。 它由 5520 亿参数的 MoE 构成,采用全新的编码器–解码器分离架构。在该架构中,模型不再为整个前向传播使用统一的激活预算,而是将其拆分为输入侧 80 亿活跃参数与输出侧 160 亿活跃参数。这带来了更高效的设计,从而实现更经济的 Token 消耗。 这种非对称设计与编码 Agent 的运作方式高度契合。典型的 Agent 轨迹具有极高的输入密集性。编码 Agent 往往需要反复读取文件、重读自身的草稿本、重读工具输出,而最终生成的补丁相对较小。在我们的 DeepSWE 运行中,该模型每项任务消耗了 3690 万个输入 Token,而输出 Token 仅为 21.1 万个,输入输出比高达 174:1。这一架构使开发者能够在输入侧节省一半的计算量,而输入侧通常占据更大比例的 Token 数量。 ## KV 缓存优化 DeepSeek 在 DeepSeek-V4.1-Flash 上对 KV 缓存利用率进行了改进,与上一代 DeepSeek V4 相比,HBM 占用仅为原来的四分之一,SSD 存储占用仅为原来的八分之一。 这项全新的 KV 缓存优化为你的编码 Agent 带来了更优的经济性。从 DeepSWE 运行结果来看,我们得到了如下经济数据: 大多数人认为,智能体经济学意味着你主要为模型生成的内容付费。然而在长时间运行的智能体循环中,大部分开销来自于对相同上下文的反复读取。这种源于重复任务的消费循环,使得 KV 缓存内存减少 4 倍对你的令牌开销产生了更大的影响。它直接针对智能体设计中最大的成本驱动因素,将达到 74% 级别的 DeepSWE 分数的成本降低了 15 倍。SSD 开销减少 8 倍与 HBM 优化形成互补,在长轨迹运行中将缓存命中率保持在接近 99% 的水平。 ## Terminal-Bench 2.1:仅落后 Astra 一分,成本低 12 倍 在另一项任务中,我们看到了类似的情况——DeepSeek-V4.1-Flash 正以极低的成本逼近前沿水平。 在 Terminal-Bench 2.1 上的结果质量相差仅一分,但经济效益却大相径庭。DeepSeek-V4.1-Flash 平均使用的输出令牌数约为 Astra 的 4 倍,这意味着它思考更久、输出更多。仅就输出定价而言,其成本优化程度达到 20 倍。综合考量所有因素——包括未缓存输入、缓存命中率和输出——DeepSeek-V4.1-Flash 在接近相同质量的情况下,每项任务的成本降低了 12 倍。 ## HLE 与预言路由器评估 我们运行了第三项基准测试任务——人类终极考试,即 HLE。这是一项多模态基准测试,用于衡量大型语言模型在研究生级别学术科目上的极限表现。在此次测试中,我们还使用预言路由器进行了一些基准测试,与我们对 Kimi K3 和 DeepSeek V4 Pro 所做的类似。简要回顾:预言路由是一种通过对每个模型运行任务、再选取成本优化的正确选项来衡量最佳理论性能的方法,从而确立成本与性能的上限。(https://fireworks.ai/blog/kimik3-fable) (https://fireworks.ai/blog/DeepSeekV4Pro-Fable5) 在 HLE 上,单独运行时 DeepSeek-V4.1-Flash 落后于 Astra。这表明 DeepSeek 单独使用更适合智能体编程任务(如 DeepSWE),而非推理任务(如 HLE)。如果你的工作负载仅涉及难度较高的科学推理,这可能不是最佳选择。 预言路由器在此展示了有趣的结果,体现了路由机制与多模型系统的重要性。Astra 与 DeepSeek V4.1 组合的预言路由器表现优于 GPT-6 单独使用的 Astra。这 4.4% 的差距只有在 V4.1-Flash 正确回答了 Astra 答错的一批有意义的问题时才能实现。34.52% 并非 50.40% 的子集;两个模型在不同问题上出现失误。值得考虑的是,预言路由器代表了你应用程序所能达到的上限。真实的路由器可能无法完全捕获这 4.4 个百分点的差距,但预言路由器展示了一个模型系统超越单独 Astra 模型的可能性。 ## 开始使用 DeepSeek-V4.1-Flash Fireworks 的 DeepSeek-V4.1-Flash 树立了新的性价比基准,在编程准确性上媲美 GPT-6 Astra 等顶级模型,每项任务成本仅为其 1/15。其 552B MoE 设计采用分离式输入/输出激活预算,并配合升级后的 KV 缓存以降低 HBM 使用量,从而为编程智能体带来更优的经济效益。在复杂学术推理方面它有所落后(HLE 得分 34.52%,而 Astra 为 50.40%),但由于它与 Astra 在不同问题上各有所长,将两者组合在路由系统中的表现优于单独使用 Astra,且成本仅为其一小部分。 以下是您今天就可以开始构建的方式: - 无服务器和专用 API:直接在 Fireworks 无服务器平台上使用 DeepSeek-V4.1-Flash 快速上手,或为您的生产工作负载使用专用容量。• 敬请期待,面向受监管行业的美国托管端点即将推出(https://fireworks.ai/models/deepseek-ai/deepseek-v4p1-flash) - 如果您有兴趣,请联系我们的团队以获取即将推出的训练支持。(https://fireworks.ai/contact-training) 正在您的工作负载上试用?我们非常期待听取您的使用体验,欢迎在下方标记我们,并告诉我们您正在构建什么!