通过codex-router将规划任务路由至Astra、执行任务路由至DeepSeek V4.1-Flash,搭建低成本多智能体AI系统的完整指南。
AI translation, not an official translation. Refer to the original for technical details.
Adapted from @sairahul1# 如何用每月50美元运行一家全天候AI公司(GPT-6 Astra + DeepSeek V4.1 Flash - 完整配置指南) 我曾经一个晚上就烧掉100美元。 9个AI智能体。同时运行。彼此互相通信。 为机器人的闲聊支付前沿模型的价格。 然后DeepSeek V4.1-Flash发布了。 GPT-6 Astra得分的98%。成本仅为1.4%。 于是我重建了整个系统。 20美元的ChatGPT Plus。30美元的DeepSeek API额度(如有需要,可加上10美元的Opencode Go)。 一套简洁的系统,全天候运行。 以下是具体做法。 ## 改变一切的基准测试 OpenDesign Arena用真实日常任务测试了11个模型。 结果:11个模型的得分都低于Flash,而且成本更高。 只有Astra得分更高。 但Astra每次任务的费用是Flash的70倍。 问题不再是"哪个模型最好"。 而变成了"每项工作我究竟需要哪个模型"。 ## 每月50美元的技术栈 我还建议将OpenCode Go用于DeepSeek,因为它似乎只需10美元就能提供60美元的用量(https://opencode.ai/go) 规则:Astra负责思考,DeepSeek Flash负责执行。 Astra是CEO。它读取目标,将其拆分为子任务/工单,然后委派出去。 Flash是团队。它以1/70的成本完成实际工作。 你的工作:向Astra解释一次目标,其余的它来运行。 ## 第一步 — 安装codex-router https://github.com/duolahypercho/codex-router 一条命令即可完成所有安装并打开仪表盘: 安装完成后仪表盘会自动打开。 在仪表盘中: → 粘贴你的DeepSeek API密钥(在platform.deepseek.com获取,或从Opencode获取) → 启用DeepSeek提供商 → 将deepseek/deepseek-v4-flash选为可用的子智能体模型 → 保持Astra作为Codex的根模型——不要将Flash设为新任务的默认模型 → 如果路由未自动启用,请从路由器目录运行./bin/model-router codex enable → 完成——Flash现在可作为你的专属执行子智能体使用 ## 第二步 — 在Codex中解锁Astra神模式 将以下内容添加到~/.codex/config.toml(或直接让Codex来做): 然后保持~/.codex/AGENTS.md简洁,专注于项目规范。 两个模型的实际连接方式: 你在Codex中输入目标。这是你唯一下达命令的地方。 → Codex将Astra作为大脑运行——读取你的目标,制定计划 → Astra显式生成一个有边界的子任务,指定使用deepseek/deepseek-v4-flash → codex-router将该子智能体调用路由至DeepSeek Flash → Flash执行,结果返回给Astra → Astra审核后将最终答案返回给你 重要提示:如果Astra没有显式地用DeepSeek模型生成子任务,工作就会留在Astra上执行。路由器不会自动对任务分类。这正是第三步中系统提示词至关重要的原因。 配置项说明: → reasoning_effort = "low" — Astra的基准测试是在最高设置下运行的。日常任务很少需要如此。从低档开始,根据具体任务按需提升。 → experimental_mode = true — 可在上下文窗口之间保留笔记,自动检索之前相关的消息,减少无效token消耗,在长时间重构和调试过程中保持Astra的连贯性。 启用后重启Codex并开启新任务。 依赖分流前请先验证: → 根模型选择器显示 gpt-6-astra → 路由器状态报告为integrated/routed模式,而非native-only → 一个小型委派测试任务在路由器活动中显示deepseek/deepseek-v4-flash ## 第三步 — 设置你的默认Astra提示词 这是让 Astra 作为编排器运行并显式委托给 Flash 的系统提示词。 将其粘贴到 Codex 设置中的 System Prompt 选项下(直接问 Codex 即可): ## 第四步——80/20 路由规则 当显式委托时,Flash 以 1/70 的成本处理 95% 的日常任务: 让你的智能体变得昂贵的 3 件事 大多数人在第一周内就会踩到这些坑。 1. 上下文膨胀 每个全局注入的文件都会在每次调用时消耗 token。 → 保持 AGENTS.md 在 800 token 以内 → 保持 SOUL.md 在 500 token 以内 → 保持 MEMORY.md 在 2,000 token 以内 → 将项目详情移至按需加载的项目级文件中 2. 在前沿模型上运行心跳和定时任务 心跳的作用只是检查是否有任务需要处理。 每天在 Astra 上运行 48 次检查 = 昂贵的机器人失眠症。 → 将每个心跳和定时任务配置为显式使用路由后的 Flash 模型 → 效果相同,成本降低 70 倍。 3. 破坏提示词缓存 DeepSeek 会自动缓存你的系统提示词前缀。 一次缓存命中 = 新鲜调用价格的 1/50。 有一件事每次都会破坏它:前缀中的动态值。 → 系统提示词中不要加时间戳 → 前缀中不要加 session ID → 保持每次调用结构一致 当配置稳定时,Codex 会自动处理缓存。这就是为什么保持 AGENTS.md 简洁、以及在会话之间不改变配置如此重要。 ## DeepSeek V4.1-Flash——真正改变了什么 这不只是一个更便宜的模型,它的架构是不同的。 KV 缓存的减少正是它专门适用于智能体的原因。 缓存命中费用在智能体成本中占很大比例。 Flash 更小的缓存意味着即使持续运行,这些费用也会大幅降低。 ## 注意 Astra 的价格悬崖(API 用户) 如果你曾经通过 API 直接调用 Astra,而非通过 ChatGPT Plus: 解决方法:使用 ChatGPT Plus(每月 $20)通过 Codex 访问 Astra。 无需按 token 计费,没有价格悬崖,固定月费。 整月预算固定。 而使用 Opencode Go,费用还会更便宜。 配置清单 □ 安装 codex-router(一条 curl 命令) □ 在控制台添加 DeepSeek API 密钥 □ 将 deepseek/deepseek-v4-flash 启用为显式子智能体模型 □ 保持 Astra 为根模型——而非 Flash □ 添加 Astra godmode 的 config.toml 配置 □ 保持 AGENTS.md 简洁且聚焦 □ 在 Codex 设置中粘贴系统提示词 □ 将心跳和定时任务配置为显式使用 Flash □ 保持系统提示词结构一致(不加时间戳) □ 重启 Codex,验证路由器活动显示 Flash 正在处理委托任务 就这些。 ChatGPT Plus $20,DeepSeek API $30,一条路由规则。 $50/月,全天候 AI 公司。 停止为所有事情支付前沿模型的价格。 开始智能路由。 资源链接: DeepSeek API: platform.deepseek.com Opencode Go: opencode.ai/go codex-router: github.com/duolahypercho/codex-router ChatGPT Plus: chat.openai.com 如果这对你有帮助: → 转发给每一位为 AI 付出过多的开发者 → 关注 @sairahul1 获取更多此类系统 → 收藏这篇文章——配置和默认提示词是你现在最需要的两样东西 我写关于 AI、产品构建以及让系统在你睡觉时自动运转的内容。