逐步介绍如何利用 DeepSeek V4.1 Flash 构建低成本 AI 智能体团队,专门处理重复上下文的执行任务。
AI translation, not an official translation. Refer to the original for technical details.
Adapted from @FareaNFts# 如何用 DeepSeek V4.1 Flash 运行全天候 AI 团队(完整分步指南) 你的支持工作者在每张工单中都会阅读同一份产品手册。 你的编码工作者在每次小修复前都会重新加载同一套代码库规则。 你的报告工作者读取同一个数据模式,然后撰写同一份每周更新。 大部分工作都是重复的上下文。 如果每次调用都使用你最贵的模型,重复的上下文很快就会让成本飙升。 DeepSeek V4.1 Flash 改变了这个循环的成本。 它拥有一个 552B 的语言骨干,但在读取时只激活约 8B 参数,在写入时激活约 16B 参数。 它支持一百万 token 的上下文、图像、工具、JSON 输出以及 MIT 授权的权重。 系统很简单: 你或一个更强的模型负责规划。DeepSeek Flash 负责执行。每个有风险的操作都等待审核。 以下是具体配置方式 ## 改变配置的那个数字 智能体工作之所以昂贵,是因为模型需要不断读取。 它读取你的指令。 它读取工具定义。 它读取代码库文件、支持历史、产品规则以及之前的消息。 然后在下一个任务中重复同样的过程。 DeepSeek 专门围绕这种以输入为主的模式设计了 V4.1 Flash。 该模型的报告数据如下: - 提示词处理阶段约激活 8B 参数 - 生成阶段约激活 16B 参数 - 每个 token 的全局 KV 缓存约为 890 字节 - 所用 HBM 是上一代 V4 Flash 设计的四分之一 - 持久化 SSD 缓存存储是上一代的八分之一 这条更精简的激活路径正是 Flash 适合作为工作者的原因。 你可以将昂贵的规划器留给少数需要判断力的调用,然后将重复的实现调用交给 Flash。 ## 基准测试视角 DeepSeek 在其最高推理设置下报告了以下结果: 这些是 DeepSeek 自己的评估结果。 用它们来判断该模型是否值得测试。你自己的工作流才能决定它是否上线。 当 DeepSeek 更换智能体脚手架时,相同的权重在 DeepSWE 上的得分从 65.5% 变化到 74.2%。Terminal-Bench 2.1 从 84.1% 提升到 90.6%。 模型本身没有改变。 变化的是工具、提示词、重试策略和审核循环。 下面的配置将在一个包含任务、工具策略和审核循环的环境中测试 Flash。 ## 你要安装的内容 DeepSeek 于 2026 年 9 月 10 日发布了 V4.1 Flash。 请使用以下确切名称: 旧教程可能使用 deepseek-v4-flash。当前原始 API 模型 ID 为 deepseek-flash。 ## 开放权重的说明 DeepSeek 发布了权重、参考推理代码、提示编码器、评估材料以及 MIT 许可证。 该许可证允许商业使用、修改和再分发,前提是保留许可证声明。 训练语料库未公开,因此"开放权重"比"完全开源"的表述更为准确。 552B 这个数字也需要放在背景下理解。 它描述的是语言骨干。DeepSeek 还单独列出了 196B 的 Engram 记忆参数、DSpark 草稿权重以及量化数据。 ## 低成本 AI 团队 你需要四个部分。 管理者不需要讨论每一个步骤。 它创建一张包含六个字段的工单: Flash 完成这张工单。 审核者检查结果。 调度器将下一个已批准的任务移入收件箱。 ## 路由规则 Flash 处理以下类型的工作: - 频繁重复的 - 易于描述的 - 易于验证的 - 在未采取最终行动前可以安全起草的 人工或更强的模型处理以下情况: - 目标不明确 - 架构决策 - 安全敏感代码 - 付款与退款 - 法律解释 - 发布与账户变更 您的工作者可以起草退款回复。 但它无法执行退款操作。 您的编程工作者可以编写补丁并运行测试。 但它无法合并或部署补丁。 您的文档工作者可以提取付款条款。 但它无法批准付款。 这条边界就是整个系统的核心所在。 ## 第0步:雇用一个工作者,而非六个 选择一个已经存在的队列。 适合入门的工作: - 为新支持工单打标签 - 从发票中提取字段 - 为一项已批准的代码变更编写测试 - 将已批准的笔记整理成每周报告 - 比较供应商报价 - 对照上线清单核查产品页面 从五个您已知正确答案的历史示例开始。 编写工作者章程: 以职责命名工作者。 support_triage 能告诉您它负责什么。 super_agent 则什么都说明不了。 ## 第1步:创建官方 DeepSeek API 密钥 前往: https://platform.deepseek.com 然后: 1. 登录。 1. 打开 API 密钥页面。 1. 为本项目创建一个密钥。 1. 复制一次。 1. 将其存储在密码管理器或密钥管理器中。 切勿将密钥粘贴到公开的代码仓库、截图、文章或共享配置文件中。 以下代码从环境变量中读取密钥。 ## 第2步:创建项目 打开终端: 创建环境文件: 在其中写入以下内容: 将其排除在 Git 之外: 加载密钥: ## 第3步:测试连接 创建 health_check.py: 运行它: 终端应打印: 如果失败,请检查: DeepSeek 还为 Codex、Claude Code、OpenCode、Hermes 及其他编程代理发布了配置说明页面。 ## 第4步:添加就绪工作者 文章包中包含: 将 starter/ 中的文件复制到您的项目中。 安装依赖项: 先运行免费的空跑检查: 它将检查: - 任务文件是否为有效的 JSON - 工作者是否存在于 charters.json 中 - 章程是否包含输出规则 - 脚本是否知道将结果放置在何处 - 是否不会执行任何外部操作 所附的入门示例返回了: 现在运行一个 API 任务: 结果将保存在此处: 没有任何内容被发送、合并、退款、删除或发布。 文件在此等待您的处理。 ## 调用如何串联 您将一项任务放入 inbox/。 → 脚本加载工作者章程。 → Flash 返回结构化 JSON。 → 一个独立的审核调用检查证据和限制条件。 → 如果审核者发现问题,Flash 获得一次修订机会。 → 最终结果进入 review/。 → 由人工批准实际操作。 审核者不信任工作者的置信度评分。 它检查任务、必填字段、证据以及 never_do 规则。 对于低成本的内部草稿,Flash 可以审核 Flash。 对于涉及资金、安全、法律事务、生产代码或公开内容的工作,请使用人工审核或更强的审核者。 ## 第5步:在 charters.json 中编写工作说明 每个工作者需要四个字段: 使用 owns 来保持职责范围的精准。 使用 good_output 来定义输出格式。 使用 never_do 来阻止特定操作。 使用 review_rules 来决定哪些内容需要上报给您。 在这四个字段明确之前,请勿接入任何工具。 ## 第6步:输入一个真实任务 从历史工作开始。 支持工单 由于涉及账单和退款,此任务应上报至人工审核。 上报意味着工作流运行正常。工作者完成了分类和起草工作。 您保留了资金操作的控制权。 编程任务 提供: 要求输出以下结果: 永远不要让同一个工作者独自完成补丁的编写、审查、合并和部署。 文档任务 给它一份文档和一个模式。 要求每一个金额、日期和义务都附有来源引用。 如果证据缺失,该字段保持为 null,任务转入审查。 ## 第 7 步:为收件箱设置定时任务 API 不会自动唤醒自身。 你需要一台始终在线的计算机或 VPS。 手动测试收件箱脚本: 它会: 1. 从 inbox/ 读取每个 JSON 任务 1. 运行工作者和审查者 1. 将模型结果写入 review/ 1. 将已处理的输入归档至 done/processed-inputs/ 1. 将错误移至 failed/ 确认运行正常后,打开 cron 编辑器: 每 15 分钟运行一次队列: 将两个路径替换为实际的项目路径。 在等待 cron 生效之前,再手动运行一次。 一个有问题的任务在 15 分钟的调度周期下,每小时会产生四次失败运行。 ## 第 8 步:分两个阶段添加工具 第一周:读取与起草 允许工作者: - 读取导出的支持文件 - 读取本地文件夹 - 读取代码仓库的副本 - 仅向 review/ 写入内容 第二周:在暂存环境中创建草稿 允许它: - 创建草稿 issue - 创建草稿邮件 - 发起 pull request - 向暂存表格中添加一行 将以下内容保留在审批之后: 一个权限范围窄的读取工具很容易测试。 一个拥有十项宽泛凭据的工作者则难以约束。 ## 第 9 步:添加更强的规划者 仅在任务需要规划或判断时,才使用更强的模型。 规划者负责处理: - 不明确的需求 - 项目拆解 - 架构选择 - 高风险代码审查 - 证据缺失时的决策 Flash 负责处理: - 代码仓库搜索 - 信息提取 - 分类 - 编写测试 - 格式化 - 重复性代码修改 - 已批准的工具调用 规划者创建小型工单。 Flash 返回工作成果和证据。 审查者处理失败情况和高风险案例。 这就是 80/20 的分工模式: ## 导致工作者成本高昂的三个因素 1. 上下文膨胀 系统提示中的每个文件,在每次全新调用时都会被计费。 请按以下顺序保持稳定前缀: 1. 系统规则 1. 工作者章程 1. 工具定义 1. 输出模式 1. 稳定参考资料 将动态变化的值放在后面: - 时间戳 - 工单内容 - 新文件 - 当前客户问题 - 特定任务的指令 不要将随机时间戳或会话 ID 放在靠近顶部的位置。 开头一处微小的变化,可能会使剩余的提示内容全部变成全新输入。 2. 空检查与无节制的重试 当没有任务时,收件箱检查不需要进行长时间的推理运行。 让调度器在不调用模型的情况下检查文件夹。 只有在真正的任务出现后,才调用 Flash。 设置限制: 该入门配置允许一次模型修订。 3. 让工作者为自己打分 无论工作者有多大把握,审查者都需要来源证据。 为其提供: - 原始任务 - 预期字段 - 来源证据 - never_do 规则 - 工作者输出 对于高风险工作,使用不同的模型或引入人工审查。 ## 六个可直接复用的工作者 1. 支持工单分类 2. 测试编写者 3. 文档管理员 4. 供应商比较器 5. 内容二次创作者 6. 日常运营报告员 ## API 预算的构成情况 DeepSeek 目前公布的非高峰期每百万 token 价格如下: 高峰期价格为非高峰期的两倍。 以下示例假设 80% 的输入 token 命中缓存: 在高峰期价格下,相同示例的费用约为 $1.85、$18.48 和 $92.40。 在没有缓存输入的情况下,非高峰时段的示例费用上升至 $2.10、$21 和 $105。 以上代币成本示例使用的是既定假设,而非承诺的月度套餐。 您的实际账单取决于: - 推理工作量 - 重试次数 - 图像 - 工具循环 - 输出长度 - 缓存命中率 - 任何规划模型或审查模型的成本 追踪四项数据: 在员工每次修复答案都需花费二十分钟的情况下,不要以代币价格作为优化目标。 ## 适用场景 代码开发 可用于测试、依赖项更新、有边界的重构、文档编写、错误复现以及迁移脚本。 @Whydowecare007 的一份实地报告显示,该模型在导航和有边界的实现方面表现突出,但在置信度校准以及验证实验是否与真实执行路径相符方面较为薄弱。 客户支持 可用于分类、证据收集、建议回复和升级处理。 发送、退款、账户变更和安全相关案例应保留人工审批环节。 文档处理 可用于提取字段、比较条款、汇总政策以及生成带引用的报告。 每项金额、日期和义务均需提供证据支撑。 视觉操作 该 API 接受 JPEG、PNG、GIF 和 WebP 格式的输入。 可检查截图、仪表板、图表、发票和表单。 涉及资金、身份和合规字段时,需通过代码或人工进行验证。 批量操作 适用于单个任务量小而队列庞大的场景。 工单标签、CRM 清理、目录更新、每日日志和测试生成均符合这一模式。 ## 为企业带来的价值 降低执行调用成本 规划模型负责少数高成本决策。 Flash 负责处理重复性工作。 更大的上下文窗口 百万 Token 的上下文窗口可容纳大型手册、代码仓库和记录文件。 即便如此仍应使用检索技术。将所有文件输入每个任务会浪费 Token,并使证据核查更加困难。 文本、图像、工具与 JSON 统一处理 Flash 可读取截图、检查相邻文本、调用工具并返回结构化输出。 这意味着需要更少的独立模型调用,同时审查策略保持不变。 自托管选项 MIT 许可证允许商业部署和修改。 建议先使用官方 API。 仅当流量、数据存储位置或延迟能够证明集群成本合理时,才迁移至自有基础设施。 ## 三种运行方式 选项一:官方 API 对大多数团队而言,这是最佳的起步路径。 安装 OpenAI SDK,设置 DeepSeek 基础 URL,然后调用 deepseek-flash。 无需本地模型硬件。 选项二:生产环境自托管 检查点文件占用约 511GB 磁盘空间。 当前 vLLM 方案预算约 614GB 聚合显存,并列出 H200、GB200、GB300 和 MI350X 硬件配置。 vLLM 建议使用其专用镜像,而非普通的 pip 安装: 文档中的内存方案适配八卡 H200 节点或四卡 GB200 NVL4 配置。 使用 vLLM 当前的方案生成器适配您的硬件。在测量内存和并发流量时,先从较小的上下文限制开始。 选项三:16GB Mac 实验 FP4 Brain 通过 SSD 流式加载,在 16GB M1 Mac mini 上运行了原始 FP4/FP8 检查点。 该运行所需: 该运行环境仅支持文本,不支持视觉、工具调用、DSpark 或百万 Token 会话的验证。 它证明了稀疏专家流式加载可以在极小内存的机器上传输权重。 以每 Token 23 秒的速度,这更像是一个工程演示,而非实际业务工具。 ## 安全规则 → 使用官方 DeepSeek API 或贵公司自行管控的基础设施。 → 将 API 密钥、密码、客户记录和生产环境机密与第三方中继隔离。 → 优先为每位工作人员分配只读权限工具。 → 发送、合并、删除、退款、购买、发布及权限变更操作须经审批方可执行。 → 记录每一次模型调用、工具调用、修订及最终操作。 → 限制 token 用量、重试次数、运行时间及支出上限。 → 在代码或人工审核通过之前,将模型输出视为不可信内容。 → 在发送机密材料之前,请阅读服务提供商的最新数据政策。 ## 值得阅读的技术文章 1. DeepSeek 发布主题帖——架构介绍、发布详情、API 及多模态能力。 1. FP4 Brain 的 16GB Mac 实验——您分享的示例,附公开运行器与日志。 https://x.com/thefp4brain/status/2098424202168586367 1. vLLM 部署主题帖——服务支持、缓存卸载、并行化及 DSpark。 https://x.com/vllm_project/status/2097940813242405272 1. Artificial Analysis 评估——对模型性能、任务成本及长上下文的独立评测。 https://x.com/ArtificialAnlys/status/2098148674203488422 1. Thomas Wolf 的架构解析——对前向传播过程的简短可视化说明。 https://x.com/Thom_Wolf/status/2097982062808428751 1. Zain Hasan 关于 Agent 脚手架的分析——为何相同权重在不同编程 Agent 中得分存在差异。 https://x.com/zainhas/status/2097941157905142210 1. BridgeMind 的任务测试——为何 token 速度与任务完成速度是两回事。 https://x.com/bridgemindai/status/2097726992565035341 1. TeksEdge 关于内存层次结构的解析——活跃计算、Engram 与本地推理。 https://x.com/TeksEdge/status/2098050190913712261 1. 一篇对真实代码库的质疑性评测——Flash 发挥作用之处,以及过度自信之处。 https://x.com/Whydowecare007/status/2098221069719200185 1. Ziwen 的路由工作流——以 Flash 作为编排器,并将特定任务转发至其他模型处理。 https://x.com/ziwenxu_/status/2099274394476347592 ## 完整配置清单 □ 选定一个重复性的业务队列 □ 收集五个具有已知答案的历史示例 □ 编写 owns、good_output、never_do 及 review_rules □ 创建官方 DeepSeek API 密钥 □ 将密钥存储在代码之外 □ 使用 deepseek-flash 运行 health_check.py □ 将入门包复制到项目中 □ 执行干运行检查 □ 处理一个历史示例 □ 将结果与已审批答案进行对比 □ 所有对外操作须经审核方可执行 □ 仅在手动运行通过后,再添加 15 分钟定时任务 □ 追踪每个已审批任务的成本、审核率、错误率及周转时间 ## 参考资源 DeepSeek API: https://platform.deepseek.com(https://platform.deepseek.com/) 官方 API 模型: deepseek-flash 模型权重: https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash vLLM 部署方案: https://raw.githubusercontent.com/vllm-project/recipes/main/models/deepseek-ai/DeepSeek-V4.1-Flash.yaml 16GB Mac 实验: https://github.com/atbender/deepseek-v41-flash-mac-mini 入门工作器: starter/agent_team.py 一个官方 API 密钥、一份工作人员章程、一个审核队列,加上一个调度计划。 在上述活跃团队示例中,当 80% 的输入命中缓存时,1 亿个输入 token 与 1000 万个输出 token 在非高峰期的总费用约为 9.24 美元。 从一个队列和五个历史示例开始。 当 Flash 处理简单案例、将高风险案例转交审核后,将第六个任务放入线上收件箱。 保存本指南,并关注 @fareanfts 获取更多文章 🙌 章程、配置命令和审核规则,正是您构建系统时所需的核心组件。