本文依据OpenAI与Anthropic官方工程标准,梳理出生产级AI工程师晋升高薪职位所需掌握的核心能力路线图。
AI translation, not an official translation. Refer to the original for technical details.
Adapted from @towards_AI# $25万美元AI工程职位究竟看重什么 AI工程岗位正在快速增长。LinkedIn数据显示,自2023年以来,美国AI职位发布数量大约翻了一番,典型职位的薪资标注约为177,000美元。在高端区间,OpenAI列出的应用AI工程师(Applied AI Engineer)岗位薪资为251,000至278,000美元加股权,前线部署工程师(Forward Deployed Engineer)岗位薪资为185,000至300,000美元加股权。 这些都是高级别、有地域限制的职位,但其任职要求揭示了高薪团队期望工程师具备哪些能力。 问题在于,大多数求职者从零散的教程中自学。他们构建一些玩具应用,凭感觉猜测什么内容才算真正有价值的作品集。与此同时,真正的学习体系其实早已公开摆在眼前——散布在Anthropic和OpenAI等公司的官方工程指南、职位描述和面试页面中。高薪团队不在乎你是否会调用API,他们想看的是你能否构建可靠、可观测、达到生产级标准的软件。 以下是一份六阶段路线图,已与上述公司的工程标准逐一对照核实。 1. 先打牢软件基础 OpenAI指出,其工程面试会考察候选人设计良好的解决方案、代码质量、性能表现以及测试覆盖率。Anthropic期望候选人对基本语法和标准库足够熟悉,能够在不依赖搜索引擎查阅基础知识的情况下编写、运行和调试代码。 需要学习: - Python 或 TypeScript - API 与数据验证 - 数据库与身份认证 - 自动化测试 - 错误处理 - 基础部署 需要构建: 创建一个小型应用,其核心流程在不依赖任何AI的情况下能够正常运行。它应能接收请求、验证数据、保存状态、返回结果,并提供清晰的错误信息。 需要保留的证据: 发布代码仓库,附上清晰的环境配置说明、API约定文档、自动化测试、一个已部署的接口端点,以及一段简短说明,阐述你所做的某项技术权衡决策。 可以进入下一阶段的标志: 其他人无需你的协助即可运行该应用,且每一种可预测的失败情况都会返回有意义的错误码。 官方指南: - https://openai.com/interview-guide/ - https://www.anthropic.com/careers 2. 掌控单次模型调用 提示词(Prompting)只是上下文工程的一部分。Anthropic将上下文定义为模型在推理时可获取的全部信息:指令、示例、工具、检索到的数据、消息历史,以及在有限注意力预算内相互竞争的其他token。 需要学习: - 任务规格定义 - 提示词设计 - 结构化输出 - 上下文组装 - 输入与输出验证 - 拒绝响应与升级处理 需要构建: 在你的应用中添加一个范围明确的AI功能。定义它处理的输入范围、有效输出的内容要求、哪些结果是被禁止的,以及模型在何种情况下必须拒绝响应或上报处理。 需要保留的证据: 保存任务规格说明、版本化的提示词、输出格式模式(schema)、具有代表性的测试用例,以及某次提示词或模型变更前后的对比结果。 可以进入下一阶段的标志: 该功能在常规输入和有意义的边缘用例下均能通过明确的验收标准。三个精心挑选的示例提示词不能作为达标依据。 官方指南: - https://www.anthropic.com/engineering/effective-context-engineering-for-ai-agents 3. 添加检索与知识库 许多生产环境中的应用需要访问内部数据或最新数据,而基础模型无法可靠地掌握这些信息。Anthropic的上下文检索(Contextual Retrieval)指南解释了文档上下文、嵌入(embeddings)、关键词搜索和重排序(reranking)如何影响最终传入模型的内容。 需要学习: - 文档解析与分块(chunking) - 元数据与权限管理 - 关键词检索与向量检索 - 重排序 - 数据时效性 - 来源归因 构建: 将应用程序连接到一个小型知识库。要求其引用所用的确切证据,并在必要证据缺失时安全响应。 **需留存的证据:** 创建一个检索测试集,包含已知问题、预期段落、检索结果及失败标签。将检索失败与生成失败分开追踪。 **推进条件:** 系统能可靠地检索到预期证据、执行数据权限管理,并在证据缺失时避免凭空猜测。 **官方指南:** - https://www.anthropic.com/engineering/contextual-retrieval --- 4. 添加工作流、工具,再引入智能体 Anthropic 将工作流(由代码定义执行路径)与智能体(由模型自主规划路径和工具)加以区分。从最简单的模式开始,仅在评估证明能带来可量化收益时,才逐步增加自主复杂性。 **学习内容:** - 工作流设计 - 工具模式与描述 - 权限边界 - 幂等性与重试机制 - 状态管理 - 人工审批步骤 - 停止条件 **构建:** 从固定工作流入手。为应用程序提供一个只读工具和一个需要确认的高影响写入工具。仅当评估表明模型自主选择工具的方案优于固定工作流时,再引入该能力。 **需留存的证据:** 提交工作流程图、工具契约测试、执行追踪记录、幂等性测试及审批边界设计。 **推进条件:** 无效工具调用能安全失败、重试不会产生重复副作用、权限管理稳固有效,且智能体版本在准确性、成本或其他明确指标上优于更简单的工作流方案。 **官方指南:** - https://www.anthropic.com/engineering/building-effective-agents - https://www.anthropic.com/engineering/writing-tools-for-agents --- 5. 对完整系统进行评估 Anthropic 围绕任务、试验、评分器和记录副本来构建智能体评估框架。任务定义输入与成功标准,试验是一次执行尝试,评分器对其进行评价,记录副本则记录整个过程。 **学习内容:** - 具有代表性的测试用例 - 针对可变行为的重复试验 - 基于代码、基于模型及人工评分方式 - 失败分类体系 - 回归测试 - 生产环境追踪 **构建:** 创建一个覆盖标准场景、边缘场景及高风险场景的评估套件。记录版本、来源、工具调用、状态变更、延迟、成本及验证结果,同时避免存储敏感数据。 **需留存的证据:** 将评估报告附于发布决策中。记录至少一个其他工程师能够根据追踪记录轻松复现的失败案例。 **推进条件:** 其他工程师能够定位责任层、复现失败、应用修复方案,并验证该修改未破坏其他关键用例。 **官方指南:** - https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents --- 6. 部署与运营系统 OpenAI 的角色定义强调上线准备、规模扩展、可靠性、延迟、成本、安全性、治理及运营所有权。Anthropic 的遏制指南则通过失败概率与影响范围来框定生产风险:更好的模型并不能消除限制失败操作所能造成损害的必要性。 **学习内容:** - 模型与提示词版本管理 - 超时与速率限制 - 成本与延迟预算 - 安全边界 - 降级回退方案 - 分阶段发布 - 监控与告警 - 回滚触发条件 - 事故所有权 **构建:** 通过分阶段发布、有限权限及已记录的回退方案,将应用程序发布给小型测试群体。 **需留存的证据:** 展示发布检查清单、每项已完成任务的成本、延迟分布情况、监控配置、回滚触发条件,以及故障演练的记录与反思。 **推进条件:** 您可以检测降级情况、识别受影响的版本、限制影响范围,并快速恢复到已知的良好状态。 官方指南: - https://www.anthropic.com/engineering/how-we-contain-claude 将项目转化为应用程序 Anthropic 表示,他们关注的是候选人实际能做什么,而不是在哪里学到的。其招聘页面建议在简历顶部突出展示独立研究、有深度的技术写作或开源工作。 给你最出色的项目留出足够的简历空间,以展示: - 生产环境中的问题 - 你主导的架构决策 - 你发现的真实故障 - 修复方案背后的依据 - 可量化的运营成果 Anthropic 建议候选人先自己起草简历,再借助 AI 工具将真实经历与职位要求进行对比并优化呈现。可以用 AI 进行练习和研究,但除非明确允许,否则绝不能在现场测评或面试中使用。OpenAI 同样建议候选人做好准备,能够清晰阐述自己的方法、权衡取舍、测试选择和推理过程。 官方招聘指南: - https://www.anthropic.com/careers - https://www.anthropic.com/candidate-ai-guidance - https://openai.com/interview-guide/ 从今天开始 拿出你现有的最强 AI 项目,找出最早无法提供证明的阶段: - 如果其他人无法运行它:修复第一阶段。 - 如果模型行为没有测试用例:修复第二阶段。 - 如果检索质量未知:修复第三阶段。 - 如果工具可能触发不受控制的副作用:修复第四阶段。 - 如果故障无法复现:修复第五阶段。 - 如果系统无法安全回滚:修复第六阶段。 在跳入下一个教程之前,先补上缺失的那一环。 这份路线图无法保证你一夜之间拿到 25 万美元的 offer。顶级职位需要多年的判断力积累和交付经验。但它能给你的,是你在设计、测试、阐述和运行方面真实能力的有力证明。 如果你希望深入了解如何构建这些生产级系统,我们将在即将出版的新书《AI Engineering For Production》中详细拆解这些阶段背后的完整架构。点击查看: https://www.louisbouchard.ai/book/?utm_source=x-tai&utm_medium=social&utm_campaign=book