通过技能文件、瘦框架、解析器、隐性与确定性分离、归纳五个概念构成的架构,解释为何部分工程师能用 AI 编程智能体实现百倍生产力提升。
AI translation, not an official translation. Refer to the original for technical details.
Adapted from @garrytan# 瘦框架,胖技能
Steve Yegge 说,使用 AI 编程智能体的人"比今天使用 Cursor 和聊天界面的工程师高效 10 到 100 倍,比 2005 年的 Google 员工高效约 1000 倍。"
这是个真实的数字。我亲眼见过,亲身经历过。但人们听到这个数字时,往往会找错原因——更好的模型、更聪明的 Claude、更多的参数。那些实现 2 倍和 100 倍提升的人用的是同一批模型。差距不在于智能,而在于架构——而且这套架构写在一张索引卡上就够了。
## 框架本身就是产品
2026 年 3 月 31 日,Anthropic 意外地将 Claude Code 的全部源代码发布到了 npm 注册表。512,000 行。我读完了。它印证了我在 YC 一直讲授的一切:秘密不在于模型,而在于包裹模型的那层东西。
实时代码库上下文。提示缓存。专用工具。上下文膨胀最小化。结构化会话记忆。并行子智能体。这些都不会让模型变得更聪明,但它们会在正确的时机将正确的上下文提供给模型,而不会把它淹没在噪音中。
这层包裹叫做框架(harness)。每个 AI 构建者都应该追问:什么放进框架,什么留在外面?答案有一个特定的形状,我称之为"瘦框架,胖技能"。
## 五个定义
瓶颈从来不是模型的智能。模型已经懂得如何推理、综合和编写代码。它们失败是因为不理解你的数据——你的 schema、你的约定、你问题的特殊形态。以下五个定义可以解决这个问题。
1. 技能文件
技能文件是一种可复用的 Markdown 文档,用来教模型如何做某件事。不是做什么——用户提供目标。技能文件提供过程。
这里有一个大多数人忽略的关键洞见:技能文件的工作方式就像方法调用。它接受参数。你用不同的参数调用它。同一套流程,根据传入的内容,会产生截然不同的能力。
考虑一个名为 `/investigate` 的技能。它有七个步骤:界定数据集范围、构建时间线、对每份文件进行归纳记录、综合分析、从正反两面论证、引用来源。它接受三个参数:TARGET(目标)、QUESTION(问题)和 DATASET(数据集)。将它指向一位安全科学家和 210 万封发现邮件,你得到的是一位医学研究分析师,判断一名举报人是否遭到了压制。将它指向一家空壳公司和 FEC 申报文件,你得到的是一位法证调查员,追踪协调一致的竞选捐款。
相同的技能。相同的七个步骤。相同的 Markdown 文件。技能描述的是判断过程,调用提供的是世界。
这不是提示工程,这是软件设计——以 Markdown 为编程语言,以人类判断为运行时。事实上,Markdown 是比刚性源代码更完美的能力封装方式,因为它用模型本身思考的语言来描述过程、判断和上下文。
2. 框架
框架是运行 LLM 的程序。它做四件事:在循环中运行模型、读写你的文件、管理上下文、执行安全策略。就这些。这就是"瘦"的含义。
反模式是胖框架配瘦技能。你肯定见过:40 多个工具定义吞噬了一半上下文窗口。上帝工具加上 2 到 5 秒的 MCP 往返延迟。将每个端点都封装成独立工具的 REST API 包装器。三倍的 token、三倍的延迟、三倍的故障率。
你真正需要的是快速而精准的专用工具。一个 Playwright CLI,每个浏览器操作耗时 100 毫秒,而不是需要 15 秒来完成截图-查找-点击-等待-读取的 Chrome MCP。那是 75 倍的速度差距。软件不必再那么珍视了。构建你恰好需要的,别无其他。
3. 解析器
解析器是上下文的路由表。当出现 X 类型的任务时,优先加载文档 Y。
技能告诉模型如何做,解析器告诉它加载什么以及何时加载。开发者修改了一个提示,准备上线。没有解析器,他直接发布了。有了解析器,模型会先读取 `docs/EVALS.md`——里面写着:运行评估套件,比较分数,如果准确率下降超过 2%,回滚并调查。这位开发者根本不知道评估套件的存在,是解析器在正确的时刻加载了正确的上下文。
Claude Code 内置了解析器。每个技能都有一个 description 字段,模型会自动将用户意图与技能描述进行匹配。你不需要记得 `/ship` 这个技能的存在。描述本身就是解析器。
坦白一件事:我的 CLAUDE.md 曾经有 20,000 行,涵盖了我遇到过的每一个怪癖、每一种模式、每一条经验。完全荒谬。模型的注意力开始退化,Claude Code 甚至直接告诉我要精简它。解决方案是大约 200 行——仅仅是指向其他文档的指针。解析器会在需要时加载正确的文档。两万行知识,按需可及,不污染上下文窗口。
4. 隐性与确定性
你系统中的每一个步骤都属于其中之一,混淆两者是智能体设计中最常见的错误。
隐性空间(Latent space)是智能居住的地方:模型在此读取、解释、决策。判断。综合。模式识别。
确定性(Deterministic)是信任居住的地方:相同输入,相同输出,每一次都是。SQL 查询。编译代码。算术运算。
LLM 能够为 8 个人安排晚宴座位,同时考虑性格和社交动态。让它为 800 人安排座位,它会产生幻觉,给出一份看起来合理但完全错误的座位表。这是个确定性问题——组合优化——却被强行塞入了隐性空间。最糟糕的系统把错误的工作放在了这条线的错误一侧。最好的系统对此毫不留情。
5. 归纳记录(Diarization)
归纳记录是让 AI 真正适用于知识工作的步骤。模型阅读关于某个主题的所有内容,然后撰写一份结构化档案——将数十乃至数百份文件中提炼出的判断浓缩成一页纸。
没有任何 SQL 查询能产生这个结果。没有任何 RAG 管线能产生这个结果。模型必须真正阅读,在脑海中同时保留矛盾信息,注意到什么在何时发生了变化,并综合出结构化的情报。这是数据库查询与分析师简报之间的差距。
## 架构
这五个概念组合成一个简单的三层架构。
胖技能位于顶层:编码了判断、过程和领域知识的 Markdown 流程。90% 的价值在这里。
瘦 CLI 框架位于中间:大约 200 行代码。JSON 输入,文本输出。默认只读。
你的应用程序位于底层:QueryDB、ReadDoc、Search、Timeline——确定性基础。
原则是有方向的。将智能向上推入技能。将执行向下推入确定性工具。保持框架精简。做到这一点,模型的每一次改进都会自动改善每一个技能,而确定性层则保持完美可靠。
## 会学习的系统
让我展示这五个定义协同工作的实际效果,不是在理论中——而是在我们正在 YC 构建的一个真实系统中。
大通中心。2026 年 7 月。创业学校,六千名创始人。每人都有一份结构化申请、问卷答案、一对一顾问聊天记录,以及公开信号:X 上的帖子、GitHub 提交、显示他们发布速度的 Claude Code 记录。
传统方式:15 人的项目团队阅读申请,凭直觉决策,更新电子表格。在 200 名创始人时有效,在 6,000 人时崩溃。没有人类能在工作记忆中保存那么多档案,并注意到 AI 智能体基础设施赛道最适合的三位候选人——一位在拉各斯的开发工具创始人、一位在新加坡的合规创始人、一位在布鲁克林的 CLI 工具创始人——在他们的一对一聊天中用不同的措辞描述了同一个痛点。
模型可以。方法如下。
**数据丰富。** 一个名为 `/enrich-founder` 的技能拉取所有来源,运行丰富化处理,进行归纳记录,并突出显示创始人所说与他们实际在构建的东西之间的差距。确定性层处理 SQL 查询、GitHub 统计、demo URL 的浏览器测试、社交信号抓取、CrustData 查询。Cron 任务每晚运行一次。六千份档案,始终保持最新。
归纳记录的输出能捕捉到任何关键词搜索都无法发现的东西:
```
创始人:Maria Santos
公司:Contrail (contrail.dev)
所说:「AI 智能体的 Datadog」
实际在构建:80% 的提交在计费模块。
她在构建一个伪装成可观测性工具的 FinOps 产品。
```
"所说"与"实际在构建"之间的差距——需要阅读 GitHub 提交历史、申请材料和顾问谈话记录,并同时将三者保存在脑海中。没有嵌入相似度搜索能发现这一点。没有关键词过滤器能发现这一点。模型必须阅读完整档案并作出判断。(这正是放入隐性空间的完美决策!)
**匹配。** 这里展示了"技能即方法调用"的优势。同一个匹配技能的三次调用,产生三种完全不同的策略:
`/match-breakout` 处理 1,200 名创始人,按行业亲和度聚类,每组 30 人。嵌入加确定性分配。`/match-lunch` 处理 600 人,跨行业进行偶然性匹配,每桌 8 人,无重复——LLM 构思主题,然后确定性算法分配座位。`/match-live` 处理此刻在场馆内的人,最近邻嵌入,200 毫秒,一对一配对,排除已经见过面的人。
模型能做出聚类算法永远无法做出的判断:"Santos 和 Oram 都是 AI 基础设施,但他们不是竞争对手——Santos 做成本归因,Oram 做编排。把他们放在同一组。"或者:"Kim 申请时填的是'开发工具',但他的一对一谈话记录显示他在构建 SOC2 合规自动化。将他移至 FinTech/RegTech。"
没有嵌入能捕捉到 Kim 的重新分类。模型必须阅读完整档案。
**学习循环。** 活动结束后,一个 `/improve` 技能读取 NPS 调查,对那些平淡的回应进行归纳记录——不是差评,而是"还好"的那些,系统差点成功但没有成功的地方——并提取规律。然后它提出新规则,并将其写回匹配技能文件:
```
当参与者说「AI 基础设施」
但创业公司代码 80% 以上是计费代码时:
→ 归类为 FinTech,而非 AI Infra。
当同一组的两名参与者
已经相互认识时:
→ 降低邻近度权重。
优先安排新的介绍。
```
这些规则被写回技能文件。下一次运行自动使用它们。技能文件在改写自身。
7 月活动:"还好"评分 12%。下次活动:4%。技能文件学到了"还好"究竟意味着什么,系统在没有任何人重写代码的情况下变得更好了。
同样的模式可以迁移到任何地方:检索、阅读、归纳、计数、综合。然后:调查、归纳、重写技能。
如果你想知道 2026 年最有价值的循环是什么,就是这些。我们可以将它们应用于知识工作中存在的每一个学科和每一个领域。
## 技能是永久升级
我最近在 Twitter 上发了一条我给 OpenClaw 的指令,引发的共鸣超出了我的预期:
> 你不被允许做一次性工作。如果我要求你做某件事,而这件事属于将来还会再次发生的类型,你必须:第一次手动处理 3 到 10 个项目。把输出展示给我。如果我批准,将其固化为技能文件。如果它应该自动运行,将它放到 cron 计划中。判断标准:如果我不得不向你要求同一件事两次,你就失败了。
一千个赞,两千五百个书签。人们以为这是一个提示工程技巧,其实不是。这正是我一直在描述的架构。你写下的每一个技能都是对你系统的永久升级。它永远不会退化。它永远不会遗忘。它在你睡觉时凌晨三点运行。当下一个模型发布时,每个技能都会立即变得更好——隐性步骤中的判断得到改善,而确定性步骤则保持完美可靠。
这就是实现 Yegge 所说的 100 倍的方式。不是更聪明的模型,而是胖技能、瘦框架,以及将一切都固化为技能的自律。
系统在复利增长。构建一次,永远运行。