Y Combinator CEO Garry Tan 描述了一个多智能体系统,能将一本22章的书籍摘要与个人生活背景逐一对应,在40分钟内生成3万字的个性化分析报告。
AI translation, not an official translation. Refer to the original for technical details.
Adapted from @garrytan# 元元提示:让AI智能体真正奏效的秘密 人们一直在问我,为什么我要熬夜编程到凌晨两点。我有一份工作,而且责任重大——作为Y Combinator的CEO,我们每年帮助数以千计的创业者实现他们的梦想,帮他们打造真实的创业公司,获得真实的营收,并快速成长。 过去五个月里,AI让我重新成为了一名创造者。去年年底,工具已经足够好用,我重新开始动手构建东西。不是玩具项目,而是真正能持续积累价值的系统。我想用具体的例子告诉你,当你不再把AI当成一个聊天窗口,而是把它当成一个操作系统来使用时,个人AI究竟是什么样子。我将它以开源的方式发布,并写成这样的文章,因为我希望你能和我一起提速。 这是系列文章的一部分:"胖技能、胖代码、瘦框架"介绍了核心架构;"解析器"涵盖了智能路由表;"代码行争议"讲述了每一位技术人如何将自己的能力放大了100倍乃至1000倍;"裸模型更愚蠢"阐述了模型是引擎而非整辆车的道理;而"技能化宣言"则解释了为什么LangChain融资1.6亿美元,却只给了你一套深蹲架和哑铃,而没有附上训练计划——以及那份你真正需要的训练计划。(https://x.com/garrytan/status/2042925773300908103) (https://x.com/garrytan/status/2044479509874020852) (https://x.com/garrytan/status/2045404377226285538) (https://x.com/garrytan/status/2045798603059548364) (https://x.com/garrytan/status/2046876981711769720) ## 那本反过来读懂了我的书 上个月,我在读佩玛·丘卓(Pema Chödrön)的《当一切崩塌》(When Things Fall Apart)。这本书共162页、22章,以佛教视角探讨苦难、无根基感与放手。一位朋友在我经历一段艰难时期时向我推荐了它。 我让我的AI做了一次"书籍镜像"。 具体来说,这个系统提取了全书22章的内容,然后针对每一章运行一个子智能体,同步完成两件事:总结作者的思想,并将每个观点映射到我真实的生活中。这不是那种泛泛而谈的"这对领导者有所启发"的废话,而是具体的映射。它了解我的家庭背景(移民父母,父亲来自香港和新加坡,母亲来自缅甸)。它了解我的职业背景(运营YC、构建开源工具、辅导数千位创始人)。它知道我最近在读什么、凌晨两点在思考什么、我和治疗师正在处理哪些议题。 输出结果是一份长达3万字的"脑页"。每一章都呈现为两列:一列是佩玛的观点,另一列是这些观点如何映射到我正在经历的现实。关于"无根基感"的那一章,与我前一周和某位创始人的具体谈话相呼应。关于恐惧的那一章,对应了我的治疗师所识别出的某些行为模式。关于放手的那一章,引用了一个深夜写作片段——那次我写到了今年发现的创作自由。 整个过程大约花了40分钟。即便是时薪300美元的治疗师,读完这本书并将其应用到我的生活中,也无法在40小时内完成——因为他们没有将我的职业背景、阅读历史、会议记录以及与创始人的关系全部载入并相互交叉参照的能力。 我已经用超过20本书做过这件事了:《放大》(林蒂安)、《伯特兰·罗素自传》、《设计你的人生》、《天才儿童的戏剧》、《有限与无限的游戏》、《来自大海的礼物》(林德伯格)、《悉达多》(黑塞)、《荒原狼》(黑塞)、《做科学与工程的艺术》(汉明)、《梦想机器》、《论禁止认识自己是谁》(艾伦·瓦茨)、《你管别人怎么看》(费曼)、《当一切崩塌》(佩玛·丘卓)、《万物简史》(肯·威尔伯),以及更多。每一本都因为大脑变得更丰富而变得更丰富。第二面镜子了解第一面。第二十面了解前面所有十九面。 ## 书籍镜像如何在迭代中不断进化 我做的第一面书籍镜像很糟糕。第一版有三处关于我家庭的事实性错误。它说我父母离婚了,但他们根本没有。说我在香港长大,但我其实出生在加拿大。都是些基础信息,如果我把它分享出去,很可能会破坏信任。 于是我增加了一个强制事实核查步骤。现在每面镜像在发布前都会对大脑中的已知事实进行跨模态评估。Opus 4.7 1M负责捕捉精确性错误。GPT-5.5 负责捕捉缺失的上下文。DeepSeek V4-Pro负责捕捉那些读起来过于泛化的内容。 后来我升级到了带有GBrain工具调用的深度检索。原始版本擅长综合,但在具体性上很弱。第三版会针对每个章节进行大脑搜索。右栏的每一条条目都引用了实际的大脑页面。当书中谈到如何处理艰难对话时,它不只是综合一般原则,而是从我与具体创始人的实际会议记录中提取内容——那些正在与联合创始人进行艰难对话的人。或者我某个周四和弟弟詹姆斯一起闲逛时产生的某个想法。或者我19岁时与大学室友之间的即时消息聊天记录。那种感觉令人惊叹。 这就是技能化(在GBrain中使用 /skillify)在实践中的含义。我拿来第一次手动尝试的过程,提取出可重复的模式,编写了一个包含触发条件和边缘情况的经过测试的技能文件,每一次修复都在所有未来的书籍镜像中叠加生效。 ## 构建技能的技能 这里开始变得递归,我认为这是最大的洞见所在。 运行我生活的系统并非作为一个整体而存在。它是由技能组装而成的。而那些技能本身,也是由一种技能创建的。 Skillify是一种创建新技能的元技能。当我遇到一个要重复执行的工作流程时,我说"技能化这个",它就会检查刚刚发生了什么,提取可重复的模式,编写一个包含触发条件和边缘情况的经过测试的技能文件,并将其注册到解析器中。书籍镜像流程是在我第一次手动完成后被技能化的。会议准备工作流是在我注意到自己每次通话前都在执行相同步骤后被技能化的。 技能可以组合。书籍镜像调用brain-ops进行存储,调用enrich获取上下文,调用cross-modal-eval进行质量评估,调用pdf-generation生成输出。每种技能专注于一件事。它们串联在一起创造出复杂的工作流程。当我改进一种技能时,所有使用它的工作流程都会自动变得更好。再也不会出现"忘记在提示中提到这个边缘情况"的情况了。技能会记住。 ## 那场自我准备的会议 德米斯·哈萨比斯来YC参加一个炉边谈话。塞巴斯蒂安·马拉比为他写的传记刚刚出版。 我让系统帮我做准备。 在不到两分钟的时间里,系统提取了:德米斯的完整大脑页面(数月来从文章、播客文字稿和我自己的笔记中持续积累而成);他公开表达的关于AGI时间线的观点("50%靠规模扩展,50%靠创新",认为AGI将在5至10年内到来);马拉比传记的重点内容;他明确表示的研究优先方向(持续学习、世界模型、长期记忆);与我公开谈论AI的内容的交叉引用;三份用于在对话中展示大脑多跳推理能力的演示脚本;以及一套基于我们世界观交汇与分歧之处而设计的对话切入点。 这不只是一次更好的谷歌搜索。这是一种准备工作——它调用了我积累的关于德米斯的背景信息、我自己的立场,以及这次对话的战略目标。系统准备的不仅是事实,还有角度。 ## 十万页大脑是什么样的 我维护着一个结构化知识库,大约有十万页内容。我认识的每一个人都有一个专属页面,包含时间线、状态部分(当前的真实情况)、未了事项,以及一个评分。每次会议都有文字记录、结构化摘要,以及我称之为"实体传播"的机制:每次会议结束后,系统会遍历所有被提及的人员和公司,并根据讨论内容更新他们的大脑页面。我读的每一本书都有逐章镜像。我接触的每一篇文章、每一个播客、每一段视频,都会被摄取、打标签并进行交叉引用。 架构很简单。每个页面顶部是"编译后的真相"(当前最佳理解),下方是只可追加的时间线(按时间顺序排列的事件),以及存放源材料的原始数据附件。可以把它想象成一部个人维基百科,每一个页面都由一个AI持续更新——它参加了那次会议,读了那封邮件,看了那场演讲,摄取了那份PDF。 下面是一个说明这种复利效应的例子。我在办公室答疑时见了一位创始人。系统随即创建或更新他们的个人页面和公司页面,与会议记录进行交叉引用,检查我们之前是否见过面(如有,则调出上次讨论的内容),调取他们的申请数据,提取他们的最新指标,并判断我的投资组合公司或人脉中是否有与他们的问题相关的资源。等我走进下一次与他们的会议时,系统已经准备好了完整的背景资料包。 这就是拥有一个文件柜与拥有一个神经系统之间的区别。文件柜储存事物。神经系统则将它们连接起来,标记发生了哪些变化,并将与当下相关的内容浮现出来。 ## 架构 它是如何运作的。我认为这是构建个人AI的正确方式,我已将整套系统开源,你可以自己搭建。 主框架很薄。OpenClaw是运行时环境。它接收我的消息,判断适用哪个技能,然后进行调度。几千行路由逻辑。它对书籍、会议或创始人一无所知,只负责路由。 技能层很厚。目前已有超过100个技能,每个都是一个独立的Markdown文件,包含针对某一具体任务的详细指令。你已经在上文看到了book-mirror和meeting-prep。以下是GBrain附带的更多技能示例:(https://github.com/garrytan/gbrain) - meeting-ingestion:每次会议结束后,它会提取会议记录,生成结构化摘要,然后遍历其中提及的每个人和每家公司,将讨论内容更新到对应的知识库页面。会议页面本身不是最终产品。真正的价值在于将信息反向传播到每个人员和公司页面。 - enrich:输入一个人的姓名,它会从五个不同来源提取信息,将所有内容合并成一个单一的知识库页面,涵盖职业轨迹、联系方式、会议历史和关系背景。每条信息均标注来源。 - media-ingest:处理视频、音频、PDF、截图和 GitHub 仓库。转录内容,提取实体,归档至知识库的正确位置。我经常用它处理 YouTube 视频、播客和语音备忘录。 - perplexity-research:基于知识库增强的网络研究。通过 Perplexity 搜索网络,但在综合信息之前,会先检索知识库中已有的内容,从而告诉你哪些是真正的新信息,哪些是你已经记录过的。 我还为自己的工作构建了数十个其他功能,可能会开源:email-triage(邮件分类)、investor-update-ingest(检测邮件中的投资组合更新并将指标提取到公司页面)、calendar-check(冲突检测和出行不可行性判断),以及一整套用于公民事务工作的新闻调研工具链。每项技能都编码了大量操作知识,若让一位人类新助手从头学习,可能需要数月时间。当有人问我如何"提示词"我的 AI 时,答案是:我不提示。技能本身就是提示词。 数据是厚重的。知识库仓库中有 10 万页结构化知识。我接触过的每个人、每家公司、每次会议、每本书、每篇文章、每个想法,全部相互链接,全部可搜索,每天都在增长。 代码是厚重的。为其提供数据的代码(转录脚本、OCR、社交媒体归档、日历同步、API 集成)同样重要,但数据才是复利价值的所在。我每天运行超过 100 个定时任务,持续监控各种信息源:社交媒体、Slack、电子邮件,以及任何我关注的内容——我的 OpenClaw/Hermes 智能体也同样在帮我留意。 模型是可替换的。我使用 Opus 4.7 1M 追求精准。GPT-5.5 用于召回和详尽提取。DeepSeek V4-Pro 用于创意工作和获取第三方视角。Groq 搭配 Llama 用于追求速度。技能模块决定针对不同任务调用哪个模型。底层框架对此并不关心。当有人问"哪个 AI 模型最好"时,答案是:这个问题问错了。模型只是引擎,其他一切才是这辆车。 ## 凌晨两点的构建者与复利系统 人们问我关于生产力的问题。我不这样想。我思考的是复利。 每次会议都让知识库更丰富。每本书都为下一本书的理解提供了更深的背景。每项新技能都让下一个工作流更快。每次更新人员页面都让下次会议准备更精准。今天的系统比两个月前强大了十倍,两个月后又将再强大十倍。 当我还在凌晨两点写代码的时候(确实如此,而且是常态,因为 AI 让我重新找回了构建的乐趣),我不只是在写软件。我在为一个每小时都在变得更好的系统添砖加瓦。100 个定时任务,全天候不间断运行。会议摄入自动执行。邮件分类每 10 分钟运行一次。知识图谱从每一次对话中自我丰富。系统实时处理每日记录,提取我当时错过的规律。 这不是一个写作工具。不是搜索引擎。不是聊天机器人。这是一个真正有效的第二大脑——不是比喻意义上的,而是一个实际运行的系统,拥有100,000页内容、100多项技能、15个定时任务,以及我过去一年中每一段职业关系、每一次会议、每一本书和每一个想法所积累的完整上下文。 我将整个技术栈开源了。GStack是编码技能框架(已获87,000+星标),我用它构建了这套系统,当智能体需要编写代码时,我仍将其作为OpenClaw/Hermes Agent内部的一项技能来使用。其中还内置了一个出色的可编程浏览器(同时支持有头和无头模式)。GBrain是知识基础设施。OpenClaw和Hermes Agent是运行框架,你可以二选一,但我通常两者都用。数据仓库托管在GitHub上。(https://github.com/garrytan/gstack) (https://github.com/garrytan/gbrain) (https://openclaw.ai/) (https://hermes-agent.nousresearch.com/) 核心论点很简单:未来属于那些构建复利AI系统的个人,而不是属于那些使用企业拥有的中心化AI工具的人。两者之间的差别,就如同写日记与拥有一套神经系统之间的差别。 ## 如何开始 如果你想构建这套系统: 1. 选择一个运行框架。OpenClaw、Hermes Agent,或者用Pi从头构建属于你自己的框架。保持精简。框架只是路由器。用Tailscale将其托管在家里的备用电脑上,或者在云端使用Render或Railway。(https://openclaw.ai/) (https://github.com/nicobailon/hermes-agent) (https://github.com/anthropics/anthropic-cookbook/tree/main/misc/prompt_caching) 1. 用GBrain启动一个大脑。我受Karpathy的LLM Wiki启发,在OpenClaw中实现了这一想法,并将其扩展成了GBrain。这是我基准测试过的最佳检索系统(在LongMemEval上召回率达97.6%,超越了MemPalace,且检索循环中不使用任何LLM),它提供39项可安装技能,涵盖本文所描述的全部内容。一条命令即可完成安装。一个git仓库,每个人、每次会议、每篇文章和每个想法都有对应的页面。(https://github.com/garrytan/gbrain) (https://gist.github.com/karpathy/442a6bf555914893e9891c11519de94f) (https://github.com/garrytan/gbrain-evals) 1. 做点有意思的事。不要一开始就规划你的技能架构。先从做一件具体的事开始。写一份报告。研究一个人。下载一个NBA赛季的数据,为你的体育博彩构建预测模型。分析你的投资组合。做任何你真正在乎的事情。用你的智能体来完成它,反复迭代直到满意,然后运行Skillify(即前面提到的元技能)将这个模式提炼为可复用的技能。再运行check_resolvable来验证新技能已接入解析器。这个循环将一次性工作转化为持续复利的基础设施。 1. 持续使用并审视输出结果。技能一开始会很平庸。这正是关键所在。使用它,阅读它产生的内容,当发现问题时,运行跨模态评估:将输出结果发送给多个模型,让它们在你关心的维度上相互打分。我正是通过这种方式发现了book-mirror中的事实性错误。修复方案被固化进了技能本身,此后每一次镜像输出都是干净的。六个月后,你将拥有任何聊天机器人都无法复制的东西——因为价值不在于模型本身,而在于你教会系统的那些关于你具体生活、工作和判断的内容。 我用这套系统构建的第一个东西很糟糕。第一百个,则是我愿意托付给它我的日历、收件箱、会议准备和阅读清单的东西。系统在学习,我也在学习。复利曲线是真实存在的。 厚技能。厚代码。薄框架。LLM本身只是一台引擎。你完全可以自己造一辆车。 我在这里描述的一切——所有的技能、书本镜像管道、跨模态评估框架、技能化循环、解析器架构,以及30多个可安装的技能包——都是开源且免费的,托管在GitHub上:github.com/garrytan/gbrain。去构建吧。(https://github.com/garrytan/gbrain)