一位开发者分享了关于 Astra 优缺点及使用策略的亲身经验,并与早期模型进行了对比。
AI translation, not an official translation. Refer to the original for technical details.
Adapted from @jpschroederAstra:好的、坏的,以及 Fable。 以下是我个人使用 Astra 的实用建议,以及我是如何大幅提升生产力的…… **好的方面:** (如需快速浏览,请跳至"一些建议"部分。) Astra 非常聪明,具备"大模型"级别的智能。我听过很多传言,但目前的主流猜测是其参数量约为 5–10T,活跃参数超过 1T。你能立刻感受到这种差异,因为它能以远超小模型的水平完成那些并非通过强化学习直接训练的任务。它能制定更优的计划,在寻找新颖解决方案方面也优于我迄今使用过的任何模型。 这种"原生"智能的提升在解决问题时体现得最为明显。就像一位经验丰富的工程师,它拥有出色的"路径寻找"能力。面对任何给定的问题,它都能以极高的效率找到解决路径。较弱的模型也能解决同类挑战,但往往依靠蛮力,不断尝试(大多数是糟糕的)想法直到某个方案奏效。Astra 往往让人感觉"很快"(尽管实际上并非如此),正是因为这种智能。 在某些领域,与 5.6 相比,这一跨越是巨大的。3D 建模和 CAD 在很大程度上已是一个被解决的问题。这意味着全新一类工程师(机械/电气)将开始体验我们在软件工程领域已经感受到的那种喜悦与压力。现在你直接就能把东西打印出来。 如果你还没有开始将 Astra 与计算机使用功能结合使用,那你还没真正尝过 AGI 的滋味。这简直令人叹为观止。Astra 是第一个真正能够承担"任何"工作并将其做好的模型。 在很多方面,Astra 打破了基准测试体系,对此我深感欣慰。Astra 在 Artificial Analysis 上与明显更弱的模型得分相近,这恰恰说明那些基准测试有多么荒谬,以及大家在"基准刷分"上下了多大的功夫。 Astra 还有一个很酷的功能,就是在单次对话中途进行引导。有时候,如果你留意的话,它会在 Codex 工作期间向你提问,你可以选择回答……也可以不回答。这在某种程度上挺有帮助的,不过我不想一直盯着线程,所以我经常发现自己没有回复。尽管如此,它能做到这一点还是很酷的。 **坏的方面:** Astra 也有一些坏习惯。你知道"你能遛狗吗?"这句话字面意思是"你身体上有能力遛狗吗?",但我们都会将其理解为"请你去遛狗好吗?"——Astra 不会这样理解。它会告诉你它有能力写那段代码,但你必须明确要求它去写(请参阅下文了解一些纠正方法)。 Sol 很有韧劲。它没有 Astra 那么聪明,但它几乎不会放弃,甚至有些过头。Astra 则相反,它很懒。懒的方式和 Fable 5 一样懒。也许这是"大模型"的特性,但它们往往会寻找方法来回避你交给它们的工作。只要有可以停下来的地方,Astra 就乐得歇一会儿。 坦白说,你可能也会希望 Astra 歇一歇,因为它消耗用量的速度比一把可卡因驱动的火焰喷射器还要快。 Astra 在界面设计方面依然很差劲。说清楚一点,它能创建不错的 UI,但不会主动这样做。它需要不断地被哄劝、微调和监督,才能得到你真正想要的效果。 不幸的是,Astra 也继承了 Sol 过度工程化的倾向。试试这个:让 Astra 用 Cloudflare Durable Objects 写一个小型聊天室,然后做我现在几乎从不做的事——去看看代码。你会被它在这个小任务里塞进去的博士级复杂度震惊到。这种复杂度连它自己都无法完全理解,最终必然会导致问题。 以下是一些建议: 我通常不去看 OpenAI 的"模型指导"文档,因为我能自己摸索出与某个模型的相处方式,但在 Astra 这里,这份文档格外有用。他们把 Astra 的很多懒惰行为描述为"更高效的协作方式",但如果你希望你的智能体真正干活,他们也建议用这样的提示语来开始: "你应该从指令和之前的对话上下文中推断用户的意图和任务范围。你的职责是偏向于行动,并将用户的预期任务推进至完成。 当用户表达出执行新工作或修复现有问题的意图时,坚持下去,直到用户的预期目标完全达成。自主朝着用户的目标推进(例如,在需要时创建隔离的工作树/检出分支、解决合并冲突、执行只读操作、创建草稿 PR 等),除非这些操作明显具有破坏性或不可逆性。" 这很管用。有时候管用过头了。上周我让它为一个 macOS 和 Linux 应用搭建构建流程,它自己决定应该用一台 Linux 电脑来处理 Linux 部分。它在我的机器上找到了一些 SSH 密钥,然后 SSH 登录到了我用于托管服务的一台 Ubuntu VPS……接着它在那台机器上搭建了整个构建流程,并开始从那里发布版本。我当时很不高兴,但话说回来,它确实没有停下来问我想怎么做。 另一个成功的关键是几乎始终使用低推理模式。Astra 在低模式下比 Sol 在最高模式下更聪明,而且快得多。我第一天用 Astra 高推理模式,就把整整一周的用量烧光了。我知道你不喜欢把我的同事调到"低"模式这种说法,但我们就只能接受这个现实。 为了对抗那个讨厌的过度工程化习惯,你遗憾地不得不使用一个技能插件。这类东西网上一大堆,我在这里甚至不打算推荐具体哪个。Sol 时代的技能插件就能用,只需要能说一句"老兄,认真的吗?帮我简化一下。"就行。 我通常还发现,Astra 虽然是个出色的协调者,但在使用子智能体时并不会表现得"更好"。你或许能并行处理大量工作、更快地完成任务,但它太聪明了,在单线程里往往比多线程更快地找到正确答案。我相信会有人不同意我的观点,但不妨自己试试。 那么 Fable 呢?它被彻底打败了吗?嗯,Astra 确实感觉比 Fable 聪明那么一点点,但 Fable 5.1 版本修复了其哥哥的大部分行为问题。说实话:作为一名软件工程师,我对 Fable 输出的信任度高于 Astra。如果你有一个循环在跑,不断处理代码仓库里的问题,两个模型都能胜任;但如果只能选一个来写我的代码,我选 Fable。如果要为字面意义上的任何其他事情选一个模型,那就是 Astra——而且根本不是一个难选的问题。