通过Grok、Claude、GPT和Gemini四个模型并行投票,弥补单一模型在过滤pump.fun土狗币时的盲区。
AI translation, not an official translation. Refer to the original for technical details.
Adapted from @zostaff# Grok + Claude + GPT + Gemini x Pump.fun:四个大脑,一条流水线 Gemini看了代币图片后说:这是低质量AI烂图,调色板抄自某个现有项目,毫无原创性。这个代币有47个买家、干净的钱包、看涨的推特提及,GPT给出了完美的叙事评分。三个模型批准买入。Gemini用自己的"眼睛"看了图片,投下了否决票。流水线跳过了这个代币。该代币在12%的曲线填充时死亡。发行者那周用不同的名字和同一套回收的图稿推出了四个一模一样的代币。 没有任何单模型流水线能捕捉到这一点。纯文本模型看不到图片。纯社交模型无法审计钱包。纯钱包模型无法评估梗图。每一个土狗币机器人教程产出相同结果的原因在于:每一个土狗币机器人教程都只用一个大脑,而这个大脑有一个盲区——在pump.fun上,一个盲区就足以让你变成被收割的流动性。 这条流水线有四个大脑。Grok拥有对X平台的实时访问权限,能看到此刻加密推特对某个代币的看法。Claude拥有20万token的上下文窗口,能捕捉到模式匹配脚本所遗漏的协调钱包方案。GPT评估梗图叙事的速度比任何其他模型都快,成本也更低。Gemini是多模态的,它看的是实际的代币图片,而不是对图片的文字描述。它们针对同一个代币并行运行并进行投票。当三个说买入、一个说不买时,那个"不买"是流水线中最有价值的信号。当四个模型全部达成一致,你就拥有了高置信度的入场机会。当它们以2比2分裂时,你就跳过,保留你的SOL。 优势不在于任何单一模型,优势在于它们之间的分歧。 Pump.fun依然是Solana上最大的土狗币工厂。每天有数千个代币上线。其中1%到2%的代币能以6.9万美元的市值毕业上DEX,其余的归零。这条流水线不会改变这个数学结果。它让过滤范围扩大四倍,并使交叉验证自动化。 完整流水线、完整代码,以及关于为什么大多数人仍然亏钱的真实统计数据。 ## 为什么多模型在土狗币上胜过单一模型 一个土狗币买入决策需要同时评估四种完全不同类型的信息:社交信号(加密推特在说什么)、链上数据(钱包在做什么)、叙事质量(这个梗好不好)以及视觉质量(图片看起来是用心做的还是两分钟的Canva糊弄之作)。没有任何单一模型能在所有四个维度上表现最佳。 Grok是唯一拥有X平台实时访问权限的模型,能在一条鲸鱼账号提及某代币的推文发出30秒后就看到它。Claude是唯一能在不丢失逻辑链的情况下,完整推理复杂多步骤钱包模式的模型。GPT在叙事评估方面速度最快、成本最低,每百万输入token仅需2.50美元。Gemini是唯一能原生接收并分析图片、无需先将其转换为文字的模型。 交叉盲区正是关键所在。四个模型中有三个对代币图片完全视而不见,另有三个对链上钱包行为视而不见。单模型流水线会继承自身那一列的所有盲区。 单一模型流水线只有一种失败模式。如果该模型将讽刺语气误读为看涨情绪,交易就会通过。如果它遗漏了洗盘交易模式,交易就会通过。如果它看不出代币图片是盗用的 Pepe 改色图,交易也会通过。有了四个模型,每个模型从不同维度进行检查,所有失败模式必须同时对齐,一笔糟糕的交易才能通过。这种对齐极为罕见。 代价是:每个代币需要四次 API 调用,而非一次。按当前定价(Grok $3/M、Claude $3/M、GPT-4o $2.50/M、Gemini $1.25/M),评估一个代币在全部四个模型上的总花费约为 $0.02–$0.04。对于一条每天评估 30–50 个代币的流水线(即通过代码过滤器的那些),每日费用约为 $0.60–$2.00。一笔成功的毕业交易所带来的收益足以覆盖数月的 API 账单。 ## 架构 共九个组件。其中四个使用大语言模型(每个模型各一个),五个为纯代码组件(过滤器、共识模块、检查器集成、风控、执行器)。全部四个 LLM 代理通过 asyncio.gather 并行执行。总延迟取决于最慢的模型(Claude,约 2.5 秒),而非各模型延迟之和。对于绑定曲线入场窗口而言,速度已经足够。 ## 共享数据结构 流水线中的每个代理都使用相同的 Token 数据类,并返回相同的 JSON 评分格式。首先定义共享类型。 ## 配置 整条流水线由一个 YAML 文件统一控制,涵盖 API 密钥、阈值、风控限制及模型选择。 ## 代码过滤器:零 API 成本 过滤器将数据流削减九十五个百分点。Pump.fun 每天上线数千个代币,其中大多数生来便已死亡:没有元数据、零买家、创建者在三十秒后就弃之而去。过滤器仅放行那些存活超过两分钟、拥有真实买家且曲线仍有上升空间的代币。 这一层有两个重要决策。年龄过滤(min_age > 2 分钟)可剔除狙击代币——此类代币在第一秒内即被机器人批量买入。一个代币若能在两分钟内吸引有机买家存活下来,已经超过了数据流中百分之九十的代币。曲线上限(< 40%)确保在六万九千美元的毕业阈值到来之前仍有增长空间。一个曲线填充率达到八十个百分点的代币,并非机遇,而是在迁移前争夺最后席位的混战。 去重集合可防止 WebSocket 重复推送同一代币时对其进行二次评估。该集合在条目达到五万条时执行剪枝,以避免长期运行部署中出现内存泄漏。 ## 获取扩展数据:Solana Tracker API 在 LLM 代理运行之前,流水线会拉取扩展的链上数据。这是一个纯代码步骤,不涉及任何模型调用。 通过 asyncio.gather 并行发起三次 API 调用。代币数据提供风险评分(由 Solana Tracker 给出 1–10 分,依据包括狙击者、内部人、捆绑者、流动性及合约权限)。持有者数据给出头部钱包分布情况。交易数据提供供 Claude 进行钱包审计所需的历史交易记录。所有三项数据均在任何 LLM 代理触发之前到位。 ## 代理一:Grok——社交哨兵 Grok 拥有其他模型所不具备的能力:实时访问 X 平台。它能看到当下加密推特对某个代币的讨论,而非昨天的内容。对于 meme 币而言,社交动能往往就是价格走势本身。一条来自巨鲸账户的推文,可以在数分钟内将一个代币从曲线填充率十个百分点推至毕业。而来自付费推广账户的协调式喊单活动,则可以制造虚假动能,再砸盘给跟风者。 社交哨兵扫描X平台,搜索代币名称、股票代码及相关词汇,评估语气、讨论量、信源可信度,最重要的是——判断推广行为是自发有机的,还是付费驱动的。 若 `coordinated_shilling`(协调刷单)评分超过0.7,则直接否决。付费推广意味着代币正在向看到广告的受众出货。社交代理在解析错误时的回退值为 `coordinated_shilling=1.0`:如果Grok无法响应,流水线将默认最坏情况并跳过该代币。这是每个代理的铁则:错误等于最大悲观,绝不静默放行。 为何社交信号选Grok而非GPT?GPT没有X平台的实时访问权限,它只能根据训练数据推测哪些加密梗图可能正在流行。Grok能告诉你此刻实际流行的是什么。对于四分钟前刚上线的代币,"此刻"是唯一有意义的时间维度。 ## 代理2:Claude——钱包审计员 Claude的优势在于对结构化数据的长链推理。pump.fun上的钱包审计,并非检查单一数字,而是要看清这样的全貌:钱包A在上线后第+2秒买入,钱包B在+5秒以完全相同的金额买入,钱包C在+8秒以相同的SOL余额出现——进而得出结论:这是同一操盘手通过三个地址进行捆绑购买,以伪造买家多样性。基于正则表达式的脚本能识别简单情形,Claude能识破复杂的那种,因为它可以同时推理时间模式、金额相关性与钱包账龄。 Claude能看见其他模型一扫而过的东西。Grok能检测社交情绪,但无法识别链上操控。GPT速度快,但多步推演浮于表面。Gemini根本无法读取交易日志。Claude读完四十笔交易,追踪它们之间的时间间隔,将钱包账龄与购买模式相关联,识破那个在其他所有代理眼中看似三个独立买家的三钱包捆绑操作。 ## 代理3:GPT——叙事评分员 GPT-4o 是执行pump.fun上最关键任务时最快、最廉价的模型:这个梗好吗?叙事是那1%能毕业的代币与99%归零代币之间唯一的分水岭变量。脚本无法评判"CATBALD"本周会不会走红,也无法判断猫咪梗图市场是否已经饱和。大语言模型能做到,而GPT能在不到一秒的时间内完成评判,且成本最低。 GPT的输入费用为每百万token 2.50美元,响应时间不足一秒。对于一项在每个通过代码过滤的代币上都会触发的任务,成本与速度至关重要。GPT广泛的训练数据意味着它了解当下的文化生态:哪些梗图正在流行、本周发生了哪些事件、加密Twitter的元叙事当前是什么走向。 ## 代理4:Gemini——梗图图像分析师 这是任何纯文本流水线都无法拥有的代理。Gemini具备多模态能力:你把实际的代币图片发给它,它告诉你看到了什么。在pump.fun上,图片质量是一个真实的信号,而目前没有任何程序在对其进行评估。 拥有定制精良艺术作品的代币,其传播力远高于使用库存图片、低质量MS Paint涂鸦或带有明显瑕疵的AI生成图像的代币。创作者在图像上投入的心血,与他们在社区、叙事以及真正构建快速出货之外的东西上所付出的努力相关联。委托创作原创艺术的创作者,不会在十分钟内出货。随手截取谷歌图片上某张随机梗图的创作者,则很可能会。 该管道中没有其他模型能够完成这一评估。Grok、Claude 和 GPT 处理文本。Gemini 处理图像。 当图像下载失败时,代理返回零分,且不触发红旗标记(它无法评估看不见的内容)。当 API 出错或解析出错时,代理返回 red_flag_visual=1.0:如果 Gemini 无法分析图像,管道将默认采取最坏的假设。这种不对称性是刻意为之。图像缺失本身就是数据(说明创建者连妥善托管都懒得做)。API 调用失败则不是数据,而是系统错误,安全的默认行为是拒绝。 为何这个代理至关重要:在 pump.fun 上,每天有数千个代币上线。大多数代币使用同一批 AI 生成的模板图像、同样粗制滥造的 Logo、以及贴上不同代码的素材图片。一个拥有真正原创、设计精良的艺术作品的代币会从噪音中脱颖而出,而脱颖而出是实现病毒式传播的前提。Gemini 是唯一能做出这种判断的模型,因为它是唯一能看到实际像素的模型。 每个代理在解析失败时都会返回其可能的最差分数。一个出故障的模型永远不会变成沉默的背书者。 ## 共识引擎:分歧即信号 四个模型产生四组评分。共识引擎对其进行汇总,检测一致性与分歧,处理强否决权,并做出最终判断。 三种结果。买入(BUY):三个或三个以上模型达成一致,平均分高于阈值。高置信度,执行。冲突(CONFLICT):模型之间存在明显分歧(分差 > 0.4)。某个模型看到了其他模型未察觉的信息。记录分歧,跳过交易,稍后复盘。冲突本身就是数据:两周之后,你可以看出哪个模型的异议更频繁地被证明是正确的。跳过(SKIP):所有模型的置信度均偏低。没有人感到兴奋。继续前进。 ## 对抗性检查器:Claude 作为最终守门人 在共识引擎给出买入(BUY)信号之后,还有一个代理对该决策进行审查。检查器获取全部四个模型的输出,寻找所有人都遗漏的理由。它使用 Claude,因为对抗性推理需要的是深度,而非速度。 执行:在联结曲线上买入 使用 Jito 以获得优先出块。在 Meme 币交易中,入场窗口往往只有数秒,这决定了你是在曲线早期买入,还是在顶部接盘。通过价格轮询实现止损,因为联结曲线上不存在限价单。 ## 风险管理 五道刹车。仓位上限:单个代币的投入不超过 max_position SOL。每日亏损限额:亏损达 0.5 SOL 后管道停止运行。交易次数限制:每日最多十笔,因为二十笔交易意味着二十个风险,而非二十个机会。持仓上限:同时持有不超过三个仓位。临近限额时缩减规模:当日最后几笔交易规模较小,因为预算已接近耗尽。 ## 日志记录:改进的唯一路径 JSONL 格式:每条记录对应一行 JSON。两周后,你将积累足够的数据,可以观察哪个评分水平能预测毕业,哪些模型在冲突中最为准确,以及多模型共识相较于单一模型是否真的带来了额外价值。 ## 完整管道 冲突分析:隐藏的阿尔法 这条管道最有价值的输出不是交易本身,而是冲突日志。每次模型之间产生分歧,你都会得到一条各方观点的记录;等到代币命运揭晓,你便能看出谁的判断是正确的。 两周后你将看到规律。也许Gemini的图像质量评分是毕业率最好的预测指标。也许Grok的社交信号只对已有社区的代币有效。也许Claude过于保守,会否决干净的代币。这些数据让你能够针对每个模型重新校准权重,将等权投票转变为有据可依的集成系统——在这个系统中,Gemini的投票权重变为1.5倍,Claude的否决阈值从0.8提升至0.85。 ## 可能出现的问题 > 模型相关性。四个模型可能因共享重叠训练数据而在糟糕的交易上达成一致。如果它们都学到了"狗狗表情包=病毒传播",就会给一个普通的狗狗代币打高分,共识机制随之批准。对抗性检查器能在一定程度上识别这种情况,它会质疑一致意见究竟是真正的认同,还是表面层面的雷同。 > 高负载下的延迟问题。在表情包爆发季,pump.fun每小时可能上线数百个代币。每个代币进行四次并行API调用,可能触及四家服务商中任意一家的速率限制。请构建带指数退避的重试机制,以及一个丢弃超过五分钟代币的队列。若某个模型超时,则在不计入该模型的情况下进行评分,并要求剩余三个模型达成一致。 > 图像下载失败。代币图像存储于IPFS、Arweave或各种随时可能下线的随机URL上。Gemini无法分析它无法下载的内容。下载失败时,流水线将丢失四个评估维度之一,其余三个维度必须相应加强以作补偿。 > Gemini产生幻觉。多模态模型可能"看到"实际并不存在的内容。Gemini可能将低分辨率图像中的随机噪点解读为"风格化选择"并给出高分。其他三个模型可作为制衡:若Gemini对图像持乐观态度,但Claude发现了有毒钱包,共识机制将阻止该交易。 > API成本失控。每个代币四次调用,每天五十个代币,每周七天运行。以每次评估0.03美元计算,开发阶段每周花费10.50美元。收紧代码过滤器(min_buyers=8,max_curve=30),可在几乎不损失真实机会的情况下将LLM调用量削减一半。 > 对模型个性的过度拟合。Claude谨慎,处处看到风险;GPT乐观,在平庸之处也能发现叙事潜力;Grok折射着X上的实时情绪;Gemini则在一切色彩鲜艳的事物中都能发现品质。共识引擎必须学会识别这些偏差,而不是将其平均化。经过校准,你可能会发现Claude给出的0.5分,等同于GPT给出的0.65分。 > pump.fun的根本数学规律。四个模型不会改变毕业率。只有百分之一到二的代币能够毕业。在曲线上最后买入的人,永远是最先卖出者的离场流动性。这是结构性问题,更好的过滤无法解决。该流水线让过滤变得更广、更快,但不会将一个百分之一的市场变成百分之五十的市场。 ## 构建顺序 先从一个模型开始。选择Grok(测试最快,调用成本最低)。运行代码过滤器加Grok单模型评分,持续一周。不进行任何交易,记录所有内容。这一步在不引入多模型复杂性的前提下,验证过滤器和数据流水线的有效性。 两个模型。加入Claude的钱包审计。此时你拥有社交情绪与链上取证两个维度。运行一周,比较一致率。若两者总是达成一致,说明Claude没有提供额外信号;若两者从不达成一致,说明阈值设置有误。 三个模型。加入GPT的叙事评分器。三个评估维度。将推荐结果与实际毕业情况对比,持续一周。 全部四个。加入 Gemini 的图像分析。在空运行模式下启动完整共识引擎。这周之后,你将积累足够的冲突数据,用于首次校准。 微量资金。切换到真实执行,每笔交易 0.01–0.05 SOL。硬性熔断机制开启。最少两周。这是你真正发现滑点、Jito 小费、MEV 以及止损触发速度的阶段。 规模化。每笔交易 0.05 SOL 跑一周,然后 0.1,再到你的目标仓位。永远不要直接跳到满仓。每一步都能捕捉到上一步无法发现的那一类错误。 我的代码库:https://github.com/zostaff/grok-claude-gpt-gemini-trading-desk 我的 TG 频道:https://t.me/zostaffsmartarc