实践者对 GPT Image 2.5 在 100 余张图片上的测试分解,涵盖缩略图、广告、品牌手册和产品图的批量生产。
AI translation, not an official translation. Refer to the original for technical details.
Adapted from @TheMattBerman# 如何用 GPT Image 2.5 从一张图片运营整个营销活动 我们每周要输出数百件内容。 其中将近 90% 在发布前需要审批,而且从来不是单一类型:缩略图、广告、品牌手册、产品图。 GPT Image 2.5 刚刚发布。我花了整整一周,在那些真正能落地、能赚钱的工作流上跑了一遍。 在进入详细拆解之前,先把提示词拿走。我把全部 10 条生产提示词、负面提示规则,以及发布前的质检清单打包成了一份免费参考文件: 👉 go.bigplayers.co/make-everything/(https://go.bigplayers.co/make-everything/) 我用三个模型(Flare、Sunburst 和较旧的 gpt-image 2),以完全相同的提示词跑了超过 100 张图,想弄清楚什么有效、什么失败,以及今天你的生意里实际能用什么。 一句话结论:真实感这关已经过了。这次测试里每个模型生成的图片,都完全能以假乱真,看起来像人工拍摄的。 这些年我雇过几十个平面设计师。GPT Image 2.5 正在超越其中 99%。 上面那张幻灯片,来自一条提示词。 它一次性处理好了层级结构、字体排印、版面布局,以及客户的决策呈现。 这个模型像一个艺术总监那样在运作。 要用这项技术跑一次真正的营销活动,请用"锚点方法": 1. 锁定一张真实照片。永远不要让模型猜你的产品长什么样。每一个素材都从这个锚点派生出来。 1. 提示词里永远不留空白。如果你要求生成一个 Logo 却没有写品牌名称,AI 就会自己猜——有时会在你的广告上盖上竞品的商标。 1. 按任务类型分配模型。Flare 是你做手册和快速广告的艺术总监;Sunburst 是你做地图和事实性图表的研究员。 下面是证明、数据,以及你今天就能动手做的事情。 ## 1. 从你已经在跑的格式开始 我从我们每周都在使用的五种静态格式入手: - 我们 vs 他们的分屏对比 - 放射状数据标注 - UGC 风格镜子自拍 - 原生 iPhone 备忘录截图风格 - 厨房白板 Flare 在白板这个场景里是明显的赢家。老实说,这让我有点惊讶。 它理解了关于窗口的玩笑——那些是有标题栏和控件的真实应用窗口,而不是一堆矩形拼凑的。照片感觉最自然,产品看起来也很棒。 不要总是选最强的模型,要选能把活干好的那个。 这一局我选 Sunburst。标题第一眼就能看到,盒子看起来是真实的,数字也有足够的留白空间,整体感觉像一张完成度很高的广告。Flare 很接近,但 Sunburst 把整件事整合得更好。 这一局很接近。我会把优势给 Flare。那张疲惫的脸、凌乱的洗手台、清晨的光线,感觉真的像是有人在四周前后各拍了一张。Sunburst 也很好看,只是稍微干净了一点点。 三个模型都理解了"前后对比"的概念,但 Flare 让我更信服了一些。 如果你在跑付费流量,这会重新定价你的创意测试成本。你可以在一个小时内测试 20 个全新的视觉角度,而不用等设计师等两周。 每周格式的提示词规则:给模型明确的版面角色。不要说"做一个酷广告",要说:"一张方形分屏对比广告。左侧:我们的干净解决方案。右侧:凌乱的替代方案。每侧恰好四行文案,严格限制在各自那一半。" ## 2. 缩略图问题已经解决 我拿了这张阿尔伯特·爱因斯坦的公共版权图片,把他变成了 2026 年最火的 YouTuber。 flare完美复刻了MrBeast风格。它运用了三要素法则(指向动作、巨型笔记本电脑与红色箭头)。最关键的是,你能一眼看出该看哪里。它看起来就像一个播放量达200万的视频。 在科技评测风格方面,sunburst胜出(但flare紧随其后)。更大的人脸、更简洁的标题,加上机器人从笔记本电脑里钻出来的设计,赋予了画面生命力。而GPT Image 2把爱因斯坦缩得很小,还把标题埋进了屏幕里。 再看戏剧化风格版本。flare和sunburst看起来都相当不错。我还是会选sunburst。那个表情、红色灯光,以及"已删除文件"的标注,让人忍不住想知道究竟发生了什么。 我很喜欢这里的OpenAI标志。模型在没有提示的情况下自行添加了它,但效果很好——一个观众熟悉的知名品牌标识摆在显眼位置,让人在读任何文字之前就已经被吸引住了。 ## 3. 三种品牌形象与配套提案PPT 这是整个项目的核心,做起来也很有趣。 我妻子在新奥尔良经营着一家艺廊。她正在筹办一场以苦艾酒品牌为主题的派对,我想给他们提出一些主题构想、视觉风格和命名方案。 GPT Image 2生成了最初的概念方案。 这些已经相当不错了。海报、T恤、菜单、门票,甚至整个场地的布置效果都有所呈现。足以判断一个创意是否具有可行性。 接着,我把这些概念交给GPT Image 2.5,让它将其整理成可用于提案的PPT。 看看它做得有多好。这只是flare的版本。 视觉效果更佳,文案简洁,而且它真正理解了如何呈现这些创意。 大图先抓住你的眼球,小图展示主题如何贯穿整场活动。名称和描述排布在你预期的位置,没有任何内容显得是为了凑版面而塞进去的。 然后它还生成了一张决策幻灯片,帮助我们做出选择。 这才是真正打动我的地方。它理解了我制作这套PPT的目的:给他们一些可以直接做出反应和选择的东西。flare做到了。 为了在一个我自己不拥有的品牌上测试这套流程,我用多邻国(Duolingo)的单张截图(上面有绿色十六进制色码)做了同样的实验。 同一张参考图输入六次独立生成(通过API,无共享聊天记录)。每张图里你都能认出Duo。 但注意看sunburst在下排的长椅版本。我要求从背后展示它,结果它在背部画出了类似面部的细节。GPT Image 2和flare对这个角度的处理都更好。 ## 4. 一张真实照片,足以撑起整套营销物料 我从Roots of Fight的店铺里找了一张产品图:一件布鲁克林道奇队Jackie Robinson连帽衫。 这张照片就是整个创作的锚点。 永远不要让模型去猜测你的面料、水洗工艺或产品细节,它会产生幻觉。用于品牌工作时,每一张广告图都应以那一张固定图片为基础生成。 看看从那一张照片里产出了什么: 连帽衫在所有模型中都完美还原了: - 皇家蓝水洗抓绒面料 - 左胸白色花体字"Brooklyn B"搭配红色"42" - 正确位置(右袖)上的袖章 - 纯白色平织抽绳和袋鼠口袋 - 下摆标签,完全准确 每条标题文案都逐字对应。 以下是我用于看台广告的精确提示词。直接复制这个结构即可: (仔细看看看台那第一张图右下角。看到那个标志了吗?先记住它) ## 5. 无需拍摄,照样出产品图 还是用那件连帽衫,我想看看能否在不预约摄影棚、不雇用模特的情况下,制作出电商目录级别的产品详情页(PDP)图片。 一次典型的目录拍摄,等你付完摄影师、摄影棚、模特和修图的费用,起步价在3500到5000美元之间,通常还不止于此。 正面照是个容易拿下的测试。三个模型都把真实连帽衫穿在了一个看起来真实的模特身上,背景是干净的摄影棚、均匀的商业布光。随便哪张放到Shopify上线都没问题。 然后我要求生成连帽衫的背面。 三个模型从未被展示过这件连帽衫的背面长什么样。 这个测试揭示了不同模型如何处理信息缺失的问题: - GPT Image 2和Sunburst直接把背面留成了空白。 - Flare把正面的图案(手写体"B"和红色"42")复制粘贴到了背面。 现在看第四张图里的真实产品。这件连帽衫的背面有弧形印字"BROOKLYN DODGERS"、巨大的红色"42"、手写体"Robinson",以及Roots of Fight和MLB的标志。 空白的背面会对一件本有图案的产品造成误导,但凭空捏造的设计更危险。它渲染得如此精细,审核人员可能一眼看不出来,就直接发出去了,甚至意识不到问题所在。所以要仔细检查产品图,或者更好的办法是,建立一道关卡,强制要求模型在发布前与真实SKU进行对照核查。 规则是:你无法仅凭一张产品正面照来生成背面。要把两面都提供给模型。 ## 6. 从未拍过任何素材的品牌的UGC 接下来,我想为付费社交投放生成UGC内容。 还是用那件Jackie Robinson连帽衫,我提示词要求生成一张随意的浴室镜子前用手机自拍的照片,带有不讨好的顶部打光,要有真实iPhone的质感。 三张图都通过了"滑屏测试"。在TikTok或Instagram上,你刷过去根本不会觉得"这是AI做的"。 但看看镜子里的倒影。 三个模型都没有把镜像中的手写体"B"和数字"42"反转过来。文字显示正常。而在真实的镜子倒影中,这些文字应该是左右翻转的。三个图像模型都没能理解镜面物理原理。我在测试其他完全不同的产品时,也发现了同样的错误。 GPT Image 2还把说明文字写错了:"hooodie"多打了一个"o",变成了三个"o"。Flare和Sunburst则都把文字精确渲染出来了。 ## 7. 图表、地图和说明图 大多数品牌还需要技术性素材:示意图、功能卡片、信息图表、产品说明图。 1. B2B SaaS说明图(三方平手) 我要求为StealAds生成一张暗色系新野蛮主义风格的信息图,解释我们的三步引擎。 三个模型全部完美呈现。每一行标题、每一个等宽字体标签、连接箭头,以及完整的官网URL,全都准确无误。就连附带的Logo标记也还原得很好,字体没有任何变形。三张任意一张都可以直接投用。 当你给模型提供了清晰的品牌规范和简洁的工作流程时,模型之间的选择就变成了一种审美偏好。视觉上,我更偏好Sunburst的这张。 2. 华盛顿特区地铁地图(Sunburst完胜) 然后我要求生成一张精确的华盛顿特区地铁线路图,显示全部六条线路和主要换乘枢纽。 Sunburst在这项测试中完胜。它列出了六条线路所有真实站点的终点站名称。 Flare编造出了毫无意义的站名("Moely Roym"、"Pentagon Aest")。GPT Image 2画出了一张漂亮的地图,但地理细节远不够精准。 ## 8. 修改轮 每一位代理公司负责人和创始人都深知这种痛苦:你拿到了一个很棒的方案,然后客户提出了两个修改意见。 我测试了将一张完成的渲染图重新输入模型并进行两轮连续修改时,会发生什么。 修订版 1:"仅将标题改为:'你的竞品广告正在赢。现在你知道为什么了。'其他所有内容保持不变。" 针对每周格式的提示规则:将按钮颜色从绿色改为品红色 #FF2E93,并将按钮文字改为"看一场实时拆解"。其他所有内容保持不变。" 以下是各模型处理这些反馈的情况: - Flare 是明显赢家。它应用了两处修改,保留了完整的副标题,保留了品红色细线装饰,并在三次生成中始终锁定了布局。 - Sunburst 正确修改了文字和颜色,但布局开始偏移。标题变大了,边距移动了,logo 也发生了位移。 - gpt-image 2 以最糟糕的方式失败了。它做出了修改,但将公司名称拆成了两个词:"Steal Ads"。 这正是那种会悄悄混入生产环境的错误。到了第四轮编辑,没有人会再重新核对公司名称。 ## 9. 这些错误将为你省下数月时间 回看第 4 节中那张 Jackie Robinson 连帽衫的看台广告。 提示词写的是:"小品牌字标,右下角。" 我没有说明品牌名称。我留了一个空白。 结果发生了这些: - GPT Image 2 盖上了"RUSSELL ATHLETIC / 19 U.S.A. 02",还附带一个狮子徽章。它把一个真实的竞争运动品牌贴到了一则 Roots of Fight 的广告上。 - Flare 虚构了一个叫"Rugged"的品牌。 - Sunburst 读取了原图中衣领和下摆处细小的织入标签,判断出该品牌是 Roots of Fight,并生成了"ROF"。 Sunburst 在这里展现了惊人的推理能力。但比起让它猜测我在销售哪个品牌,我更愿意直接给它真实的 logo。 规则:AI 模型永远不会让空白处保持空白。如果你要求一个徽章、一个 logo 或一个网址却没有指定名称,模型就会自行填充。有时候,它填进去的是你竞争对手的商标。 在你的简报中,为每一个元素命名。 ## 10. Flare 与 Sunburst 的对比 OpenAI 发布了 2.5 的两个版本:Flare 和 Sunburst。 大多数人把它们当成速度上略有差异的两个版本。实际上它们是截然不同的模型,各有相反的失败模式。 → 事实性图表、地图、交通线路图:Sunburst 唯一一个正确标注出华盛顿特区地铁全部六个终点站的模型。Flare 标错了站名。 → 高管路演演示文稿、展示幻灯片:Flare/Sunburst 完成了 5 张幻灯片的品牌识别系列,边距锁定,坐标零偏移。 → 从照片中去除物体:Flare 在去除画面中的人物时保留了笔记本电脑的打光效果;其他模型留下了一个空洞的光晕。 → 多轮修订:Flare 在两轮连续修订中,始终保持了字体排印、按钮和边距的一致性。 → 从背后呈现角色或吉祥物:G2 或 Flare 干净地处理了 Duo 的背面视角。Sunburst 把他的脸画到了头部后侧。 → 从照片智能推断品牌:Sunburst 从连帽衫上细小的织入标签中推断出"ROF"标识。 → 镜子自拍与镜像反射:三者均失败 每个模型都无法正确反转镜像照片中胸前的文字。 速度也是一个重要因素。Flare 每次生成耗时 15 到 19 秒。Sunburst 需要 26 到 32 秒。 Flare 大约快 1.7 倍。对于 80% 的日常广告制作、YouTube 缩略图和幻灯片设计而言,Flare 是你的主力工具。将 Sunburst 留给技术地图、图表和复杂推理任务。 ## 11. 获取提示词 以下是我们在任何生成资产交付给客户或投放到广告账户之前所用的检查清单(go.bigplayers.co/make-everything/):(https://go.bigplayers.co/make-everything/) 1. 锚点检查:每个产品角度是否都源自一张冻结的真实世界照片? 1. 空白检查:我们是否在提示词中明确命名了每一个标志、徽章和网址? 1. 物理检查:我们是否验证了产品的反光、光源以及看不见的侧面? 1. 修订检查:每轮反馈后,我们是否重新阅读了静态文案(比如品牌名称)? 在这方面取得成功的人,并不在争论基准测试,也不在争论AI内容是否足够好(它确实足够好)。 他们选定一张锚点照片。他们在提示词中填补每一处空白。建立工作流程和评估体系来实现规模化,然后运行一套每周能交付50个干净创意素材的生产引擎。 放手去干,Matt。 附言:你最先测试哪种格式?