完美逆向文生图提示词的方法找到了 ✍ Bridge Wang🕐 2026-05-21📦 9.8 KB 🟢 已读 𝕏 文章列表 文章介绍了一种利用 Codex 创建两个子智能体(逆向提示词智能体 A 和监督智能体 B)的方法,通过 A 生成提示词、B 生图并对比找差异的循环迭代机制,将任意图片精准逆向为可复用的文生图提示词。实验表明,通过 3 轮迭代,成功将风格描述升级为版式锁定和视觉重心的精确约束,实现了 95 分的高保真复刻。 文生图提示词工程AI工作流多智能体图像生成Codex逆向工程版式设计AIGC # 完美逆向文生图提示词的方法找到了 **作者**: Bridge Wang **日期**: 2026-05-21T05:06:08.000Z **来源**: [https://x.com/qc777qc/status/2057327056774648108](https://x.com/qc777qc/status/2057327056774648108) ---  > 在 Codex 里创建两个子智能体,就能把网络上任意一张你想复刻的图片,逆向成可复用、可测试、可迭代的文生图提示词。 我最近做了一个小实验:给 AI 一张封面图,让它反推出背后的提示词。 难点不是猜出「黑黄 cyberpunk manga poster」这种风格词,而是把画面结构也锁住: - 左侧巨大 `276` - `USE CASES / OF / HERMES AGENT` 的层级 - 右侧戴耳机的漫画女性 - 黄色圆形光环 - 右侧 HUD 面板 - 底部六个 icon 标签 - 黑黄白三色旧印刷质感 目标图长这样:  我没有直接让一个模型一次猜完。 我创建了两个子智能体。 A:逆向提示词智能体。 它的任务是看图,然后猜背后的 prompt。 B:监督智能体。 它的任务不是夸 A,而是用A的prompt生成一张图片,然后和原图找差异,把差异拆成可执行反馈。 A 猜一次。 B 打一次分。 A 再改。 最多 5 轮。 或者分数达到。 ## 在 Codex 里怎么用 操作很简单。 上传一张你想复刻的图片。 然后粘贴这段提示词: > 创建两个子智能体,一个是逆向提示词智能体 A ,一个是监督智能体 B。A 的作用是猜测一张图片背后的提示词。B 智能体负责用猜出来的提示词生图,对比和原始图片的差异,然后不断给 A 反馈,让它迭代提示词。直到 B 认为二者的差异很小。 > 终止条件:B 认为差距很小,或者达到第5轮迭代。 ## Step 1:72 分,先把元素写死 A 第一轮做的事很直接: 把原图里的关键元素全写进 prompt。 不是「huge typography」。 而是: > giant yellow "276" > massive bone-white "USE CASES" > small centered "OF" > huge yellow "HERMES AGENT" 不是「HUD panels」。 而是: > "$> hermes run" > "PLAN" > "RESEARCH" > "EXECUTE" > "DELIVER" > "DONE." 这一步生成出来是这样:  B 给了 72 分。 它的判断是:风格方向对了,主要元素也对了,但还不够像。 因为原图不是元素堆叠。 原图是一个非常明确的海报版式。 B 的反馈很关键: > 不要继续加风格词,要把 prompt 从「风格描述」升级成「版式锁定描述」。 这是整个实验第一次拐弯。 ## Step 2:92 分,开始锁版式 第二轮,A 加了一个很重要的词: > LOCKED COMPOSITION 这不是魔法词。 它真正有用的地方是后面的约束: > left half of the poster is dominated by exact readable typography, occupying about 50-55% of the canvas 也就是说,不再只是「左边有大字」。 而是: 左半边 50-55% 都是文字。 `276` 在最上面。 `USE CASES` 在中间。 `OF` 小号居中。 `HERMES AGENT` 在底部。 底下还有六个 icon: > DEV, AUTOMATION, RESEARCH, BUSINESS, CREATIVE, INFRA 这一步生成出来是这样:  B 直接把分数打到了 92,已经达到使用标准了。 这说明一件事: 生图提示词里,最值钱的不是形容词。 是空间关系。 `cyberpunk`、`screenprint`、`high contrast` 这些词只能把你带到一个风格区间。 但 `left 55%`、`top-left`、`lower-right`、`terminal panel sits between typography and character face` 这种词,才能把图钉在画布上。 ## Step 3:95 分,最后修视觉重心 第二轮已经很接近了。 但 B 还是挑出了几个问题: 人物还不够大。 头发不够像原图。 黄色光环不够压画面。 左侧 `276` 的压迫感还可以更强。 于是 A 第三轮不再加新元素,只做精修。 它把人物改成: > Long straight glossy black hair falling past the shoulders, heavy black hair mass, blunt bangs 把人物位置改成: > head and upper body occupy most of the right half, cropped at the bottom-right 把 `276` 改成: > the largest element in the image, nearly touching the top and left margins 最后生成出来是这样:  B 给了 95 分,然后触发 STOP。 它的理由很简单: 关键结构已经锁住了。 继续加词,只会让 prompt 变得臃肿。 ## 分数怎么涨的 这次不是线性变好。 它更像三次不同层级的收敛: > 初始 prompt:只抓风格,未评分 > 第 1 轮:72 分,补全关键元素 > 第 2 轮:92 分,锁定版式结构 > 第 3 轮:95 分,精修视觉重心,STOP 最重要的变化不是「词更多了」。 而是 prompt 的描述对象变了。 第一版在描述风格。 第二版在描述元素。 第三版在描述版式。 第四版在描述视觉重心。 这也是我觉得这次实验最有价值的地方。 逆向提示词不是把图片翻译成一堆漂亮词。 而是把图片拆成可执行的生成约束。 ## 最终合并提示词 这是最后 B 判定为 95 分的合并版。 正向和负向我放在一起,方便直接丢进生图工具。 > Ultra-wide 1500x600 / 2.5:1 X Article cover, exact locked poster layout, black safety-yellow and bone-white limited palette, distressed manga screenprint cyberpunk technical poster, matte black background, thin rounded safety-yellow border around the entire canvas, dense blueprint grid lines, circuit traces, terminal schematics, HUD markings, risograph grain, halftone dots, scratches, worn ink texture, high contrast. > LOCKED COMPOSITION: left half is dominated by exact readable typography, occupying about 50-55% of the canvas. Top-left: enormous safety-yellow "276", the largest element in the image, nearly touching the top and left margins, each digit very wide, squared, ultra-condensed varsity / industrial block type, extremely thick strokes, tight spacing, chipped screenprint edges. Middle-left: huge bone-white "USE CASES", ultra-condensed industrial block letters, tight tracking, stacked tightly below 276. Directly below: small centered bone-white "OF" between thin yellow horizontal rules. Lower-left: huge safety-yellow "HERMES AGENT", tightly spaced ultra-condensed block letters, spanning the lower-left width. > Bottom-left row beneath the title: six small rounded-square icon buttons with thin yellow outlines, bone-white icons, and exact labels "DEV", "AUTOMATION", "RESEARCH", "BUSINESS", "CREATIVE", "INFRA", followed by small yellow ellipsis and bone-white text "AND MORE". > Right half: large anime manga young woman AI operator, head and upper body occupy most of the right half, cropped at the bottom-right, face located around center-right and facing left in three-quarter profile. Long straight glossy black hair falling past the shoulders, heavy black hair mass, blunt bangs, hair nearly touches the top border, pale bone-white face, calm serious expression, large over-ear headphones, thick black manga linework, sharp white ink highlights, large black high-collar jacket creating a heavy black shape on the lower-right. > Behind the character: large flat safety-yellow disk halo centered behind the head, spanning from upper center to lower right, partially cropped by the frame and partially hidden behind hair and shoulder. > HUD panels: terminal panel sits between the left typography and the character face, reading "$> hermes run", "PLAN", "RESEARCH", "EXECUTE", "DELIVER", "DONE." Top-right small panel reads "AGENT STATUS", "ONLINE", "WORKING 24/7". Far-right vertical panel reads "CATEGORIES" with "DEV WORKFLOWS", "INTEGRATIONS", "PERSONAL ASSISTANTS", "BUSINESS OPS", "CONTENT CREATION", "RESEARCH SYSTEMS", "INFRASTRUCTURE", "AND MORE...". Lower-right box reads "TOTAL", huge yellow "276", "REAL WORLD", "USE CASES". > Preserve strong readable hierarchy and clear negative spacing around the main typography; all main text must be perfectly spelled and vector-sharp, with no extra random letters or distorted glyphs. Dense, balanced, gritty poster composition, but keep the left typography clearly readable. > Avoid small timid typography, avoid shrinking the character, avoid making the girl cute/chibi, avoid generic random text, avoid misspelled title text, avoid replacing 276, avoid photorealistic face, avoid colorful cyberpunk lights, avoid neon gradients, avoid glossy corporate gradients, avoid soft 3D render, avoid clean corporate UI, avoid pastel colors. 以前想复刻一张网络酷图,基本只能靠猜:猜风格、猜关键词,或者把图丢给大模型拿一个大概 prompt。 这次真正有价值的,不是提示词变长了,而是机制变了。 A 负责生成假设,B 负责监督差异;每一轮都生图、对照、打分,再把差异变成下一轮约束。 这很像生成对抗网络:一个生成,一个判别。 但这里的判别器会给出可执行反馈:人物太小、文字层级没锁住、光环位置不对、HUD 面板缺失、负向约束不足。 于是复刻不再靠玄学,而是变成一个有测试、有反馈、有验证的迭代系统。 复刻酷图的关键,不是猜中那句神秘咒语,而是搭出一个会自己逼近答案的机制。 ## 相关链接 - [Bridge Wang](https://x.com/qc777qc) - [@qc777qc](https://x.com/qc777qc) - [1.9K](https://x.com/qc777qc/status/2057327056774648108/analytics) - [Upgrade to Premium](https://x.com/i/premium_sign_up) - [1:06 PM · May 21, 2026](https://x.com/qc777qc/status/2057327056774648108) - [1,956 Views](https://x.com/qc777qc/status/2057327056774648108/analytics) - [View quotes](https://x.com/qc777qc/status/2057327056774648108/quotes) --- *导出时间: 2026/5/21 16:21:52*
S Skills从0到1:如何设计一个商用级Skill 本文分享了如何从零开始设计一个商用级AI Skill的一手实践经验。文章将Skill比作给新同事的工作说明书,详细介绍了两种设计方法(先沉淀后生成、直接调用Skill-Creator),并提出了善用GitHub寻找工具和内容分层两个迭代核心技巧。最后,作者以自动化剪辑Skill为例,拆解了视频拆解、素材匹配、配音生成和导入草稿等环节中的具体卡点与解决方案。 技术 › Skill ✍ xilo🕐 2026-07-11 SkillAI工作流自动化剪辑提示词工程Codex实战经验技能设计TTS
开 开源一个文章配图 Skill:歸藏材质插画 作者开源了一款名为“歸藏材质插画”的 Skill,旨在解决文章、汇报及教学中概念解释难的问题。该工具通过调用 GPT-Image 2.0,能将文本转化为风格统一、带中文标签的 3D 材质解释图。文章详细介绍了其在处理冷门概念检索、图表数据重绘以及防止 AI 乱写标签等方面的技术优化。 技术 › Skill ✍ 歸藏🕐 2026-07-08 AIGCClaudeAgent图像生成开源工具提示词工程数据可视化设计
逆 逆向 329 条 GPT-Image2 提示词并开源:工业级模板引擎 作者逆向分析了 329 条 GPT-Image 2 的提示词案例,并将其开源至 GitHub。项目不仅涵盖了直播、海报、拆解图等多种视觉类型,还创新性地提出了「Prompt-as-Code」理念,将视觉要素原子化为 JSON 结构,实现了 Agent 自动化调用的零配置工作流,彻底改变了传统抽卡式的出图体验。 技术 › 工具与效率 ✍ 苍何🕐 2026-05-24 GPT-Image2提示词工程开源AgentAI设计工作流自动化Codex逆向工程
我 我写提示词时,不再只靠感觉了 文章探讨了提升AI提示词(Prompt)质量的思考,对比了“情绪法”与“结构法”的区别。作者指出,单纯依赖情绪词汇虽能营造氛围但缺乏稳定性,而结构法通过定义载体、光线、构图等参数确保结果可控。最终提倡“混合法”,即用结构锁定画面骨架,再用情绪补足灵魂,将提示词从“许愿文”转化为精准的“视觉合同”。 技术 › LLM ✍ VoxCat🕐 2026-05-14 提示词提示词工程AIGC图像生成结构法情绪法工作流技巧
从 从单图到Campaign:使用GPT-v2与LTX构建视觉创意流 文章分享了作者如何利用 ChatGPT (GPT-v2) 和 LTX Studio,从一张参考图开始,一步步构建出 Gucci x Crocs 品牌概念的全过程。作者提供了完整的创意执行逻辑和五组核心提示词,涵盖了从参考图解构、品牌概念融合、情绪板制作、Brief锁定到主视觉(KV)生成的全链路工作流。该教程展示了如何利用 AI 将抽象的创意方向转化为可落地的视觉资产,并提供了现成的 LTX 项目供读者免费使用。 技术 › LLM ✍ AmirMušić🕐 2026-05-07 AI工作流ChatGPTLTX Studio提示词工程创意设计视觉营销AIGC品牌设计营销案例自动化
C Codex + Image-2 视频产出工作流分享 本文介绍了一种利用代码生成产品视频的高效工作流。通过先使用 GPT-Image-2 生成分镜预览图,确立视觉基准,再将图片交给 Codex 复刻成代码动画。该方法将视觉设计与工程实现拆分,避免了直接编写代码时的不确定性,无需剪辑软件即可产出高质量的产品演示视频。 技术 › Codex ✍ Philip Van🕐 2026-05-05 AI工作流视频生成Codex前端动效自动化提示词工程
G GPT Image 2 深度应用:个人气质分析与穿搭推荐系统实战 本文详细介绍了作者基于 GPT Image 2 开发的一套个人气质分析与穿搭推荐系统。文章重点分享了四套不同风格的 Prompt 提示词设计方案(基础款、环形款、低沉浸版、沉浸版),阐述了如何通过 AI 分析用户气质并生成 9:16 比例的高级时尚海报。内容涵盖核心逻辑、视觉结构设计、人物一致性约束及互动引导技巧,旨在帮助开发者挖掘 AI 在时尚视觉生成领域的潜力。 技术 › LLM ✍ 李岳🕐 2026-05-03 AI应用提示词工程图像生成穿搭推荐UI设计AIGC视觉设计个性化推荐产品实战创意玩法
A AI+公众号矩阵月入10w+实操工作流(2026版) 文章详细拆解了利用AI辅助运营公众号矩阵实现月入10w+的完整SOP流程。核心策略是AI承担80%重复劳动,人工专注于选题决策与内容润色,以确保符合微信平台2026年的合规要求(防封号限流)。工作流按周一至周日循环,涵盖数据诊断、AI批量生产(使用Claude/Grok等)、人工优化、矩阵分发及私域变现。变现模式包括流量主广告、软广及代运营分成。 技术 › Agent ✍ 蛋仔🕐 2026-04-17 AI工作流公众号矩阵自媒体变现提示词工程私域引流合规运营代运营AIGC副业内容创业
阿 阿里Qwen-Image-2.0发布实测:超长上下文与精准中文渲染 本文是对阿里最新发布的千问图像模型 Qwen-Image-2.0 的深度实测报告。文章详细介绍了该模型在提示词长度支持(1k token)、中文文字渲染准确性、指令遵循能力以及2K高清直出等方面的显著提升。作者通过水煮肉片菜谱、人物写真、PPT制作、信息图生成等12个具体场景的实测案例,展示了模型在复杂排版和中文语义理解上的优势,同时也指出了相较于Banana Pro在自主审美和推理能力上的不足。 技术 › LLM ✍ 苍何🕐 2026-02-14 Qwen阿里图像生成实测AIGC提示词中文渲染文生图AI绘画
P Practical multi-agent orchestration in Codex 文章介绍了Codex中多智能体编排的实际应用,包括如何通过Sol和Terra模型协调任务、分配角色以及管理上下文继承。还提供了实用技巧,如使用Skill模式优化智能体协作和调整推理工作量。 技术 › Codex ✍ eric provencher🕐 2026-07-25 多智能体CodexSolTerra任务编排智能体协作推理工作量上下文继承Skill模式
从 从搜索词到内容发布:小红书自动化获客流水线搭建教程 本文详细介绍了如何利用 Codex、飞书多维表格和 TikHub 搭建小红书内容获客自动化流水线。文章强调了“先明确用户画像、再寻找痛点关键词、最后进行内容生产”的正确顺序,避免盲目生成无效内容,并提供了从选题挖掘到自动发布的完整工作流。 技术 › Agent ✍ aix阿乐🕐 2026-07-23 自动化小红书Codex获客内容营销TikHub飞书AI工作流用户画像SEO
图 图书解读视频制作教程与实践案例 文章介绍了如何利用 Codex、AI 图片、AI 配音和 HyperFrames 制作 60-90 秒的中文图书解读短视频。作者以《活着》为例,详细分享了选书、脚本写作、图片生成约束、声音选择、字幕对齐及剪辑转场等全流程,并将经验封装成 Skill,为想做自媒体的人提供了一条不露脸、低门槛的内容创作路径。 技术 › Skill ✍ Smartpig🕐 2026-07-21 AI视频图书解读CodexHyperFrames自媒体工作流自动化AIGC短视频教程