# 朋友想省几千块设计费,我用 GPT-Image-2 + XCrawl 搭了一套 AI 主图流程
**作者**: AI奶爸
**日期**: 2026-05-06T00:28:56.000Z
**来源**: [https://x.com/zstmfhy/status/2051821481995407437](https://x.com/zstmfhy/status/2051821481995407437)
---

前几天一个做电商的朋友找我,说他准备上一批天然蜂蜜产品,想让我帮他搭一套 AI 主图流程。
他的原话很现实:
> 找设计师做一套包装视觉和电商主图,便宜的看不上,能看的又太贵。一个 SKU 几千块,十几个 SKU 跑下来,钱还没开始赚,图先烧掉好几万。
他的需求也很明确。
不是要一张炫技图,而是要一套能反复跑的流程:
- 输入一个品类,比如蜂蜜、咖啡、护肤品
- agent 自动去找高质量设计参考
- 把参考图、风格标签、商品信息整理好
- 最后丢给 GPT-Image-2 出一组能上架、能投流、能卖货的主图
我一开始以为难点在 prompt。
结果跑完发现,真正花钱的地方,根本不是那句提示词。
同一句:
> 日式天然蜂蜜玻璃瓶包装,黑熊吉祥物
裸跑出来的图,能用,但很像超市里十几块钱一瓶的普通货。
但如果给 GPT-Image-2 加上 5 张 Behance 上成熟包装项目的参考图,结果立刻变成另一种档次:更像品牌稿,更有溢价感,也更接近设计师会交付给客户的东西。
那一刻我意识到:
GPT-Image-2 时代,真正值钱的不是 prompt,是参考图工作流。
## 一、为什么是参考图,不是更好的 prompt
GPT-Image-2 出来这两周,时间线上半个圈的人都在试。
测下来的共识应该差不多:美学比 nano banana 能打,提示词难度反而下降一截。
以前在 nano banana 上,你可能要写两百字,堆满风格词,再加各种 negative。
现在 image-2 你写一句:
> 现代极简风的保温杯,纯白背景
就已经有得看。
但这也带来一个新问题:当模型基础美学已经足够强,继续卷 prompt 的边际收益其实在下降。
你真正要卷的,不是“怎么把一句话写得更玄学”,而是“怎么给模型更好的视觉样本”。
文字描述美学,本质上是有损压缩。
参考图,才是高质量样本。
这件事在 Stable Diffusion 时代我们就懂。ControlNet 永远比 prompt engineering 更接近控制。GPT-Image-2 没有改变这个规律,只是把基础美学拉高了,让普通人更容易看见参考图的价值。
我这次做的是同一个蜂蜜品牌、同一个 GPT-Image-2、同一个核心 prompt:
- 裸 prompt:能用,但很日常
- prompt + 5 张同类参考图:直接接近设计师作品级别


上图就是我跑的真实对比。同一个品牌(AI 奶爸天然蜂蜜),同一个 image-2,左边裸 prompt,右边给了 5 张 Behance 上一个日本设计工作室 Pinch & Punch 做的 Chikuma Honey Packaging 项目作为参考——视觉档次差距一眼能看出来,第一张图跟那些超市里面 10 快钱一瓶的没差别,第二张图这个一看就可以贵很多,而且孩子喜欢,有童趣,设计感拉满。
所以问题变成了:
怎么大规模、自动化地拿到对的参考图?
## 二、以前找参考图,为什么这么痛
我以前找参考,大概就三种方式。
第一种,浏览器手工扒。
打开竞品站、搜索、一张张右键存图、改名分类。30 张图 1 小时起。最低效,但最常用。
第二种,自己写 Python 爬虫。
能写,但维护成本很高。一年里反爬规则改几次,代理池要自己维护,单 IP 一个月几十刀。爬一周下来,花在防封和修 bug 上的时间,可能比真正抓数据还多。
第三种,headless Chrome / Playwright。
看起来很自动化,但对方一上 Cloudflare 就跪。住宅代理要自己买,指纹要自己调,维护成本经常是工具本身的好几倍。
这三种方式有一个共同问题:
它们都把“找参考”当成一次性小任务。
但只要你认真做 AI 出图,找参考就不是一次性的。
每个新项目、每个新风格、每个新品类,都要重新找一遍。
这也是我为什么把 XCrawl MCP 接进 Claude Code。
我要的不是一个“能抓网页”的工具,而是让 agent 把“找参考图”这件脏活,变成工作流里的一个自动子任务。
## 三、接入很简单:一行命令
API key 在这里注册就能拿:
https://xcrawl.com/?keyword=no64ek5v
Pay as you Go,注册送 1000 credits 免费额度。
这篇教程完整跑通一次大概 11 credits,单次完整 scrape 约 5 credits,1000 credits 足够你测很多轮。
终端里跑:
claude mcp add xcrawl --url https://mcp.xcrawl.com/你的KEY/mcp
把“你的KEY”换成真实 key。
注意:不要带花括号,直接拼到 URL 里。

然后打开 Claude Code,输入:
/mcp
看到 xcrawl 在列表里,就接好了。
Cursor、VS Code、Claude Desktop 也能接,只是配置写法不同,文档在:
https://docs.xcrawl.com
这里先说一个边界:
XCrawl 只抓公开页面。登录态后、付费墙后、私密内容,它不碰。
这反而是我敢把它放进工作流的原因。做 AI 自动化,工具能力很重要,但边界更重要。
## 四、完整工作流:Behance 参考图到 GPT-Image-2 主图
我这次的目标,是给朋友的蜂蜜产品做电商主图。
但参考源我没选淘宝、拼多多、1688。
原因很简单:大家都在扒同行商品页,最后只会把图卷成同一种低端电商味。
真正有杠杆的做法,是去 Behance / Dribbble 这种设计站,抓已经经过审美验证的品牌设计和包装设计,让 GPT-Image-2 把你的商品图档次直接抬上去。
成本还是几毛钱,但视觉上会换一档。
Step 1:先抓一个具体项目页
我先挑了一个具体项目:
Pinch & Punch 做的 Chikuma Honey Packaging。
这是一个日本长野县蜂蜜品牌包装项目,有黑熊吉祥物,风格很适合我朋友的天然蜂蜜产品。
在 Claude Code 里直接说:
```
用 xcrawl 的 scrape 工具抓 https://www.behance.net/gallery/245101437/Chikuma-Honey-Packaging
输出 markdown
抽取 title / designer / description / tags[] / images[] / tools[]
```
agent 会调用:
```
{
"name": "xcrawl_scrape",
"arguments": {
"url": "https://www.behance.net/gallery/245101437/Chikuma-Honey-Packaging",
"output": {
"formats": ["markdown"]
}
}
}
```
回来之后能拿到:
- title: Chikuma Honey Packaging
- designer: Pinch & Punch
- tags: branding / packaging / brand identity / honey / Japanese design / mascot
- images: 21 张高清原图 URL
- tools: Adobe Photoshop / Illustrator / After Effects
单页 5 credits 消耗(base 1 + json_extract 4)。
> 💡 真踩坑 1:xcrawl_scrape 默认开 js_render.enabled=true,但对 Behance 这种 SPA 站点,必须显式加 wait_until: networkidle 才能等到图片懒加载完成——一次拿全 21 张,不需要二次重跑。
> 💡 真踩坑 2:output.formats: ["json"] + JSON schema extraction 在当前 Claude Code MCP 适配下不透传 data.json 字段——API 端扣了 4 credits 但响应里没有 JSON。保险姿势:只要 ["markdown"],自己 parse,省 4 credits/次。这条没人教我,跑两次才发现。

这里有两个真实踩坑:
第一,Behance 这种 SPA 站点,必须显式加 wait_until: networkidle,否则懒加载图片拿不全。
第二,output.formats: ["json"] 在当前 Claude Code MCP 适配里不一定稳定透传 data.json 字段,API 端可能扣了 json_extract credits,但响应里没有 JSON。更保险的做法是只要 markdown,再让 Claude Code 自己 parse。
Step 2:批量发现同类高质量项目
单个项目能抓通之后,我继续让 agent 去找更多日系包装风格项目。
一开始我想用 xcrawl_map 扫 Behance 搜索页:
https://www.behance.net/search/projects?search=japanese%20stationery
结果翻车了。
返回的是 Behance 全站“最新发布”的 50 个 URL,根本不是日系搜索结果。
原因是 Behance、Pinterest、Dribbble、Instagram 这类站点的搜索页经常是客户端 SPA 路由。map 抓的是初始 DOM,那时候搜索结果还没渲染,工具就把首页 feed 当成 sitemap 返回了。
正确姿势是:
用 xcrawl_scrape 抓搜索页
wait_until: networkidle
从渲染后的 markdown 里用正则 /gallery/\d+/[^\s\)]+ 提取项目 URL
这次回来 24 个真实日系包装 / 品牌项目,比如:
- The Tokyo Restaurant
- Japanese Food Menu Design
- Chikuma Honey
- umi clothing brand
- Sando
- Fuji Coffee House
- Ramenoya
- FISHI Japanese Restaurant

但这里也要注意:搜索结果不是 100% 干净。
Behance 搜索里大概会有 20% 到 30% 噪声,比如 promoted 广告位、通用 mockup 模板、相关度不高的 branding 项目。
我的做法是让 Claude Code 再过一道筛选:
根据标题、描述、设计师、标签,筛掉通用模板和低相关项目,只保留日本包装、天然食品、品牌识别相关的案例。
这一步很适合 agent 做。
人手工筛 24 个项目会烦,agent 处理这种结构化判断很快。
Step 3:把参考图变成 GPT-Image-2 的输入
最后一步,就是把“参考”转化成“新图”。
我从 Chikuma 那 21 张图里挑 5 张视觉信息量最高的静帧,跳过 GIF,然后给 GPT-Image-2 这样的 prompt:
```
基于以下参考图的视觉风格、色彩调性、字体感觉,
设计一款新的日本天然蜂蜜玻璃瓶包装。
保留参考的构图节奏和品牌识别风格,
主体改为我自己的蜂蜜品牌:
AI 奶爸 · 北海道天然はちみつ。
要求:
完美电商背景,
适合商品主图,
画面干净高级,
1024x1024。
```
再附上 3 到 5 张同一项目里筛出来的参考图 URL。



输出结果就是开头那组对比。
单张 GPT-Image-2 出图约 4 美分,几张参考图就能把模型美学潜力释放到接近设计师手稿的水平。
这一步真正的杠杆,不是“随便找几张好看的图扔进去”。
真正有用的是:
结构化数据 → 结构化参考 → 结构化 prompt。
同一个项目里挑出来的参考图,视觉语言一致。
再加上抽出来的设计标签、品牌信息、输出规格,稳定性会比手工乱丢参考高很多。
## 五、这笔账怎么算
这套流程帮朋友省下来的,不是“一张图多少钱”。
真正省的是第一轮设计探索成本。
以前找设计师做一套能看的电商包装视觉,一个 SKU 几千块很正常。
更麻烦的是,第一次沟通常常不知道要什么风格,只能反复说:
“高级一点。”
“再日系一点。”
“不要这么淘宝。”
“能不能更像品牌?”
这些话对设计师和客户都是折磨。
现在先用 GPT-Image-2 + 高质量参考图跑 20 到 50 个方向,几块钱就能把审美空间铺开。
朋友不一定最终直接拿 AI 图上架,但他至少可以拿着这些方向去判断:
- 哪种包装调性更适合产品
- 哪种视觉更有溢价感
- 哪些元素适合进入正式设计
- 哪些图可以直接做投流素材测试
所以这里省下来的几千块,不是“AI 替代设计师”的钱。

我这次完整跑通这个工作流,总消耗 11 credits(Chikuma 单页 5 + Behance 搜索 5 + key_status 1),1000 免费额度还剩 989。
不是吹"AI 多厉害"——是把以前工作流里**最不性感、最贵、但被低估的那一步(找参考)**用 agent + MCP 自动化掉。
## 六、我踩过的 7 个坑
这些坑你可以直接抄走。
1. wait_until: networkidle 必加。Behance 这种 SPA 站点不加这个参数,懒加载图经常拿不全。
2. output.formats: ["json"] 在当前 Claude Code MCP 适配里不一定稳定。保险做法是只要 markdown,再自己 parse。
3. SPA 搜索页别无脑用 xcrawl_map。map 只看初始 DOM,容易把首页 feed 当成搜索结果。
4. ignore_query_parameters: true 不是无脑开。对 ?search=... 这种真实路由参数,开了反而会把关键词砍掉。
5. 位置参数要对应目标站地区。抓美区站用 location: "United States",日区内容尽量用日本,指纹更自然。
6. 批量任务前先跑 xcrawl_key_status。免费额度够测,但批量抓之前先看余额,别跑一半中断。
7. VS Code 集成如果遇到 JSON schema 校验导致 MCP 加载失败,可以先关掉 VS Code 的 JSON validation。Cursor、Claude Code、Claude Desktop 这边相对顺。
## 七、谁适合把这套接进工作流
做 AI 出图、漫剧、绘本的人适合。
参考图驱动 GPT-Image-2,输出可用率会明显高于纯 prompt。
做电商主图的人适合。
不要只扒同行商品页。去 Behance / Dribbble 抓成熟设计,把商品视觉从“货架图”往“品牌图”抬。
做行业情报和 RAG 数据集的人适合。
公开站点结构化抓取之后,可以直接清洗、入库、喂向量库。
给企业做 AI 落地的人也适合。
客户行业 top 10 站点抓一轮,当天就能整理出初版行业知识库和参考素材库。
但如果你只是一次性抓一个单页,浏览器复制粘贴可能更快。
如果你想抓登录态后、付费墙后、私密内容,XCrawl 不适合,也不应该这么用。
## 八、最后说一句
GPT-Image-2 出来之后,时间线上每个人都在分享 prompt 模板。
但我现在越来越确定:
prompt 决定下限,参考图决定上限。
会写 prompt,说明你会用 AI。
能自动找到对的参考图、筛掉噪声、整理成结构化输入,再让 agent 接着往下跑,说明你能用 AI 干活。
这就是区别。
我把 XCrawl 接进 Claude Code,不是为了“抓网页”而抓网页。
它在我的工作流里只干一件事:
把找参考这件最脏、最慢、最容易被低估的事,自动化掉。
朋友想省几千块设计费,我最后帮他省下来的不只是钱。
更重要的是,他以后每上一个新品类,都不用从零开始找风格、找图、找感觉。
流程已经在那里了。
输入品类,agent 找参考,GPT-Image-2 出方向。
这才是 AI 工作流真正有用的地方。
想试的:
注册拿 key:https://xcrawl.com/?keyword=no64ek5v
文档:https://docs.xcrawl.com
接进 Claude Code 一行命令:
claude mcp add xcrawl --url https://mcp.xcrawl.com/你的KEY/mcp
今晚就能跑通。
## 相关链接
- [AI奶爸](https://x.com/zstmfhy)
- [@zstmfhy](https://x.com/zstmfhy)
- [1.1K](https://x.com/zstmfhy/status/2051821481995407437/analytics)
- [https://xcrawl.com/?keyword=no64ek5v](https://xcrawl.com/?keyword=no64ek5v)
- [https://mcp.xcrawl.com/](https://mcp.xcrawl.com/)
- [https://docs.xcrawl.com](https://docs.xcrawl.com/)
- [https://www.behance.net/search/projects?search=japanese%20stationery](https://www.behance.net/search/projects?search=japanese%20stationery)
- [https://xcrawl.com/?keyword=no64ek5v](https://xcrawl.com/?keyword=no64ek5v)
- [https://docs.xcrawl.com](https://docs.xcrawl.com/)
- [https://mcp.xcrawl.com/](https://mcp.xcrawl.com/)
- [Upgrade to Premium](https://x.com/i/premium_sign_up)
- [8:28 AM · May 6, 2026](https://x.com/zstmfhy/status/2051821481995407437)
- [1,112 Views](https://x.com/zstmfhy/status/2051821481995407437/analytics)
---
*导出时间: 2026/5/6 09:12:24*