零成本 AI 生图,从安装到变现 ✍ Miles.Ma🕐 2026-07-19📦 13.1 KB 🟢 已读 𝕏 文章列表 文章探讨了在 MacBook Pro 上运行 ComfyUI 进行本地 AI 生图的实战经验。作者详细解析了潜空间扩散、提示词机制及模型工作原理,对比了 SDXL Turbo、FLUX 和 Qwen Image 等模型的优劣。文章提出了一套利用本地模型配合云端 API 的混合工作流,旨在低成本实现高质量出图,并介绍了商品场景图、封面配图等商业变现路径。 AI生图ComfyUIStable DiffusionFLUX本地部署工作流变现SDXLTurbo生图技巧 # 零成本 AI 生图,从安装到变现 **作者**: Miles.Ma **日期**: 2026-07-18T11:33:13.000Z **来源**: [https://x.com/ma_zhenyuan/status/2078442964951728517](https://x.com/ma_zhenyuan/status/2078442964951728517) ---  我第一次在 MacBook Pro 上跑 ComfyUI,模型下载了六个多 GB,打开工作流,折腾到 SDXL Turbo 真正跑起来,第一张图大约十几秒出现在屏幕上。 我紧接着冒出的疑问是:一张图好不好,到底靠提示词,还是靠模型? 这也是研究本地生图最容易绕进去的地方。 我们总想找到一段神奇提示词,或者下载某个据说能平替 Nano Banana 2、ChatGPT Images 2.0 的模型。 跑过几套工作流以后,我的判断很直接:模型决定能力上限,提示词负责指方向,工作流负责把能力稳定地用出来。 三层缺一层,出图就不稳定。 低成本接近云端模型,也要沿着这三层往下做。只研究提示词,最后大多是在一个旧模型的能力边界里反复抽卡。 # 一张图并不是直接从像素里"画"出来的 理解 ComfyUI,先要放下一个直觉:模型生成图片的时候,没有直接盯着一张 1024×1024 的画布逐个填像素。 一张普通 RGB 图片,每个像素都有红、绿、蓝三个数值。分辨率一高,模型要处理的数据就迅速膨胀。Stable Diffusion 走了一条更省算力的路:先用 VAE 把图片压到一个更小的隐藏空间,在那里完成最耗计算的生成过程,最后再还原成我们能看到的图。 这个隐藏空间就是常说的 latent,中文一般叫潜空间。 你可以把 VAE 想成一套压缩-还原系统。Encoder 把图压进 latent,Decoder 再把 latent 解码回像素。它能舍弃不重要的细节,保留轮廓、颜色、空间关系和纹理。同一个 latent 换一个 VAE 解码,颜色、对比度和皮肤质感都会变。 VAE 太弱,隐藏空间里已经做对的内容,回到像素世界时还是会糊掉或者偏色。 生图能在消费级显卡上跑起来,latent diffusion 是关键原因之一。 模型不必在几十万个像素上反复计算,只在这个被压缩的空间里干活。 # Stable Diffusion 到底在扩散什么 扩散模型的训练方法听起来有点反直觉。 训练的时候,它先拿到真实图片的 latent,然后不断往里加高斯噪声,直到原来的内容几乎认不出来。模型在大量样本上只学一件事:面对某个噪声程度的 latent,里面混进了哪些噪声,应该往哪个方向还原。 生成的时候反过来。系统从一团随机噪声开始,按若干个时间步一点点去噪。最初只是模糊的明暗块,接着出现大致构图,再往后才是脸、衣服、材质、光线和局部纹理。最后得到的仍然是 latent,经过 VAE Decoder 才变成真正的图片。 ComfyUI 里的 sampler 和 scheduler 控制的就是这个去噪路线。Scheduler 决定每一步的噪声水平,Sampler 决定怎么从当前 latent 走到下一步。Euler、DPM++ 是不同的数值求解方法。步数多不一定好。Turbo 模型你强行跑几十步,可能只是花更多时间重复它不擅长的事。 我最早跑通的 SDXL Turbo,就是一个很典型的例子。普通 SDXL 往往需要二三十步甚至更多,Turbo 通过蒸馏把原来多步去噪的能力压到一到四步。我的入门工作流只跑一步,CFG 也是 1。它的意义是快,适合预览构图、学节点、低成本批量试错。代价也明显:复杂空间关系、手部、细小的文字和精确控制,通常不如完整的高质量模型。 # 提示词是怎样进入一张图的 噪声知道自己要变干净,却不知道应该变成一只狗、一台咖啡机,还是一条下雨的上海街道。文字条件在这里进入系统。 Stable Diffusion 里的 CLIP Text Encoder 先把提示词切成 token,再把 token 变成一组向量。向量不保存字面排版,它保存的是模型学到的语义关系。"狗"和"幼犬"的位置比较接近,"狗"和"电冰箱"离得更远;"清晨逆光""商业产品摄影""红色金属外壳"也会形成各自的语义表示。 这些文字向量通过 Cross-Attention 进入去噪网络。模型处理画面某个位置的时候,会计算这里应该关注提示词中的哪些部分。画面中央的特征可能更关注"银色咖啡机",左侧区域更多关注"留出干净空间",背景区域则关注"深灰色现代厨房"。 文字没有变成一张草图,它是在每一次去噪中持续改变模型的注意方向。 提示词能帮模型选主体、定构图、调光线和风格。但它没法补上模型根本没学会的能力。 不擅长中文排版的模型,不会因为你加了"文字必须百分之百准确、8K、杰作"就变成专业设计师。人物一致性不足,重复十遍"保持人物一致"也只是略微改善。 CFG 是另一种文字引导方式。它比较"有提示词"和"没有提示词"时的去噪方向,再把差异放大。普通 Stable Diffusion 常用较高的 CFG,让画面更紧贴文字,但数值过高会造成颜色发硬、对比度过强和画面失真。SDXL Turbo 已经针对低 CFG 蒸馏,继续套用老模型常见的 7 或 8,结果反而容易坏。 提示词值得研究,但它更像导演给演员讲戏。 演员的能力、外形和训练决定了能演到哪里,导演说得清楚可以少走弯路,不能让任何演员立刻掌握所有角色。 # ChatGPT Images 2.0 到底强在哪 本地模型和新一代云端模型的差距,早就不在画面锐不锐、脸像不像了。 ChatGPT Images 2.0 的定位是原生多模态图片模型。它能同时接收文字和多张图片,在对话中持续修改,还利用世界知识理解你提到的地点、物体和现实关系。你可以给它一张草图、一张参考图、一张产品照片和一段自然语言,它先理解这些材料之间的关系,再生成或修改图。 这类产品背后是一整套系统。 它要理解语言和参考图,判断哪些内容该保持,处理世界知识和空间关系,再交给图像模块生成。复杂任务还可能经过推理、搜索和多轮修正。网页里只有一个输入框,后面却不只挂着一个 checkpoint——它可能先调一个模型理解你的草图,再切另一个处理材质,最后再调一个做风格迁移。 完全在本地复刻 ChatGPT Images 2.0,目前不现实。 真正能做的事是拆开它的能力:哪个本地模型负责理解,哪个负责生成,哪个负责编辑,哪些交给局部重绘和确定性工具。拆得越清楚,接近它的成本越低。 # 本地模型已经走到了哪一步 SDXL Turbo 适合入门,不适合承担最终上限。想把本地画质往前推,模型至少要升级到 FLUX 和 Qwen Image 这一代。 FLUX.2 Dev 是 32B 级图像模型,擅长高分辨率写实、多参考图、结构保持和编辑。 它能理解需要保留的人物、服装、材质和商品几何结构,做产品广告和人物换场景的时候更接近现代云端模型的效果。注意,它的权重许可需要在商业使用前认真核对。如果你打算接商单,这一步不能跳。 FLUX.2 Klein 9B 更适合做快速版本。 体积小、蒸馏步数少,可以承担草图、批量构图和普通编辑。方向确定以后,再切到 Dev 版本做最终图。这个分工比每一次试错都调最大模型省得多。 Qwen Image Edit 更适合中文场景和精确编辑。 它建立在 20B 模型上,输入图同时进入视觉语言模型和 VAE Encoder:前者理解内容,后者保留外观。它能听懂"把杯子换成玻璃材质"这类修改,也尽量维持人物、字体和整体样貌。 这些模型放在 128GB 统一内存的 Ryzen AI Max+ 395 MiniPC 上,已经具备运行条件。能跑不等于几秒交付,它更适合个人生产、夜间批处理、隐私素材和重复任务。 一张图跑一分钟还是五分钟,对商单交付来说区别很大。你报价的时候要把这个时间算进去。 # 真正省钱的是工作流分工 让我搭的话,我不会让一个模型包办所有事。 第一遍用 FLUX.2 Klein 或其他快速模型做 768 到 1024 分辨率的草图,只判断主体位置、画面比例、光线和颜色。提示词保持清楚就行,不需要堆满"超高清、杰作、获奖摄影"之类的词。 方向确定以后,写实内容交给 FLUX.2 Dev,中文海报、人物和商品修改交给 Qwen Image Edit。有人物或产品参考图的时候,直接把图交给模型,明确写出改什么、保留什么。这种自然语言指令比几十个零散关键词有效得多,因为新一代模型本来就在学自然语言编辑。 局部出错,只重绘局部。手指、Logo、衣服纹理有问题,就用遮罩圈定区域做 inpainting。整张重新生成会破坏已经正确的脸、构图和产品结构,也会重新消耗一次完整推理时间。局部修改是本地工作流追上云端编辑体验的关键一步。 客户说"Logo 再大点",你不想整张图重跑一遍。 画面稳定后再放大一到两倍。标题、价格、二维码和长段中文,交给排版工具。Photoshop、Canva、Figma,哪个顺手用哪个。确定性排版才能保证每个字和位置正确,否则改错一个字,人物和背景也可能跟着一起重抽。 每个成熟工作流还要保存模型版本、提示词、参考图、seed、采样器、步数、CFG 和最终参数。ComfyUI 真正的价值就在这里。 节点图看起来麻烦,却能把你某一次偶然跑出来的好结果变成可复现的流程。下次换商品、换人物、换主题,只改几个开放出来的输入参数,不用重新摸索整条链路。 # 本地方案能接近到什么程度 如果任务是写实人物、商品场景、封面配图、风格化海报和有参考图的局部编辑,一套搭配合理的 FLUX + Qwen Image + 局部重绘 + 放大的工作流,已经能做出相当接近 ChatGPT Images 2.0 的结果。 对于需要反复生成的固定业务,本地方案还多出隐私、可控和边际成本低的优势。 遇到密集中文排版、复杂信息图、需要真实世界知识推理、多个人物长期保持一致、十几轮连续修改这些场景,本地方案会明显吃力。模型偶尔做对一次不等于形成了稳定的生产能力。商业交付看的是十次、百次任务里的成功率和返工时间。 我倾向一套混合方法:大多数试错、普通生图、隐私编辑和批量任务放在本地,真正困难的最终版本偶尔调 ChatGPT Images 2.0 的 API。 云端从主力生产工具变成最后一道补位,整体费用会降很多。本地模型继续进步以后,再缩小这部分比例。 # 这套东西,怎么变成钱 商品场景图是最容易入手的。独立站卖家、淘宝店主、跨境电商,都需要产品放在不同场景里的图。一套模板搭好,换产品只改变量,十分钟出一组。 封面配图是另一块。公众号、小红书、X 长文、播客封面,尺寸和风格相对固定,本地模型跑完主体画面,排版工具压文字。客户觉得值,因为你省了他找设计师排期的时间。 风格化人像是高客单价路数。证件照换背景、写真风格迁移、动漫头像定制,淘宝和小红书上需求一直有。本地模型的真正优势是隐私——客户的照片留在你的硬盘上,不上传任何云端服务器。 接单渠道不需要独家资源。淘宝闲鱼开店、小红书发案例、独立站 SEO、熟人转介绍、设计师社群接二手单,五个渠道轮着来,单量不会断。关键是你的作品集要能让人一眼看出"这图能用",而不是"这图很艺术"。 定价方面,按工时倒推。先算你跑一张满意图平均要多久,加上沟通和修改时间,乘以你给自己定的时薪,就是底价。别按"AI 生图所以便宜"的逻辑定价——客户买的是结果,不是你消耗的显卡时间。 回到最开始的问题,一张高质量图片靠提示词还是靠模型? 模型给出上限,工作流决定稳定性,提示词负责方向。 VAE 决定图片如何进入和离开潜空间,文字编码器让模型理解你的要求,扩散模型在 latent 里把噪声还原成结构,Sampler 决定每一步怎么走。最后的局部重绘、放大和排版,才把一张"AI 生成图"变成能交付的成品。 本地生图这件事,没必要在家里复制 OpenAI 的整个系统。你只需要把自己反复用的那一段能力拆开、选对模型、固定流程。 云端模型追求什么都能做,本地模型真正划算的地方,是把一类事情越做越稳。 稳了,就能收钱。 ## 相关链接 - [Miles.Ma](https://x.com/ma_zhenyuan) - [@ma_zhenyuan](https://x.com/ma_zhenyuan) - [44K](https://x.com/ma_zhenyuan/status/2078442964951728517/analytics) - [Upgrade to Premium](https://x.com/i/premium_sign_up) - [7:33 PM · Jul 18, 2026](https://x.com/ma_zhenyuan/status/2078442964951728517) - [44K Views](https://x.com/ma_zhenyuan/status/2078442964951728517/analytics) - [View quotes](https://x.com/ma_zhenyuan/status/2078442964951728517/quotes) --- *导出时间: 2026/7/19 18:46:19*
零 零成本 AI 生图,从安装到变现 本文探讨了在 MacBook Pro 上使用 ComfyUI 进行本地 AI 生图的经验。文章解析了 Stable Diffusion 的原理,指出模型决定上限、提示词指导方向、工作流保障稳定性。作者对比了本地模型(如 FLUX、Qwen Image)与云端 ChatGPT Images 2.0 的差异,并提出了混合工作流策略,最后分享了商品场景图、封面配图等变现路径。 技术 › AI应用 ✍ Miles.Ma🕐 2026-07-19 ComfyUIStable DiffusionFLUXAI生图本地部署工作流变现潜空间VAE图像模型
C ComfyUI 节点图劝退?让 Codex 替你学就行(67 个工作流直接抄) 文章介绍了一种无需深入学习 ComfyUI 复杂节点即可实现 AI 绘图和视频生成的方法。作者利用 Codex Agent 结合 Hermes 的 ComfyUI Skill,通过自然语言指令驱动本地 ComfyUI 运行,避开了繁琐的节点参数配置。文章提供了包含 67 个现成 Workflow 的 GitHub 资源,覆盖文生图、电商修图、视频生成等场景,并详细讲解了从环境配置到出图的全流程及常见坑点,降低了本地图/视频生成的门槛。 技术 › 工具与效率 ✍ Wei🕐 2026-05-21 ComfyUICodexAI绘图Agent工作流HermesFLUXStableDiffusionAIGC本地部署
我 我测试了5个声音克隆项目,最后留下了这一个 本文分享了作者在制作AI视频过程中,从使用MiniMax云端API转向本地部署IndexTTS2的实践经验。作者详细对比了两者在中英混排发音、音频格式、离线能力、声线一致性及成本等方面的优缺点,最终选择了IndexTTS2以保障视频工作流的可控性与稳定性。 技术 › TTS ✍ 雪踏乌云🕐 2026-07-29 声音克隆IndexTTS2MiniMax中英混排AI视频本地部署工作流音频处理
一 一个人的 AI 视频生产线:从 MiniMax 到本地声音克隆与数字人 文章详细记录了作者构建个人 AI 视频生产线的全过程。包括从 MiniMax 云端声音克隆迁移到本地 IndexTTS2 以降低成本和延迟,解决参考音频漂移问题;接入 HeyGen 数字人实现虚拟分身,并通过脚本自动化视频合成与人脸裁切。文章分享了具体的代码配置、生产流程(脚本、配音、字幕、合成)以及避坑指南,适合高频视频创作者参考。 技术 › 视频生成 ✍ 雪踏乌云🕐 2026-07-28 AI视频声音克隆IndexTTS2HeyGen数字人FFmpeg工作流Mac开发本地部署TTS
C Codex + Hyperframes + HeyGen +声音克隆:零基础自媒体变现全开源 作者分享了利用 Codex、Hyperframes、HeyGen 和 IndexTTS2 等工具构建的自动化视频工作流,实现了零基础、低成本的短视频制作与变现。文章详细介绍了各工具的选型理由、工作流架构及成本账单,旨在帮助读者通过 AI 技术解决内容生产的效率问题。 技术 › 工具与效率 ✍ 雪踏乌云🕐 2026-07-27 AI自媒体视频制作HeyGen声音克隆CodexHyperFrames自动化变现工作流
2 2026 年下半年靠 AI 赚钱的逻辑变了 文章回顾了 2023 至 2026 年 AI 商业模式的演变,指出市场已从卖「会用」、卖「接起来」转向卖「结果」。AI 能力日益廉价,对具体业务结果负责则愈发昂贵。无论是企业服务还是自媒体,真正的机会在于深入具体业务,解决昂贵且可测量的问题,而非单纯贩卖工具或流量。 职场 › 职业发展 ✍ 艾略特🕐 2026-07-23 AI商业模式职业发展自媒体副业Agent咨询结果导向工作流变现
打 打造爆款短视频的AI Agent实战 作者分享了如何构建一个能自动制作爆款视频的AI Agent。该代理通过分析数据寻找热门格式,利用Kimi、Seedance等工具自动完成脚本、剪辑和分发,并根据反馈自我优化。月成本仅111美元,收入达14700美元,实现了全自动化的内容生产闭环。 技术 › Agent ✍ Fokki🕐 2026-07-23 AI Agent短视频自动化KimiSeedance变现工作流视频生成
用 用 ima 搭建公众号爆款选题库系统 文章介绍了如何利用 ima 工具搭建公众号爆款选题库,解决创作缺乏灵感和资料杂乱的问题。通过建立爆款文章、用户问题、个人案例等分类,结合选题备注和五步写作流程,实现从资料到内容的高效转化。这套系统不仅提升内容生产效率,还能通过知识付费实现商业变现,将时间沉淀为可复用的内容资产。 技术 › 工具与效率 ✍ 文子🕐 2026-07-14 ima公众号选题库内容创作AI工具知识库个人品牌变现工作流复盘
A AI 内容创作变现零基础入门指南 这是一篇面向零基础的 AI 内容创作变现指南。文章提出内容创作的核心在于“选题”和“定版”,而重复劳动可由 AI 接管。作者系统拆解了短文、长文、图片、短视频、长视频五种内容形式的变现路径,详细阐述了如何利用 AI 进行新闻稿写作、评测分析、电商设计及视频翻译搬运,并附有具体的实操流程和爆款案例。 技术 › 工具与效率 ✍ Ren🕐 2026-07-13 AIGC内容创作变现工作流短文写作AI绘图视频剪辑零基础教程自媒体工具推荐
大 大二学生借助 Agent + Obsidian 搭建 OPC 赚钱系统 文章详细介绍了大二学生安十一如何利用 Agent 和 Obsidian 搭建“一人公司(OPC)”赚钱系统,半年变现 6 万+。内容涵盖 OPC 的前端获客、中端转化与后端交付闭环,以及如何利用 Obsidian 构建 AI 知识库作为 Agent 的“记忆中枢”,实现课程制作与定制咨询两套后端收入的自动化工作流。 技术 › Agent ✍ 安十一 (程序员小灰)🕐 2026-07-13 OPC一人公司AgentObsidian知识库副业变现工作流个人IP
终 终于!!AI Agent 也能开口说话了:这个开源工具把语音克隆、听写、MCP 全打通 文章介绍了一款名为 Voicebox 的开源 AI 语音工作室工具。它不仅支持语音克隆、生成和全局听写,更关键的是通过内置 MCP Server,让 Claude Code、Cursor 等 AI Agent 能够调用本地语音层,实现“能听、能说”的交互闭环,弥补了 Agent 只能文字交互的短板。 技术 › TTS ✍ AFei Liang🕐 2026-07-08 VoiceboxMCP语音克隆Agent开源听写Claude本地部署AI语音工作流
B Blender + Seedance 王炸组合:精准控制(附20种玩儿法) 文章深入探讨了 Blender 与 Seedance 结合的工作流,展示了如何从“写 Prompt 猜镜头”转变为“导演一个镜头”的精准控制模式。核心在于利用 Blender 的灰盒预演、Camera Blocking、角色调度等功能生成参考视频,再通过 Seedance 生成高质量画面。文章涵盖了 25 个真实案例,包括 Blender MCP 自动化、Mixamo 动作结合以及多工具 Pipeline,并提供了速查表和失败案例分析,为 AI 视频创作者提供了从单点技巧到完整管线的实用指南。 技术 › AIGC ✍ 林悦己Cheer🕐 2026-07-01 SeedanceBlenderAI视频工作流3D制作MCPCamera BlockingComfyUIMixamoAgent