把照片变成真实逐笔手绘视频 ✍ 多肉|AI 内容增长架构师🕐 2026-07-20📦 8.2 KB 🟢 已读 𝕏 文章列表 文章介绍了作者如何不使用视频模型,通过生成目标图、语义分割规划和真实笔刷引擎,将照片转换为真实的逐笔手绘视频。项目目前自评85分,后续计划整理成Skill并开源。 AI手绘视频技术实现MediaPipe笔刷引擎开源Skill # 把照片变成真实逐笔手绘视频 **作者**: 多肉|AI 内容增长架构师 **日期**: 2026-07-20T11:44:52.000Z **来源**: [https://x.com/leo_xiaolei/status/2079170675449733235](https://x.com/leo_xiaolei/status/2079170675449733235) ---  > 非成品,目前自评 85 分,会持续迭代,直到开源 这几天我一直在折腾一件看起来挺简单的事: 给一张照片,让程序像人在 Procreate APP 里画画一样,从第一根结构线开始,一笔一笔把它画成动漫插画,最后再自动剪成一条可以发布的视频。 说这件事简单,你可能会想到用 Seedance 2.0 这种视频模型简随便调调提示词就能实现,但这类模型只有提示词,不是流水线,很难保障效果统一,成本也不好控制。 说这件事不简单,是因为我想挑战一下,不用视频模型去完成这件事。 目前这套东西,我给 85 分。 已经能换照片,能识别人、衣服、头发、脸和主要配饰,也能做到先画主体、再补主要场景、最后弱化背景;但小字、手指、复杂配饰和极端构图还会翻车,离“随便扔一张图都放心”还有一段距离。 ## 三个关键因素 目标图:目标图决定“最后要画成什么”; 笔序规划器:规划器决定“先画哪里、用多宽的笔、沿什么方向画”; 真笔刷引擎:笔刷引擎决定这一笔看起来像不像人画的。 三件事少一件都不行。 ## 第一步:先把照片变成“画得出来”的目标图 直接对着照片逐像素追,最后很容易变成几万根小短线,远看像照片,近看像打印机坏了,视频里更明显。我的做法是先生成一张适合手绘的动漫目标图,主动减少照片里的噪声、纹理和无意义细节,让头发变成可组织的块面,让衣服有清楚的明暗,让五官线和主体轮廓能被真实笔刷画出来。 这里有个很反直觉的地方:目标图越“精美”,不一定越适合画。五官太细,规划器抓不到;发丝太多,会变成黑团;背景每片叶子都清清楚楚,最后就得花大量笔触去伺候背景,人物反而出不来。 所以目标图要先服从绘画,再谈漂亮。主体清楚、明暗分组明确、配饰能辨认,背景有那个意思就够了。 ## 第二步:机器得知道哪里是人,哪里只是背景 早期版本最大的毛病是无序。画笔刚在脸上勾两下,又跳去画墙,再回来补裙子,算法知道自己在降低误差,观众只觉得它在乱画。 现在我用 MediaPipe 做离线语义预检。人像分割模型把画面分成头发、身体皮肤、脸部皮肤、衣服、配饰和背景;Face Landmarker 再给出 478 个脸部关键点。OpenCV 负责边缘、连通区域、颜色和局部方向,NumPy 与 scikit-image 用来算误差和相似度。 有了这些区域,顺序就能改成人会理解的顺序: 1. 先定人物结构和大色块。 2. 画最主要的配饰或场景,比如雨伞、自行车。 3. 补人物身份细节,让脸、发型和服装先像起来。 4. 背景只做提示,不和人物抢精度。 5. 回到人物,依次精修衣服、四肢皮肤、轮廓、头发和脸。 这不是给某张照片手写坐标。两张测试图分别生成了 62,379 和 80,646 条笔触,手工坐标覆盖都是 0。白裙、球衣、自行车、雨伞的位置不同,走的仍然是同一套语义规则。  ## 第三步:笔触不能只是 Canvas 画出来的圆头线 这个项目中间有一次很明显的变化:笔序没怎么动,只把浏览器原生的 ctx.stroke() 换成 MyPaint 家族的真笔刷引擎,画面马上就从“程序在拉线”变成了“像有人在画”。 当前渲染层用的是 brushlib-wasm,也就是 libmypaint 1.3 的 WebAssembly 版本。它带 36 支内置笔刷,能处理压力、dab 密度、不透明度叠加、速度响应和收锋。我把不同阶段映射到不同笔刷:结构用 shade,铺色用 marker,衣服细化用 dry_brush,头发用 textured_ink,轮廓和五官用 liner。 Rust 版的 hokusai 我也已经构建验证过,能直接加载 MyPaint、Krita 的 .myb 笔刷。它还没有替换当前正式渲染器,但后面要做彩色铅笔、水彩和更多纸张质感,这条路比继续手调 Canvas 参数靠谱。 渲染时,规划器输出的折线还会被再次细分,压力沿笔迹变化,起笔和收笔更轻,中段更实。画笔图标读取同一条实时轨迹,所以它不是盖在视频上的装饰动画,笔刷落在哪里,图标就跟到哪里。  ## 还原度怎么提高 这个项目走过一条很容易上瘾的歪路。把目标图放在下面,用遮罩或者大画笔慢慢揭开,最终 SSIM 可以做到 0.99,指标非常漂亮;但观众不傻,几秒钟就能看出画面是在显现,不是在画。当时我的反馈就一句:“2-6s的大面积横涂,以及最后8秒的的画笔扫掠,这种效果确实不好,这种感觉就很假。”后来这两条路都被放弃了。 现在的精修仍然只生成真实笔迹。程序先比较当前画布和目标图的差异,在误差大的地方安排下一批笔触,但不会在运行时合成目标图,也没有覆盖全画布的扫描笔。两条最新样片里,整个人物区域的归一化误差分别下降了 60.8% 和 60.6%,脸部 SSIM 保持在 0.855 和 0.861;视频验收中,可分析像素的重复修改比例都是 100%,说明它们确实经历了多轮落笔,而不是第一次出现就直接等于终值。 这里也得说清楚,SSIM 只是辅助检查。纹理越像纸笔,逐像素反而越难和目标图完全重合。最终还是要把工程门槛和人眼验收分开:指标负责抓作弊、闪烁和没画完,人负责判断人物好不好看、过程像不像真画。  ## 一条视频最后是怎么出来的 整条生产过程目前是这样的:输入照片和想要的风格,先生成动漫目标图;MediaPipe 检查是不是单人图,并输出人物、脸、头发、衣服和配饰区域;Python 规划器按结构、铺色、细化和局部修正生成笔触 JSON;浏览器里的 MyPaint 笔刷引擎按时间轴逐笔重放,运镜跟着语义阶段走;Node 驱动无头浏览器逐帧渲染,FFmpeg 编码成 1080×1440、25fps 的 H.264 视频,再合成背景音乐;最后用 OpenCV 抽帧检查闪烁、重复绘制比例和末帧相似度。 速度也不是把全片统一乘一个倍数。我当时说:“这部分很容易让观众以为是在空画,可以适当加速个6-8倍试试。”所以结构和大色块要让人看清,连续补细节就压到 6~8 倍;人物精修会重新放慢一点;最后留下几秒完整成品。前面试过全局三倍速,30~34 秒直接闪成一团,后来才改成按阶段分配速度。 ## 后面会整理成一个 Skill,并开源 接下来会继续补更多构图的回归样本,把目标图生成、语义分割、人物精修和失败重试统一起来,再加入彩色铅笔风。等这些问题处理得差不多,我会把整条流程整理成一个 Skill:输入照片、选择风格、可选一段音乐,输出目标图预览、逐笔计划、最终视频和验收报告。 代码也会开源。现在先不放一个只能跑演示图、换张照片就要手修半天的版本,那种开源除了多一份 README,意义不大。 我会继续把剩下的 15 分磨掉。下一次更新,希望能直接拿一张没见过的照片,当场跑给大家看。 ## 相关链接 - [多肉|AI 内容增长架构师](https://x.com/leo_xiaolei) - [@leo_xiaolei](https://x.com/leo_xiaolei) - [Upgrade to Premium](https://x.com/i/premium_sign_up) - [7:44 PM · Jul 20, 2026](https://x.com/leo_xiaolei/status/2079170675449733235) - [2,006 Views](https://x.com/leo_xiaolei/status/2079170675449733235/analytics) - [View quotes](https://x.com/leo_xiaolei/status/2079170675449733235/quotes) --- *导出时间: 2026/7/20 23:46:00*
s skill+anki+美剧,这样学英语太高效了 作者分享了利用AI Agent结合Anki和美剧学习英语的高效方法,并开源了相关Skill。该工具能自动抓取剧集字幕、提取生词并生成闪卡,配合先预习后追剧的学习顺序,大幅提升词汇记忆效率和观剧体验。 技术 › Skill ✍ 狗哥笔记🕐 2026-07-19 AI英语学习Anki开源ClaudeSkill美剧方法论
开 开源个 Skill|解决 X 转国内赛道的内容审查违规难题 文章介绍了一个开源的 AI Skill 工具 media-publish-check,旨在帮助创作者解决从海外平台(如 X)转至国内自媒体平台(抖音、小红书等)时遇到的内容审查和违规限流问题。该工具整合了大量平台规则和违禁词库,支持发布前的内容自审和优化,降低违规风险。 技术 › Skill ✍ Sherry小水🕐 2026-07-15 AI内容审查开源自媒体AgentSkill内容风控工具
装 装完 Codex 不知道干什么?这 6 个 GitHub Skills 让你做视频搞钱 文章介绍了 6 个适用于 Codex 的 GitHub Skills,涵盖动效生成、视频剪辑、批量制作、AI 生成及中文剪辑等工具,帮助用户构建自动化视频工作流以提升效率。 技术 › Codex ✍ Kay🕐 2026-07-30 Codex视频制作AgentSkill自动化HyperFramesRemotionAI剪辑工作流
从 从零构建邮件AI助手实战指南 介绍了LangChain官方开源的Agents From Scratch教程,手把手教开发者从零构建能处理邮件的AI助手。教程涵盖基础搭建、评估体系、记忆机制四个阶段,提供完整代码和测试方案,适合初学者快速上手。 技术 › Agent ✍ 孤桜ETH🕐 2026-07-29 LangChain邮件助手AI实战教程开源PythonGmail API
大 大部分人用 skill还停留在下载别人写好的 文章指出当前大部分人对 Skill 的使用仅停留在下载现成工具层面,而更先进的项目已开始将方法论、思维方式及商业经验转化为可运行、可复用的 Skill。文中列举了女娲、dbskill、ljg-skills 等典型案例,并分析了中英文社区在 Skill 生态上的不同侧重,强调“造 Skill 的 Skill”才是生产力杠杆。 技术 › Skill ✍ Jason Zhu🕐 2026-07-29 SkillAgent方法论生产力开源女娲dbskill生态中文社区
H Hermes Agent Masterclass: 安装、配置与基础命令 本文介绍了开源 AI Agent Hermes 的安装与基础配置。Hermes 由 Nous Research 开发,支持多种模型和终端运行,具有会话复用和技能积累的独特设计。文章详细讲解了在 Windows、macOS 和 Linux 上的安装步骤、设置向导流程以及如何配置推理提供商。 技术 › Agent ✍ tonbi🕐 2026-07-29 HermesAgentAI安装教程CLI工具与效率开源
一 一个暑假,我侄子用两个 Skill 搞明白了 Agent 最难的部分 作者讲述侄子利用暑假开发两个健康类 Agent Skill 的经历。从“养生谣言粉碎机”到“体检行动助手”,解决了大模型幻觉、信息检索权威性及流程设计等难点。文章重点介绍了如何利用豆包搜索 API 的结构化数据与权威过滤功能来增强 Agent 能力,并分享了 Skill 开发优于独立 Agent 的实践经验和建议。 技术 › Agent ✍ 宝玉🕐 2026-07-28 AgentSkill豆包搜索AI开发大模型实战经验信息检索健康类目工作流开源
提 提升学习和工作效率,这2个GitHub热门开源项目千万不要错过 文章介绍了两个提升效率的GitHub开源项目:OmniGet整合下载、播放、阅读和笔记功能,一站式管理内容资源;Microsoft的Flint Chart是专为AI智能体设计的图表描述语言,简化图表生成流程。 技术 › 工具与效率 ✍ DaoYi.林🕐 2026-07-27 OmniGetFlint Chart开源效率AI知识管理可视化
开 开源HTML PPT项目Bento:动效炫酷,支持AI修改 Bento是一个开源的HTML PPT项目,动效炫酷,仅需一个HTML文件即可实现核心功能,支持文本编辑、全屏播放和多人协作。文档采用明文JSON格式,便于AI修改迭代。 技术 › 前端 ✍ 向阳乔木🕐 2026-07-26 HTMLPPT开源动效AI协作JSON
2 29k star的AI克隆任意网站开源skill 介绍了一个获得29k star的开源AI工具,能像素级还原任意网站。其成功关键在于将大任务拆解为小任务、使用详细的规格文件作为“合同”、正确识别页面交互逻辑,并通过git worktree实现并行工作,最终与原站进行视觉对比。 技术 › Agent ✍ AIGCLINK🕐 2026-07-22 AI开源网站克隆Agent自动化Git视觉对比
8 8个AI生成PPT的Skill项目整理 文章分享了8个AI生成PPT的Skill项目,包括原生可编辑的PPTX、HTML预览转PPTX、杂志风模板等,涵盖多种风格和功能,适合用于制作演示文稿。 技术 › Skill ✍ AI奶爸🕐 2026-07-22 AIPPTSkill模板演示文稿GitHub
微 微软开源 Resource2Skill 项目 微软开源了 Resource2Skill 项目,并发表了相关 arXiv 论文。该项目通过自动将教程视频、文章、代码等人类资源蒸馏成 Agent 可直接执行的技能,解决了技能来源问题。Agent 能够浏览、组合和运行这些技能,生成网页、PPT、Excel、Blender 场景甚至音频作品,标志着技能生成从手写进入自动提炼阶段。 技术 › Agent ✍ Jason Zhu🕐 2026-07-21 微软Resource2SkillSkillAgent开源自动化论文