URL智能读取SKILL:一键抓取网页内容同步至Obsidian ✍ 老杨啊🕐 2026-02-06📦 6.7 KB 🟢 已读 𝕏 文章列表 文章介绍了一款自建的网页抓取神器,通过Firecrawl、Jina和Playwright三层策略,能一键抓取微信公众号、知乎等任意网站内容,自动下载图片并转存Markdown到Obsidian本地,解决了网页复制格式乱和外链失效问题。 ObsidianPython网页抓取Firecrawl自动化Markdown效率工具Playwright # URL智能读取SKILL:一键抓取任何网站内容并自动同步到到Obsidian做为素材。 **作者**: 老杨啊 **日期**: 2026-02-04T07:35:19.000Z **来源**: [https://x.com/yhslgg/status/2018951488488513621](https://x.com/yhslgg/status/2018951488488513621) ---  卧槽!!!今天必须给大家分享一个我刚做完的神器!!! 一个能读取任何网站内容的工具,微信公众号、小红书、知乎、抖音、淘宝、京东...全都能抓!!! 而且自动保存成Markdown并同步到Obsidian,图片也全部下载到本地!!! ## 为什么要做这个?  每次看到好文章想保存,要么复制粘贴格式全乱,要么图片全是外链过几天就挂了。 微信公众号更离谱,复制出来全是乱码!!! 所以我就想:能不能做一个工具,输入URL就自动把内容和图片全部抓下来? 答案是:能!而且特么的超简单!!! ## 核心思路:三层策略自动降级 这个工具的核心就是三层策略: > Firecrawl(首选)→ Jina(备选)→ Playwright(兜底) 为什么要三层?因为没有一个方案能搞定所有网站!!! - Firecrawl:AI驱动,能搞定96%的网站,但要钱(免费500页/月)闲鱼有8万积分,很便宜。 - Jina:完全免费,但有些网站搞不定 - Playwright:浏览器自动化,什么都能搞,但需要登录态 三层组合,基本上能搞定99%的网站!!! ## 第一步:平台识别 首先要识别URL是哪个平台的,这样才能选择最佳策略。 让AI写代码的Prompt: > 帮我写一个Python函数,输入URL,识别是哪个平台: > - 微信公众号:mp.weixin.qq.com > - 小红书:xiaohongshu.com, xhslink.com > - 知乎:zhihu.com > - 抖音:douyin.com > - 淘宝:taobao.com > - 京东:jd.com > - B站:bilibili.com > 返回平台名称和是否需要登录 AI会给你一个完美的identify_platform()函数! ## 第二步:Firecrawl策略 Firecrawl是一个AI驱动的网页抓取API,牛逼的地方在于: - 自动处理JavaScript渲染 - 自动绕过反爬机制 - 直接返回干净的Markdown 让AI写代码的Prompt: > 帮我写一个用Firecrawl抓取网页的函数: > 1. 从环境变量读取FIRECRAWL_API_KEY > 2. 调用firecrawl-py库的scrape方法 > 3. 注意:Firecrawl v2返回的是Document对象,不是dict > 4. 用getattr获取markdown和metadata > 5. 检查内容是否有效(长度>100,不是验证页面) 踩坑提醒:Firecrawl v2的返回值变了!!! 以前是result.get('markdown'),现在要用getattr(result, 'markdown', '')!!! 这个坑我踩了半小时才发现... ## 第三步:Jina策略 Jina Reader是完全免费的!!!用法超简单: > https://r.jina.ai/{你的URL} 直接在URL前面加上https://r.jina.ai/就行! 让AI写代码的Prompt: > 帮我写一个用Jina Reader读取网页的函数: > 1. 在URL前面加上https://r.jina.ai/ > 2. 设置Accept: text/markdown > 3. 设置User-Agent模拟浏览器 > 4. 检查返回内容是否有效 ## 第四步:Playwright策略 这是兜底方案,用真实浏览器去访问页面。 让AI写代码的Prompt: > 帮我写一个用Playwright读取网页的函数: > 1. 使用async_playwright > 2. 启动chromium浏览器(headless模式) > 3. 设置微信内置浏览器的User-Agent > 4. 支持加载已保存的登录态(storage_state) > 5. 等待页面加载完成后提取内容 > 6. 用page.evaluate执行JS提取标题和正文 踩坑提醒:微信公众号的长链接(带__biz参数的)容易触发验证!!! 短链接(/s/xxxxx格式)更稳定!  ## 第五步:内容保存及同步 抓到内容后,要保存成Markdown并下载图片同时保存到Obsidian 只需要指定内容保存到XXXX目录,然后再到Obsidian把这个目录添加进去就可以了。 让AI写代码的Prompt: > 帮我写一个保存内容的函数: > 1. 从内容中提取标题 > 2. 创建目录:日期_标题 > 3. 用正则提取所有图片URL(支持Markdown格式、直接URL、小红书图片、飞书图片) > 4. 下载图片到本地,命名为img_01.jpg等 > 5. 把内容中的图片URL替换成本地路径 > 6. 保存为content.md,带上元数据(标题、来源、时间) 踩坑提醒:下载小红书图片要设置Referer头!!! > headers = { > 'User-Agent': 'Mozilla/5.0...', > 'Referer': 'https://www.xiaohongshu.com/' > } 不然会403! ## 踩坑总结 - Firecrawl v2返回值变了:用getattr()不要用.get() - 微信长链接触发验证:用短链接更稳定 - 标题提取要跳过元数据:第一行可能是"来源:xxx"不是标题 - 图片下载要设Referer:不同平台要设不同的Referer ## 成本计算 - Firecrawl:免费500页/月,够用了 - Jina:完全免费 - Playwright:免费,但需要安装chromium(约200MB) 总成本:0元!!! ## 变现方向 - 内容采集服务:帮自媒体批量采集素材 - 竞品监控:监控竞争对手的公众号/小红书 - 数据分析:采集行业内容做分析报告 - 知识库建设:自动采集整理行业知识 ## 最后 这个工具我后面我会开源了,现在还在优化中,接下来会做批量抓取,同时会结合其他skill,做更多的二创内容, 用法超简单: > # 读取并保存 > python url_reader.py https://mp.weixin.qq.com/s/xxxxx --save 内容和图片自动保存到本地!!! 有问题评论区见!!! ## 相关链接 - [老杨啊](https://x.com/yhslgg) - [@yhslgg](https://x.com/yhslgg) - [68K](https://x.com/yhslgg/status/2018951488488513621/analytics) - [mp.weixin.qq.com](https://mp.weixin.qq.com/) - [xiaohongshu.com](https://xiaohongshu.com/) - [xhslink.com](https://xhslink.com/) - [zhihu.com](https://zhihu.com/) - [douyin.com](https://douyin.com/) - [taobao.com](https://taobao.com/) - [jd.com](https://jd.com/) - [bilibili.com](https://bilibili.com/) - [https://r.jina.ai/](https://r.jina.ai/) - [https://r.jina.ai/](https://r.jina.ai/) - [https://r.jina.ai/](https://r.jina.ai/) - [content.md](https://content.md/) - [https://www.xiaohongshu.com/](https://www.xiaohongshu.com/) - [https://mp.weixin.qq.com/s/xxxxx](https://mp.weixin.qq.com/s/xxxxx) - [Upgrade to Premium](https://x.com/i/premium_sign_up) - [3:35 PM · Feb 4, 2026](https://x.com/yhslgg/status/2018951488488513621) - [68.2K Views](https://x.com/yhslgg/status/2018951488488513621/analytics) - [View quotes](https://x.com/yhslgg/status/2018951488488513621/quotes) --- *导出时间: 2026/2/6 09:15:15*
别 别再把收藏夹当知识库了:用 Hermes 和 AutoCLI 搭建自动整理链路 针对“收藏即遗忘”的痛点,文章提出了一套本地化知识管理方案。作者建议结合 AutoCLI(采集层)、Hermes Agent(处理层)和 Obsidian(存储层),构建一条自动化流水线。通过定时抓取网页、清洗摘要并生成 Markdown,将杂乱信息转化为可检索的本地知识库,从而提升资料利用率。 技术 › 工具与效率 ✍ AFei Liang🕐 2026-07-06 知识管理HermesAutoCLIObsidian自动化工作流AgentMarkdown效率工具
把 把文章变成图文流量翻倍,自研排版系统开源 作者分享了其公众号粉丝从 80 涨到 1000 的经验,发现将长文转化为图文卡片可使阅读量提升 5-20 倍。为此,作者开源了一套基于 Python 和 Playwright 的自动化排版系统,能将 Markdown 转化为精美图片,将排版时间从 2 小时缩短至 30 秒。该工具结合 AI 指令,实现了低门槛的批量内容生产,适用于公众号、小红书等多平台分发。 技术 › 工具与效率 ✍ Bill_DO_A_BIT多少做点🕐 2026-04-29 开源项目自动化图文排版AIPlaywright内容创作Python效率工具公众号小红书
开 开源Obsidian公众号插件:排版半小时变1分钟,一键发布草稿 文章介绍了一款开源的Obsidian公众号插件,能将排版时间从半小时缩短至1分钟。该插件支持实时预览、7套精美主题一键切换、封面同步、多账号配置及一键发布到草稿箱等功能。作者全程使用Vibecoding与AI对话开发,未手写一行代码,目前插件已开源。 技术 › 工具与效率 ✍ 产品经理老王霸🕐 2026-07-29 Obsidian公众号插件排版开源VibecodingAI开发效率工具Markdown
C Claude + Obsidian,你数百条死笔记,瞬间变成帮你思考的第二大脑 本文介绍了一种结合 Claude 和 Obsidian 的知识管理方案,通过自动化提取、链接和归档,将死笔记转化为可交互的第二大脑,支持全文检索和引用,帮助知识复利增长。 技术 › 工具与效率 ✍ 老白(每日 AI 干货)🕐 2026-07-22 ClaudeObsidian知识管理第二大脑笔记MCP自动化LLMMarkdown效率
使 使用 Claude + Obsidian 管理 GitHub 仓库的完整指南 本文介绍如何利用 Claude 和 Obsidian 自动化管理 GitHub 仓库。通过自动化循环记录每个仓库的用途、抓取原因及使用状态,避免遗忘和重复工具,提高开发效率。 技术 › 工具与效率 ✍ Gipp🕐 2026-07-20 GitHubObsidianClaude自动化仓库管理代码管理效率工具AI工具
本 本地 Markdown 转 X 长文:我开源了目前最顺手的方案 本文作者 kaitox 介绍了一款名为 Kaitox 的开源工具,旨在解决本地 Markdown 文章发布到 X (Twitter) 时格式丢失、图片需手动上传的痛点。该方案由本地 Relay、Chrome 插件及 CLI/Skill/Obsidian 插件组成,支持原生排版保留、封面自动设置及一键生成草稿,且完全免费开源。 技术 › 工具与效率 ✍ kaitox🕐 2026-07-10 MarkdownXChrome插件Obsidian开源工具自动化工作流Claude Code
7 7天用 Codex Skill 把 Obsidian 改造成可执行的第二大脑 本文介绍如何将 Obsidian 本地 Markdown 知识库与 Codex 结合,通过编写可执行的 Skill,把第二大脑的方法论封装成系统。文章提出了五入口目录结构、Bootstrap Skill 的设计原则以及从捕获到产出的知识管理闭环,旨在让 AI 成为持续工作的知识操作员。 技术 › Codex ✍ 知识猫图解🕐 2026-07-02 Obsidian第二大脑CodexSkill个人知识管理Agent自动化Markdown
H Horizon:开源 AI 新闻雷达,打造你的专属双语日报 介绍了一款名为 Horizon 的开源 AI 新闻雷达工具。该工具支持抓取 HN、Reddit、GitHub 等多平台一手信息,利用大模型自动打分、去重、总结,并生成中英双语日报。支持 Docker 一键部署及多种订阅方式,旨在解决信息过载和二手信息泛滥的问题。 技术 › 工具与效率 ✍ 开发者Hailey🕐 2026-06-28 AI开源新闻聚合效率工具HorizonDockerLLM资讯自动化Python
如 如何将 Claude Code 打造为投资研究分析师 文章讲述了作者如何利用 Claude Code 这一编程工具,成功转型为个人的投资研究分析师。通过将其与 Obsidian 知识库及浏览器自动化工具集成,作者构建了一个能够自动筛选数据、抓取信息、建模并撰写报告的工作流。文章指出,与普通的聊天机器人不同,Claude Code 能够独立执行复杂的任务链条,极大地提高了金融研究的效率。 技术 › Claude Code ✍ leopardracer🕐 2026-05-26 投资研究Claude Code自动化Obsidian工作流人工智能金融科技效率工具Agent知识管理
如 如何构建一个每日晨间简报的 Claude 研究代理 文章介绍如何利用 Claude、MCP(Filesystem 和 Brave Search)、N8N 及 Obsidian 构建一个全自动的晨间研究代理。该代理能自动监控信息源、过滤噪音、综合关键信息,并生成一份 5 分钟可读完的简报存入 Obsidian,帮助用户从繁杂的信息过载中解放出来,高效开始工作。 技术 › Agent ✍ CyrilXBT🕐 2026-05-25 ClaudeMCPN8N自动化工作流ObsidianBrave Search效率工具AI Agent
保 保姆级:用AI搭建选题流水线,从信息源到入库全流程 本文分享了如何利用 AI 构建自动化的内容选题系统。作者提出“选题是信息处理问题而非灵感问题”,通过确立“四层水源”(快、深、慢、反)、撒下“关键词渔网”、AI 初筛信息、人工做四维判断以及入库排期这五个步骤,实现每天自动生成 10 个带数据和角度的选题,从而告别创作焦虑,提升内容生产效率。 技术 › 工具与效率 ✍ 爆裂队长NEXT🕐 2026-05-24 AI工作流内容创作自动化知识管理Agent选题方法论Obsidian效率工具
从 从零开始使用 Obsidian:普通人也能搭建自己的知识库 本文是一篇面向零基础用户的 Obsidian 新手教程。作者指出 Obsidian 本质上是一款本地优先、基于 Markdown 的双向链接笔记软件,能有效构建知识网络。文章通过创建库、掌握基础语法、理解双向链接、建立文件夹结构、使用每日笔记和模板等步骤,引导新手从“先写再整理”开始,避免沉迷插件和过度装修,最终搭建出属于自己的个人知识库。 技术 › 工具与效率 ✍ 兔子Chole_🕐 2026-05-20 Obsidian知识管理双向链接Markdown新手教程笔记软件方法论效率工具个人知识库