📚 Wiki 知识库

🏷️ 爬虫

10 篇

Crawl4AI:7万星开源神器把网页秒变LLM能吃的干净Markdown

文章介绍了一款名为 Crawl4AI 的开源爬虫工具,GitHub 星标超 7 万。该工具专为 RAG 和 Agent 设计,能将网页快速转换为干净的结构化 Markdown 数据。其特点包括零 API Key、异步浏览器池、智能去噪、支持 CLI/Docker 部署以及强大的反爬策略,被视为构建 LLM 数据管道的利器。

技术LLM ✍ 开发者Hailey🕐 2026-07-10

价值1万刀的稳定小红书“API”工具拆解:Airtap Agent实战评测

文章介绍并评测了一款名为 Airtap 的云端 AI Agent 工具,该工具通过操控真实安卓手机 App 来解决小红书缺乏官方 API 的问题。文章详细拆解了其架构模型、Task 执行流程(包括搜索、点击、截图及节点树提取)、稳定性实测结果以及 SDK 使用边界。结论表明,虽然数据层受推荐算法影响,但在接口契约和结构层上,它为开发者提供了一个高可用的“类 API”解决方案。

技术Agent ✍ WquGuru🕐 2026-05-15

使用 Hermes Agent 自动化制作 TikTok 幻灯片内容指南

本文介绍如何利用 Hermes Agent 自动化 TikTok 幻灯片(Slideshow)内容的生成与发布流程。文章分析了幻灯片流量红利与手动制作痛点,详细讲解了 Hermes 的安装配置、基于 Skill 和 Cron 的管道模型设计,以及 Hook 研究、图片路由、Pinterest 爬取和合成等核心技能的实现方法。

技术Hermes ✍ Alex Nguyen🕐 2026-05-14

我花10分钟做了产品调研Skill,以后不用自己扒竞品了

针对运营同事使用通用AI生成竞品报告出现数据失真的问题,作者开发了一款名为 'ai-product-research' 的自动化调研 Skill。该工具利用 XCrawl 的 Search 和 Scrape API,模拟人类“先搜再抓”的逻辑,自动获取产品官网、GitHub 数据及社区评价,并在 2 分钟内输出包含定价、技术指标和竞品对比的结构化报告。文章实测了 Cursor 和 AIHOT,效果精准且成本极低。

技术Agent ✍ 木马人🕐 2026-05-12

朋友想省几千块设计费,我用 GPT-Image-2 + XCrawl 搭了一套 AI 主图流程

文章讲述了作者如何利用 GPT-Image-2 和 XCrawl 工具构建一套自动化电商主图设计流程。通过 XCrawl 抓取 Behance 上的高质量设计参考图,并结合 Claude Code 进行数据清洗与结构化,解决了单纯依靠 Prompt 效果不佳的问题。该方法不仅能大幅降低设计探索成本,还能提升商品图的视觉溢价,展示了参考图在 AI 绘图中的决定性作用。

技术Agent ✍ AI奶爸🕐 2026-05-06

AI 创作者的选题外挂:中英信息差工作流

本文介绍了利用 Claude Code、XCrawl 和 n8n 搭建自动化工作流的方法,旨在通过抓取英文 AI 圈的最新资讯并对比中文圈,挖掘“信息差”作为内容选题。文章详细拆解了从筛选信源(如 latent.space、Import AI 等)、配置爬虫策略到构建自动化日报系统的全过程,实现了从“手动刷屏”到“5分钟定题”的效率飞跃。

技术Agent ✍ 劳伦斯🕐 2026-04-27

为了让 AI 管家学会交易,我直接爬取了 42万字投资大佬的文章喂给它

作者尝试通过向 AI 管家“贾维斯”投喂 42 万字 Web3 投资大佬的文章,来提升其投资分析能力。文章详细记录了使用爬虫工具 XCrawl 配合 OpenClaw,快速抓取 Chris Dixon 博客并清洗成 Markdown 格式喂给 AI 的全过程。最终,AI 成功学习并输出了具有专业框架的投资策略。文中还探讨了 XCrawl 在反爬、清洗和集成方面的技术优势。

技术Openclaw ✍ 我真的没有拼多多🕐 2026-04-15