LlamaIndex 用 Rust 重写文档解析器 LiteParse ✍ Jason Zhu🕐 2026-05-28📦 4.3 KB 🟢 已读 𝕏 文章列表 LlamaIndex 推出完全用 Rust 重写的文档解析器 LiteParse。相比旧版,新版本在处理大文档时速度提升 3 倍,小文档提升可达 100 倍,实测 457 页 PDF 解析仅需 0.777 秒。该工具支持 Python、Node.js、Rust 及浏览器环境,覆盖 PDF、Office 等主流格式,具备原生 OCR 能力,且可作为 Agent Skill 直接集成。 LlamaIndexRust文档解析OCRAgent SkillRAG开源性能优化 # 457 页 PDF 解析只要 0.7 秒,LlamaIndex 用 Rust 重写了文档解析器,开源免费 **作者**: Jason Zhu **日期**: 2026-05-28T01:50:19.000Z **来源**: [https://x.com/GoSailGlobal/status/2059814494021316923](https://x.com/GoSailGlobal/status/2059814494021316923) ---  LlamaIndex 把自家的文档解析器用 Rust 重写了,457 页 100MB 的 PDF 解析只要 0.777 秒,Python、Node、Rust、浏览器四个环境都能跑,开源免费 ## 为什么要用 Rust 重写 LiteParse v1 是 Node.js 写的,解析速度受限于 Node 的启动开销和运行时性能。v2 整个用 Rust 重写,小文档快了 5 到 100 倍,大文档也有 3 倍提升 Rust 重写带来的另一个好处是多平台原生支持。同一套核心代码通过不同的绑定层,直接输出 Python 包(PyO3)、Node 包(napi-rs)、Rust crate 和 WASM 包。不管你的技术栈是什么,都能直接用  ## 支持哪些文档格式 输入端覆盖了日常能遇到的主流格式:PDF、DOCX、XLSX、PPTX、图片。PDF 直接用 PDFium 提取文本,其他格式通过 LibreOffice 和 ImageMagick 转换后处理 输出有三种选择。结构化 JSON 带完整的文本定位信息和 bounding box,适合需要精确坐标的场景。纯文本保留原始版面布局。还能直接生成页面截图 PNG,给 LLM Agent 做视觉理解用  ## OCR 怎么做的 内置 Tesseract,装完就能用,零配置。如果 Tesseract 的识别精度不够,可以挂一个 HTTP OCR 服务器,EasyOCR、PaddleOCR 或者自己搭的都行,接口规范是标准化的 解析流程是先用 PDFium 提取原生文本,然后对扫描页或图片页做选择性 OCR,最后把两种结果合并,通过网格投影还原空间布局。这套流程保证了速度和精度的平衡  ## 四个平台怎么装 Python 用户一行命令:pip install liteparse Node/TypeScript 用户:npm i @llamaindex/liteparse Rust 用户:cargo add liteparse(库)或 cargo install liteparse(CLI) 浏览器端:npm i @llamaindex/liteparse-wasm,可以在浏览器里直接跑文档解析,数据不出本地 四个平台装完都自带一个统一的 CLI 工具 lit,命令行解析文档只需要 lit parse document.pdf  ## 性能到底有多快 官方给的基准测试数据:457 页、100MB 的 PDF 文档,解析耗时 0.777 秒 小文档的提升更夸张,比 v1 快 5 到 100 倍。这个差距主要来自两个地方:消除了 Node.js 的进程启动开销,以及 Rust 原生的内存管理和并发能力 对于 RAG 管道或者需要批量处理文档的场景,这个速度意味着你可以在本地跑完解析,不需要依赖云端服务  ## 还能当 Agent Skill 用 LiteParse 提供了现成的 Agent Skill 文件,一行命令就能加到你的 Agent 工具链里:npx skills add run-llama/llamaparse-agent-skills --skill liteparse 这意味着你的 AI Agent 可以直接调用本地文档解析能力,PDF 进去、结构化文本出来,不需要网络请求,不需要 API key 项目完全开源,Apache 2.0 协议,GitHub 上 5.5k Star 项目地址:https://github.com/run-llama/liteparse  ## 相关链接 - [Jason Zhu](https://x.com/GoSailGlobal) - [@GoSailGlobal](https://x.com/GoSailGlobal) - [2.1K](https://x.com/GoSailGlobal/status/2059814494021316923/analytics) - [@llamaindex/liteparse](https://x.com/@llamaindex/liteparse) - [@llamaindex/liteparse-wasm](https://x.com/@llamaindex/liteparse-wasm) - [https://github.com/run-llama/liteparse](https://github.com/run-llama/liteparse) - [Upgrade to Premium](https://x.com/i/premium_sign_up) - [9:50 AM · May 28, 2026](https://x.com/GoSailGlobal/status/2059814494021316923) - [2,116 Views](https://x.com/GoSailGlobal/status/2059814494021316923/analytics) --- *导出时间: 2026/5/28 16:00:09*
I Introducing SMFS: The Supermemory Filesystem SMFS 是一个结合了 RAG 和传统文件系统优势的新型可挂载文件系统。它允许 Agent 使用标准的 Unix 命令(如 grep)执行语义搜索,支持多格式文件的自动解析与提取,并提供本地优先的同步引擎。内部基准测试显示,SMFS 能显著减少 Token 消耗和工具调用次数,同时大幅提升检索准确率。 技术 › 工具与效率 ✍ Dhravya Shah🕐 2026-04-29 RAGAgentLLM文件系统开源语义搜索RustDevOps工具SMFS
C CAG:缓存增强生成,RAG的替代方案 文章介绍了缓存增强生成(CAG)作为一种替代经典RAG流水线的新方案。CAG通过将全部知识预加载到模型上下文并缓存KV Cache,显著提升响应速度,解决检索延迟和召回缺失问题。适用于中短篇幅静态文档,但对大规模或频繁变动数据仍需传统RAG或混合架构。 技术 › LLM ✍ Amto🕐 2026-07-29 CAGRAG缓存增强生成LLM私有知识向量化KV Cache开源
I Introducing pgContext 0.2.0: Advanced AI search inside Postgres pgContext 0.2.0 发布,作为 PostgreSQL 的开源扩展,提供更快的语义搜索、过滤和混合检索功能。新版本优化了性能,增加了搜索透明度和安全性,支持更多 AI 搜索方法,适用于推荐系统和低成本检索。用户可通过源代码、容器或 Docker Compose 使用。 技术 › 数据库 ✍ dale🕐 2026-07-24 PostgreSQLpgContextAI搜索语义搜索混合检索开源数据库性能优化
网 网页爬虫迎来重大升级:PixelRAG 实现基于视觉的网页检索 PixelRAG 是一种开源的视觉化网页检索技术,通过直接截图并使用视觉模型分析像素,而非依赖 HTML 解析,从而避免信息丢失。它构建了 3000 万维基百科截图的视觉索引,在问答任务上超越传统文本 RAG 基准 18.1%,并支持 Claude 代码插件。 技术 › LLM ✍ 半吊子程序猿大铭🕐 2026-07-19 PixelRAG网页爬虫视觉检索RAGClaude开源多模态Qwen3-VL
B BestBlogs 早报 · 07-17|Bun 借 AI 重写、Hook 堵越权、Nemotron 登顶检索 本期早报聚焦 AI 工程落地,精讲 Bun 用 64 个智能体 11 天重写 53.5 万行代码、腾讯 DECO 用 Hook 治理 LLM 偷懒越权、NVIDIA Nemotron 登顶检索榜。此外涵盖 Kimi K3、Inkling 模型、全双工语音等速览,强调竞争焦点从模型参数向工程实践迁移。 技术 › Harness Engineering ✍ ginobefun🕐 2026-07-17 AI工程BunRustAgentNVIDIALLM检索Hook开源模型评测
深 深入理解 AI Agent:设计原理与工程实践 李博杰新书《深入理解 AI Agent:设计原理与工程实践》开源,涵盖从0到1构建生产级AI Agent的原理与代码,包括RAG、工具调用、多Agent协作等实战内容。 技术 › Agent ✍ 李博杰🕐 2026-07-15 AI Agent开源LLMRAG工具调用多模态编程工程实践生产级代码
M Meetily:100%本地AI会议助手开源 Meetily 是一款完全本地运行的AI会议助手,支持实时转录、说话人区分和智能总结,全程零云端、零数据泄露。基于Rust底层开发,支持GPU加速,适用于Zoom、Teams等多种会议场景。 技术 › 工具与效率 ✍ 开发者Hailey🕐 2026-07-14 本地AI会议助手开源隐私保护实时转录OllamaRustGPU加速
C Crawl4AI:7万星开源神器把网页秒变LLM能吃的干净Markdown 文章介绍了一款名为 Crawl4AI 的开源爬虫工具,GitHub 星标超 7 万。该工具专为 RAG 和 Agent 设计,能将网页快速转换为干净的结构化 Markdown 数据。其特点包括零 API Key、异步浏览器池、智能去噪、支持 CLI/Docker 部署以及强大的反爬策略,被视为构建 LLM 数据管道的利器。 技术 › LLM ✍ 开发者Hailey🕐 2026-07-10 Crawl4AI爬虫开源RAGAgent数据处理Python工具推荐
私 私有知识库从 demo 到生产,中间差了 8 层工程 文章探讨了私有知识库项目在实际落地中遇到的挑战。许多 Demo 看起来聪明,但在生产环境中常因检索链路混乱而答非所问。作者指出单纯升级模型无济于事,根本在于构建稳固的 RAG 底座。文章详细拆解了从数据源、解析、清洗、切分、Embedding 到索引、检索、生成及评估的 8 层最小可用架构,并阐述了 Agentic RAG 如何通过决策层优化检索策略。最后提供了从 0 到 1 的搭建步骤及技术选型建议,强调权限过滤、混合检索与持续评估的重要性。 技术 › LLM ✍ Ando🕐 2026-07-08 RAG私有知识库Agentic向量检索工程架构LlamaIndexLangChain
阿 阿里开源 Zvec:像 SQLite 一样极简的嵌入式向量数据库 阿里开源了一款名为 Zvec 的向量数据库项目,主打“纯本地、内嵌式”极简体验,号称向量界的 SQLite。该项目基于 C++ 编写,支持零配置安装,性能强悍(毫秒级搜索数十亿向量),同时兼容稠密、稀疏向量及全文检索。它非常适合本地大模型、RAG 和个人知识库开发,彻底免去了部署繁琐的后端向量服务。 技术 › 后端 ✍ 智享🕐 2026-07-08 向量数据库阿里ZvecRAG本地大模型开源LLMAgent数据库工具
开 开源CC+Obsidian打造LLM Wiki内容创作3.0系统 文章介绍了一套基于LLM Wiki方法论的内容生产3.0系统,解决了2.0版本中知识库信息垃圾化的问题。通过“三步编译法”(浓缩、质疑、对标)将原始文档编译为持久化Wiki结构,实现知识资产的自动积累与进化,大幅降低维护成本并提升了内容创作与知识管理的效率。 技术 › LLM ✍ 饼干哥哥AGI🕐 2026-07-07 ClaudeObsidian知识管理内容创作Agent提示词自动化开源RAG方法论
不 不用花钱仅需10分钟在笔记本搭好本地OCR工作流(实测PP-OCRv6) 文章实测了百度开源的PP-OCRv6(Tiny、Small、Medium三档)本地部署方案。作者演示了如何用10分钟在笔记本上搭建OCR工作流,并对比了这三档模型与Apple Vision、Qwen3-VL等在手写、名片、轮胎压印等场景下的表现。结论指出,专用轻量模型在“逐字还原”的抄写员场景下远超大模型(VLM),且具备离线、隐私保护的优势。 技术 › 工具与效率 ✍ Berryxia.AI🕐 2026-06-17 OCRPaddleOCR本地部署实测效率工具开源AI应用教程