PixelRAG

PixelRAG

网页爬虫

Loading…

应用介绍

#视觉RAG #网页爬虫 #多模态AI #ClaudeCode #Qwen3VL #FAISS
PixelRAG 是一款基于视觉检索的开源 RAG 工具。它不依赖传统的 HTML 解析,而是将网页、PDF、论文或本地应用渲染成截图,再让视觉模型直接从像素中检索和理解内容。
传统网页解析经常会丢失表格、图表、公式、排版和页面结构。PixelRAG 直接索引用户实际看到的页面,可以保留更多视觉信息,减少内容在解析过程中的损失。项目介绍称,其团队构建了包含 3000 万张以上维基百科截图的视觉索引,在纯文本问答任务中的表现比强文本 RAG 基准高出 18.1%。

软件功能

- 基于像素检索网页:不先将网页转换成纯文本,而是直接索引渲染后的页面截图。
- 保留页面视觉信息:表格、图表、公式、布局和文字之间的位置关系都可以保留下来。
- 支持多种内容来源:可处理普通网页、PDF、arXiv 论文以及本地应用界面。
- 视觉 RAG 流程:先将页面渲染为图像块,再生成视觉向量并存入检索索引。
- Qwen3-VL-Embedding:使用视觉嵌入模型处理截图,并通过针对截图数据微调的 LoRA 提升检索效果。
- FAISS 向量索引:将生成的视觉向量存储到 FAISS 中,用于快速搜索相关页面。
- Claude Code 插件:为 Claude 提供视觉浏览能力,使其能够截图页面并基于渲染结果回答问题。
- 无需因视觉模型升级而重新解析页面:原始页面截图可以保留,升级模型后可继续使用已有的视觉数据。
- 减少解析器影响:绕过 HTML 清洗、正文提取和结构转换等容易丢失信息的环节。
- 完全开源:项目代码公开,可用于研究、部署和二次开发。

应用截图