PixelRAG

AI工具26分钟前更新 AI工具集
0 0 0

PixelRAG – 伯克利开源的视觉原生 RAG 框架

PixelRAG,一款源自伯克利 SkyLab/BAIR 的创新开源视觉原生 RAG 框架,正以前所未有的方式革新信息检索的范式。它巧妙地摆脱了传统 RAG 方法将网页内容抽离为纯文本再进行检索的局限,转而采用一种更直观、更全面的“视觉优先”策略。

PixelRAG 究竟是何方神圣?

PixelRAG 并非简单的文本处理工具,它是一个集成了浏览器渲染、视觉向量检索与视觉语言模型(VLM)解读的完整框架。其核心在于,它将网页和 PDF 文档转化为一系列精美的截图瓦片,并利用经过 LoRA 微调的 Qwen3-VL 模型,直接从这些图像中识别并理解表格、图表以及复杂的页面布局。这一突破性进展,有力地解决了传统 RAG 在处理结构化信息时常遇到的表格丢失、版式混乱等棘手问题。

PixelRAG 的核心能力

  • 像素级页面呈现(pixelshot):通过无头 Chromium 浏览器,PixelRAG 能将网页和 PDF 精准渲染成截图瓦片,确保表格的行列对齐、图表的完整呈现以及页面版式的原貌保留。在 Windows 和 macOS 系统上,它还能自动调用本地 Chrome 浏览器,无缝支持 URL 和本地文件的混合处理。
  • 视觉语义检索:框架将这些截图瓦片编码成向量表示,实现了强大的文本搜图和以图搜图功能。本地默认使用 FAISS 进行高效检索,对于大规模场景,则可无缝切换至 Qdrant,支持量化压缩、磁盘存储及多服务共享,极大地提升了检索的灵活性和可扩展性。
  • 原生图像解读:经过检索命中的截图瓦片,将直接作为图像输入喂给 VLM,模型由此能够直接“阅读”图像上的信息,完成问题解答,整个过程无需任何中间文本转换,真正实现了像素到答案的直接飞跃。
  • 便捷托管搜索服务:PixelRAG 提供免密钥的 API 接口和直观的网页 Demo,内置了覆盖 828 万页面的预建索引,让用户能够即刻体验其强大的搜索能力,无需繁琐的配置。
  • 自建索引管道:通过简洁的命令行工具,如 pixelrag index / embed / build-index / serve,用户可以轻松为自己的 PDF 和网站构建专属的索引库。即使是 Mac(Apple Silicon)设备,也能处理小规模的数据集。
  • Agent 集成赋能:PixelRAG 还提供了 Claude Code 插件 pixelbrowse,该插件无需 MCP 依赖,能够让 Claude 模型“看见”网页的真实截图,而非仅仅解析残缺的 HTML,极大地增强了 Agent 的网页理解能力。

PixelRAG 的技术精髓

  • 文档即图像的表示层:PixelRAG 将文档的视觉形态视为核心。通过无头 Chromium,网页被捕捉为截图,PDF 按页转换为图像并进一步切分为瓦片。这一过程确保了表格的行与列、图表以及其他视觉结构信息得以完整保留,如同原始文档一般。
  • 视觉向量嵌入的检索层:基于 Qwen3-VL-Embedding-2B 模型,并运用对比学习数据进行 LoRA 微调,PixelRAG 赋予了截图瓦片强大的语义检索能力。用户查询的不再是孤立的文本片段,而是“那一块图像”。向量数据在本地采用 FAISS 存储,大规模部署则可切换至 Qdrant,以应对不同规模的需求。
  • VLM 读图作答的生成层:检索到的截图瓦片直接作为像素输入,被送入视觉语言模型。模型能够直接从图像中提取数字、理解版式,完成问答,全程消除了中间文本转换的环节,确保了信息的准确性和完整性。
  • 规模与效率的飞跃:PixelRAG 是首个实现了以截图形式覆盖全量的 RAG 管线。像素表示带来了前所未有的效率优势——通过降低截图分辨率,可以实现最多 3 倍的 token 成本降低,同时保持精度不减。实验结果显示,PixelRAG 在多项评估中全面超越了传统的文本 RAG 基线,最高性能提升可达 18.1%。

微信关注并回复“开源”,即可加入AI开源项目交流群,与更多技术爱好者一同探索。

如何驾驭 PixelRAG

  • 安装便捷:只需执行 pip install pixelrag 命令,即可轻松安装核心工具(需要 Python 3.10+)。
  • 页面渲染体验:使用 pixelshot https://example.com -o ./tiles 命令,即可将任意网页或 PDF 渲染成一系列截图瓦片。
  • 即刻体验托管搜索:无需任何配置,直接向 https://api.pixelrag.ai/search 发送 POST 请求,即可搜索包含 828 万维基页面的海量索引。您也可以直接访问 pixelrag.ai 网站进行在线试用。
  • 构建专属索引:通过创建 pixelrag.yaml 配置文件,指定文档路径、嵌入模型和输出目录,然后执行 pixelrag index build 命令即可构建索引。之后,使用 pixelrag serve --index-dir ./my_index --port 30001 启动搜索服务。Mac (Apple Silicon) 用户即可处理小规模索引,而全量维基索引(约 217GB)则需要 GPU 算力支持。
  • 对接 Claude Code:安装 uv tool install pixelrag 后,在 Claude 中安装 pixelbrowse 插件(通过 claude plugin marketplace add StarTrail-org/PixelRAGclaude plugin install pixelbrowse@pixelrag-plugins)。这将允许 Claude 模型直接“看见”网页截图,无需依赖 MCP。
  • 深度训练探索:如果您希望自行研发嵌入模型,可以进入 train/ 目录(这是一个的 uv 项目),按照 README 文件进行微调。或者,您也可以直接复用官方开源的 LoRA 权重和训练数据。

PixelRAG 的核心优势

  • 信息无损,原貌呈现:PixelRAG 以截图代替传统的文本抽取,完整保留了表格的行列关系、图表的细节以及页面的原始布局。这彻底解决了传统 RAG 在看似有答案,但抽取文本后信息丢失的痛点。
  • 性能卓越,超越基线:研究表明,PixelRAG 在 NQ、SimpleQA 等纯文本任务上全面超越了文本 RAG 基线。在多模态和 Agentic 基准测试中,其性能提升最高可达 18.1%。
  • 成本效益显著:像素表示带来了独特的效率杠杆。通过降低截图分辨率,可以在保证精度的前提下,将 token 成本最多降低 3 倍。
  • 管线简化,工程友好:PixelRAG 省去了复杂的 HTML 解析、清洗和切分流程,只需渲染截图即可入库,极大地缩减了工程开发的工作量。
  • 规模验证,可靠体验:PixelRAG 是首个成功构建覆盖全量的截图式 RAG 管线。其提供的 828 万页免密钥托管索引,让用户能够立即体验其强大的能力。

PixelRAG 的项目链接

  • 官方网站:https://pixelrag.ai/
  • GitHub 仓库:https://github.com/StarTrail-org/PixelRAG
  • 技术论文 (arXiv):https://arxiv.org/pdf/2606.28344

PixelRAG 与同类竞品的比较

对比维度PixelRAGColPali
出品方伯克利 SkyLab / BAIR / NLP Group(2026)Illuin 科技(2024)
基座模型Qwen3-VL-Embedding-2B + LoRA 微调PaliGemma(后续有 ColQwen2.5 变体)
检索对象网页截图为主,兼容 PDFPDF 等静态文档页面图像
嵌入粒度单向量:每块截图对应一个向量Late-interaction:每页保留上千个 patch 级向量
存储成本单向量方案,存储效率高,易扩展每页约 256KB,大规模部署压力大
索引规模已验证覆盖全量,3000 万张截图公开验证以万级页码基准为主
检索精度在 NQ、SimpleQA、MMSearch 等开放域任务全面超越文本基线,最高提升 18.1%版面密集型文档细粒度匹配精度占优,长期占据 ViDoRe 榜首
token 效率降低截图分辨率可降最多 3 倍 token 成本且精度不降无图像压缩效率杠杆
工程生态全栈工具链:渲染、嵌入、索引、托管 API、Claude Code 插件提供模型与评测代码,检索服务需自建

PixelRAG 的应用场景

  • 财务报表与数据表格问答:直接读取财报和统计表格中的精确数字,避免了因文本解析错误导致的行列错位问题。
  • 仪表盘与图表检索:能够检索并理解包含图表、关键绩效指标(KPI)面板的截图区域,让模型直接从图表中获取信息并作答。
  • 信息图与带图解文档的检索:对于信息图、流程图等传统文本索引难以覆盖的内容,PixelRAG 能够实现有效的搜索。
  • 多栏排版产品页的理解:复杂的商品对比页、新闻页面等,其原始布局得以完整保留,并参与到检索过程中。
  • Agent 的网页阅读能力增强:通过 Claude Code 的 pixelbrowse 插件,Agent 能够“看见”网页的真实视觉内容,而非解析不完整的 HTML,极大地提升了其网页交互和信息获取能力。
阅读原文
© 版权声明

相关文章

AI聚合视觉工厂

暂无评论

暂无评论...