TL;DR

PixelRAG는 웹/문서를 screenshot tile로 렌더링해 visual index에서 검색하고 VLM reader가 읽게 하는 오픈소스 visual RAG 시스템이다.

출처별 관점

research/2026-06-20-new-rag-method-sees-page

  • 영상은 PixelRAG가 700만 Wikipedia 페이지와 약 3,000만 screenshot/tile 규모의 데모 및 실험으로 소개된다고 설명한다 [1].
  • 공식 repo는 pixelshot으로 문서나 URL을 screenshot tile로 렌더링하고, pixelrag 하위 stage로 chunk/embed/build-index/serve를 제공한다고 설명한다 [2].
  • PixelShot/pixelbrowse 계열 skill은 Claude Code류 agent가 raw HTML 대신 스크린샷을 읽게 하는 경로로 소개되며, WebFetch가 실패한 포메이션 다이어그램 예시에서 유용하게 나타난다 [1] [2].
  • 발표자는 PixelRAG의 token 절감 주장과 benchmark 수치를 소개하지만, 운영 비용이 ingestion, tile storage, vision model 호출로 이동한다는 점을 함께 지적한다 [1].

관련 개념