TL;DR

Visual RAG는 문서를 텍스트로 파싱하지 않고 렌더링된 페이지 이미지나 타일을 검색 단위로 쓰는 retrieval 패턴이다.

출처별 관점

research/2026-06-20-new-rag-method-sees-page

  • 영상은 visual RAG의 실무 동기를 parser loss로 설명한다. 표, 차트, 다이어그램, 시각적 계층이 Markdown/text 변환에서 빠지면 답이 원문에 있어도 검색 전에 손상될 수 있다는 주장이다 [1].
  • 구현 흐름은 페이지를 screenshot tile로 만들고 vision embedding model로 색인한 뒤, 검색된 tile을 VLM reader가 읽는 구조다 [1].
  • 적용 판단은 text RAG 폐기가 아니라 layout-heavy 질의만 visual index로 라우팅하고 ordinary text 질의는 text index에 남기는 hybrid retrieval에 가깝다 [1].
  • 주요 제약은 작은 VLM의 reading floor, screenshot storage, ingestion/embedding 비용, fixed-height visual chunking의 미해결성이다 [1] [2].

관련 개념