📑프레임워크

PageIndex: 벡터 DB 없이 추론으로 문서 검색하는 RAG 시스템

벡터 유사도 대신 LLM의 추론 능력으로 트리 구조 인덱스를 탐색해 관련 정보를 찾는 새로운 RAG 접근법

원본 링크
#RAG#벡터리스#트리인덱스#에이전트

PageIndex란?

기존 벡터 기반 RAG의 한계를 극복한 새로운 문서 검색 시스템입니다. 벡터 DB를 사용하지 않고, LLM의 추론 능력으로 문서에서 정확한 정보를 찾습니다.

핵심 아이디어

유사도 ≠ 관련성

기존 벡터 검색은 의미적 '유사도'로 문서를 찾지만, 실제로 필요한 것은 '관련성'입니다. 관련성을 판단하려면 추론이 필요합니다.

작동 방식

PageIndex는 2단계로 작동합니다:

1.트리 구조 인덱스 생성: 문서를 목차처럼 계층적 트리로 구조화
2.추론 기반 검색: LLM이 트리를 탐색하며 관련 섹션 찾기

AlphaGo처럼 트리 탐색을 통해 인간 전문가가 문서를 읽는 방식을 모방합니다.

주요 특징

벡터 DB 불필요: 임베딩이나 청킹 없이 작동
추적 가능: 검색 과정을 설명할 수 있음
대규모 확장: PageIndex File System으로 수백만 문서 처리
에이전트 통합: OpenAI Agents SDK와 쉽게 연동

활용 사례

전문 문서 분석 (법률, 의료, 금융 등)
긴 기술 문서에서 정확한 정보 추출
맥락 이해가 중요한 복잡한 질의응답

시작하기

GitHub에서 오픈소스로 공개되어 있으며, MCP 서버나 API로도 사용 가능합니다. 에이전트 기반 RAG 예제도 제공됩니다.