Vector Search
임베딩, HNSW·IVFFlat, 필터링과 RAG 검색 흐름
벡터 검색 기본 흐름
- 문서와 데이터를 업무 단위로 수집합니다.
- 정제·청킹 후 임베딩 모델로 벡터를 생성합니다.
- 원문, 벡터와 메타데이터를 함께 저장합니다.
- 질문 벡터로 유사 후보를 검색합니다.
- 권한·기간·업무 조건으로 필터링합니다.
- Reranker로 재정렬해 LLM에 근거를 제공합니다.
인덱스 선택
HNSW는 높은 재현율과 낮은 지연에 적합하고, IVFFlat은 구축 속도와 저장 효율이 중요한 환경에 적합합니다. 실제 선택은 데이터 수, 차원, 갱신 빈도, 목표 Recall과 응답시간으로 검증합니다.
대용량 운영
- 업무·기간별 테이블과 파티션 분리
- 데이터 유형별 전처리·임베딩 파이프라인
- 검색 품질을 위한 Reranking
- 중요 데이터 중심의 선택적 임베딩
- Lakehouse를 이용한 원천 데이터 보존
이 문서가 도움이 되었나요?