본문으로 건너뛰기

하이브리드 검색 시스템 구축

PostgreSQL의 pg_trgm과 pgvector를 활용하여 텍스트 유사 검색과 의미 기반 벡터 검색을 구현하고, 두 검색 방식을 결합한 하이브리드 검색 시스템을 구축하는 실습 중심의 교육 과정입니다.

수강생은 붙여쓰기·오타와 같은 실제 검색 환경의 문제를 처리하는 텍스트 유사 검색과 임베딩을 활용한 의미 기반 벡터 검색을 구현합니다. 또한 100만 건 규모의 학교급식 식품 데이터를 대상으로 검색 인덱스와 쿼리를 최적화하고, 두 검색 결과의 점수를 결합하여 검색 정확도를 높이는 하이브리드 검색 구조를 설계합니다. 이후 Pandas 기반 데이터 전처리, FastAPI 검색 API 구축, 검색 품질 검증, 가중치 최적화, 운영 및 확장 전략까지 실습함으로써 데이터 구축 → 검색 구현 → 하이브리드 검색 → 성능 최적화 → API 서비스 → 운영·확장으로 이어지는 검색 시스템 개발 전 과정을 경험합니다.

강의 시간​

8차시 과정

강의 계획서​

차시주제내용
1AI 기반 개발 환경 구축– ChatGPT, Claude, Copilot 활용
– AI를 활용한 코드 생성 및 디버깅
– 개발 과정에서의 프롬프트 작성 방법
2PostgreSQL 기본 쿼리 및 검색 데이터 처리– SELECT, WHERE, JOIN 등 PostgreSQL 기본 쿼리
– AI를 활용한 SQL 작성 및 수정
– 검색 데이터 구조와 인덱스의 기본 개념
3고급 SQL 및 검색 구조 이해– 서브쿼리와 CTE 활용
– 다중 테이블 조회 및 집계
– pg_trgm 기반 텍스트 유사 검색
– pgvector 기반 의미 검색 구조 이해
4검색 데이터 전처리– Pandas 기반 Excel·CSV 데이터 처리
– 결측치 처리 및 데이터 정제
– 검색용 데이터 변환
– 임베딩 생성을 위한 데이터 준비
5검색 인덱스 최적화– pg_trgm 검색 인덱스 구성
– pgvector HNSW 인덱스 구성
– HNSW 파라미터 튜닝
– EXPLAIN ANALYZE를 활용한 실행 계획 및 성능 분석
6하이브리드 검색 API– FastAPI 기반 검색 API 구현
– pg_trgm과 vector 검색 점수 결합
– 텍스트 검색과 의미 검색을 결합한 하이브리드 검색 구현
7검색 품질 검증– 다양한 검색 시나리오 테스트
– 붙여쓰기·오타·의미 검색 정확도 검증
– 검색 품질 평가
– Grid Search를 활용한 최적 검색 가중치 도출
8운영 및 확장– 임베딩 배치 갱신 전략
– 검색 로그 모니터링
– 대용량 데이터 확장 시 고려사항
– Elasticsearch 등 전문 검색 시스템으로의 확장 기준