하이브리드 검색 시스템 구축
PostgreSQL의 pg_trgm과 pgvector를 활용하여 텍스트 유사 검색과 의미 기반 벡터 검색을 구현하고, 두 검색 방식을 결합한 하이브리드 검색 시스템을 구축하는 실습 중심의 교육 과정입니다.
수강생은 붙여쓰기·오타와 같은 실제 검색 환경의 문제를 처리하는 텍스트 유사 검색과 임베딩을 활용한 의미 기반 벡터 검색을 구현합니다. 또한 100만 건 규모의 학교급식 식품 데이터를 대상으로 검색 인덱스와 쿼리를 최적화하고, 두 검색 결과의 점수를 결합하여 검색 정확도를 높이는 하이브리드 검색 구조를 설계합니다. 이후 Pandas 기반 데이터 전처리, FastAPI 검색 API 구축, 검색 품질 검증, 가중치 최적화, 운영 및 확장 전략까지 실습함으로써 데이터 구축 → 검색 구현 → 하이브리드 검색 → 성능 최적화 → API 서비스 → 운영·확장으로 이어지는 검색 시스템 개발 전 과정을 경험합니다.
강의 시간
8차시 과정
강의 계획서
| 차시 | 주제 | 내용 |
|---|---|---|
| 1 | AI 기반 개발 환경 구축 | – ChatGPT, Claude, Copilot 활용 – AI를 활용한 코드 생성 및 디버깅 – 개발 과정에서의 프롬프트 작성 방법 |
| 2 | PostgreSQL 기본 쿼리 및 검색 데이터 처리 | – SELECT, WHERE, JOIN 등 PostgreSQL 기본 쿼리 – AI를 활용한 SQL 작성 및 수정 – 검색 데이터 구조와 인덱스의 기본 개념 |
| 3 | 고급 SQL 및 검색 구조 이해 | – 서브쿼리와 CTE 활용 – 다중 테이블 조회 및 집계 – pg_trgm 기반 텍스트 유사 검색– pgvector 기반 의미 검색 구조 이해 |
| 4 | 검색 데이터 전처리 | – Pandas 기반 Excel·CSV 데이터 처리 – 결측치 처리 및 데이터 정제 – 검색용 데이터 변환 – 임베딩 생성을 위한 데이터 준비 |
| 5 | 검색 인덱스 최적화 | – pg_trgm 검색 인덱스 구성– pgvector HNSW 인덱스 구성 – HNSW 파라미터 튜닝 – EXPLAIN ANALYZE를 활용한 실행 계획 및 성능 분석 |
| 6 | 하이브리드 검색 API | – FastAPI 기반 검색 API 구현 – pg_trgm과 vector 검색 점수 결합– 텍스트 검색과 의미 검색을 결합한 하이브리드 검색 구현 |
| 7 | 검색 품질 검증 | – 다양한 검색 시나리오 테스트 – 붙여쓰기·오타·의미 검색 정확도 검증 – 검색 품질 평가 – Grid Search를 활용한 최적 검색 가중치 도출 |
| 8 | 운영 및 확장 | – 임베딩 배치 갱신 전략 – 검색 로그 모니터링 – 대용량 데이터 확장 시 고려사항 – Elasticsearch 등 전문 검색 시스템으로의 확장 기준 |