교육 대상
- 기관 내 AI 서비스를 직접 개발하는 개발자
- 문서 검색·지식관리 시스템 담당자
- AI 도입 사업을 기술 검토하는 정보화 담당자
학습 목표
- 문서 유형에 맞는 청킹과 임베딩 조합을 근거를 들어 선택합니다.
- 키워드 검색과 벡터 검색을 결합한 검색 파이프라인을 직접 구성합니다.
- 검색 품질을 Recall@k 같은 지표로 측정하고 변경 전후를 비교합니다.
- 열람 권한과 문서 개정을 반영하는 인덱스 운영 절차를 문서로 남깁니다.
커리큘럼
1일차 · DAY 1
1일차 1교시
140분
검색 단계가 답변 품질을 정한다
생성 단계보다 검색 단계에서 품질이 갈리는 이유를 실제 오답 사례로 확인합니다.
기관 문서 검색에서 반복되는 실패 유형을 질의 유형별로 분류합니다.
파이썬과 오픈소스 벡터 저장소로 실습 환경을 만들고 비교 기준이 될 베이스라인을 세웁니다.
1일차 2교시
140분
문서 수집과 파싱, 청킹 설계
PDF·HWP·표가 섞인 문서를 텍스트로 정리하는 전처리 순서를 정합니다.
고정 길이 청킹, 문단 청킹, 제목 기준 청킹을 같은 질의로 비교합니다.
표와 각주가 잘려 의미가 끊기는 문제를 처리 규칙으로 코드에 반영합니다.
1일차 3교시
140분
임베딩 모델 선택과 인덱싱
공개된 한국어 임베딩 모델을 후보로 놓고 동일한 질의 세트로 검색 결과를 비교합니다.
벡터 저장소 인덱스 구조와 메타데이터 스키마를 문서 관리 체계에 맞춰 설계합니다.
재색인 비용을 고려한 배치 적재 스크립트를 작성해 전체 문서를 올립니다.
2일차 · DAY 2
2일차 1교시
140분
키워드와 벡터를 함께 쓰는 하이브리드 검색
BM25 기반 키워드 검색과 벡터 검색이 서로 강한 질의 유형을 나눠 확인합니다.
두 검색 결과를 하나로 합치는 점수 결합 방식을 구현합니다.
법령명·사업명처럼 정확 일치가 필요한 질의를 별도 경로로 처리합니다.
2일차 2교시
140분
쿼리 재작성과 리랭킹
줄임말과 구어체 질의를 검색에 맞는 표현으로 바꾸는 단계를 파이프라인에 넣습니다.
리랭킹 모델을 붙여 상위 후보의 순서를 다시 정합니다.
응답 지연과 정확도의 교환 관계를 측정해 단계 수와 후보 개수를 결정합니다.
2일차 3교시
140분
권한 필터링과 문서 갱신 반영
부서·직급별 열람 권한을 검색 단계에서 걸러내는 구조를 만듭니다.
원문이 개정될 때 인덱스가 따라가도록 갱신 흐름과 주기를 설계합니다.
삭제되거나 비공개로 바뀐 문서를 결과에서 제외하는 처리를 확인합니다.
3일차 · DAY 3
3일차 1교시
140분
검색 품질 평가셋 만들기
담당자 질문과 실제 질의 기록을 모아 질의별 정답 문서를 표시합니다.
Recall@k와 MRR을 계산하는 평가 스크립트를 직접 작성합니다.
지표 변화가 개선인지 표본 차이인지 구분하기 위한 비교 방법을 정합니다.
3일차 2교시
140분
실패 사례 분석과 튜닝 루프
점수가 낮은 질의를 모아 원인을 청킹·임베딩·검색·리랭킹으로 나눕니다.
한 번에 한 요소만 바꾸고 지표 변화를 기록하는 방식으로 개선을 진행합니다.
3~4인 조를 이뤄 서로의 개선 전후 결과를 교차 확인합니다.
3일차 3교시
140분
운영 이관과 결과 발표
인덱스 재구축 절차와 점검 항목을 인수인계 문서로 정리합니다.
검색 품질 지표를 주기적으로 측정하고 이상을 감지하는 방식을 정합니다.
조별로 구축한 파이프라인과 지표 개선 과정을 발표하고 강사 피드백을 받습니다.
총 21시간(1260분) — 모듈 1260분
