교육과정AI 개발·에이전트

온프레미스 sLLM 운영

내부망에서 소형 언어모델을 직접 띄우고, 서빙과 모니터링까지 운영하는 절차를 익힙니다.

결과물 · 내부망 기준 sLLM 서빙 구성도와 배포 스크립트, 자원 산정표, 장애 대응·모델 교체 절차서#sLLM#온프레미스#LLM서빙#GPU운영#모니터링

교육 대상

  • 기관 정보시스템 운영·인프라 담당자
  • 내부망 AI 서비스 구축을 맡은 개발자
  • AI 인프라 도입 사업을 관리하는 정보화 담당자

학습 목표

  • 외부 API와 내부망 자체 운영의 선택 기준을 요구사항 기준으로 정리합니다.
  • 공개 모델을 양자화해 보유 장비에 맞는 서빙 구성으로 배포합니다.
  • 동시 요청과 응답 지연을 측정해 필요한 자원 규모를 산정합니다.
  • 장애 상황과 모델 교체 상황에 대응하는 운영 절차를 문서로 남깁니다.

커리큘럼

1일차 · DAY 1
1일차 1교시
120
어디까지 직접 운영할지 정하기
망분리와 자료 반출 제약이 있는 환경에서 가능한 구성 방식을 비교합니다. 외부 API, 내부망 자체 운영, 혼합 구성의 비용과 제약을 항목별로 정리합니다. 담당 업무의 요구사항을 적어 자기 기관에 맞는 구성 방향을 결정합니다.
1일차 2교시
120
모델 선정과 양자화
공개 가중치 모델의 라이선스와 상업적 이용 조건을 확인하는 절차를 다룹니다. 같은 과제로 여러 크기의 모델을 비교해 필요한 모델 규모를 판단합니다. 양자화 형식별로 메모리 사용량과 응답 품질 변화를 직접 측정합니다.
1일차 3교시
120
서빙 엔진 배포 실습
오픈소스 서빙 엔진을 컨테이너로 올리고 기동 옵션을 조정합니다. 모델 적재 시간, 컨텍스트 길이, 배치 설정이 동작에 미치는 영향을 확인합니다. 기존 업무 시스템이 호출할 수 있도록 API 형식과 엔드포인트를 정리합니다.
1일차 4교시
120
자원 계획과 동시 처리
GPU 메모리를 모델 가중치와 캐시로 나눠 보고 남는 여유를 계산합니다. 동시 요청 수를 늘려가며 처리량과 대기 시간 변화를 기록합니다. 장비를 늘릴 시점과 모델을 줄일 시점을 판단하는 기준을 정합니다.
2일차 · DAY 2
2일차 1교시
120
게이트웨이와 인증, 요청 기록
서빙 엔진을 직접 노출하지 않고 앞단에 게이트웨이를 두는 구조를 만듭니다. 부서별 키 발급과 호출량 제한을 설정합니다. 감사에 필요한 요청 기록 항목과 개인정보 마스킹 기준을 정합니다.
2일차 2교시
120
모니터링과 장애 대응
응답 지연, 오류율, GPU 사용률을 수집해 대시보드로 확인합니다. 모델 응답이 끊기거나 메모리가 부족할 때 나타나는 증상을 재현합니다. 증상별 확인 순서와 조치 방법을 대응 절차로 작성합니다.
2일차 3교시
120
부하 테스트와 용량 산정
예상 이용자 수와 사용 시간대를 반영한 부하 시나리오를 만듭니다. 부하를 걸어 처리 한계와 응답 지연 상한을 측정합니다. 측정값을 근거로 도입 규모와 증설 계획을 산정표에 정리합니다.
2일차 4교시
120
모델 교체와 운영 인수인계
새 모델로 바꿀 때 기존 응답 품질을 확인하는 비교 절차를 만듭니다. 무중단 교체와 되돌리기 절차를 실습으로 확인합니다. 구성도, 배포 스크립트, 대응 절차를 묶어 인수인계 문서로 마무리합니다.

총 16시간(960분) — 모듈 960분

교육 문의카카오톡 문의02-533-4770