[LLM] LLM 서빙과 최적화: 고급 최적화 기법 - 7.1. 개요: 단일 GPU 너머의 네 기법
LLM 서빙 고급 최적화 기법(speculative decoding, 멀티 GPU 분산, PD 분리, 고급 KV 캐싱)에 대해 알아 보자.
LLM 서빙 고급 최적화 기법(speculative decoding, 멀티 GPU 분산, PD 분리, 고급 KV 캐싱)에 대해 알아 보자.
클러스터 밖으로 노출된 접속용 포트를 클러스터 내부 Service 포트로 착각하면 어떤 증상이 나타나는지 알아 보자.
서빙 최적화 기법의 출발점인 배칭의 큰 흐름을 실행 단위, 동기, 구조, 재구성 시점 순으로 잡아 보자.
LLM 서빙 최적화가 고객 경험·비용·확장성을 어떻게 좌우하는지 알아 보자.
Roofline 모델을 LLM 서빙 워크로드에 세 점으로 나눠 찍고, 실제 서빙에 적용해 그래프를 그려 보자.
Roofline 모델에 대해 알아 보자.
prefill과 decode 개념에 대해 알아 보자.
트랜스포머 학습을 서빙과 잇고, 왜 프레임워크 없이 서빙 시스템을 직접 만드는지 그려 보자.
GPU ECC 발생 사례를 통해 VRAM DBE 발생부터 분산 학습 실패, row remapping과 리셋 복구까지 알아 보자.
CoreDNS 레플리카 하나가 반환한 공용 IP, 그 간헐 실패의 진단과 해결 기록
트랜스포머 블록의 출력이 토큰이 되는 과정에 대해 알아 보자.
LLM 서빙을 이해하기 위한 언어 모델의 발전, 트랜스포머 아키텍처 개요에 대해 알아 보자.