[LLM] LLM 서빙과 최적화: 고급 최적화 기법 - 7.2.2. speculative decoding 실습: 네 가지 변형 벤치마크와 측정 검증
vLLM에서 vanilla, n-gram, EAGLE-3 변형을 동시성 1과 16으로 실측해 보자.
vLLM에서 vanilla, n-gram, EAGLE-3 변형을 동시성 1과 16으로 실측해 보자.
추측과 병렬 검증으로 decode를 가속하는 speculative decoding의 원리에 대해 알아 보자.
LLM 서빙 고급 최적화 기법(speculative decoding, 멀티 GPU 분산, PD 분리, 고급 KV 캐싱)에 대해 알아 보자.
클러스터 밖으로 노출된 접속용 포트를 클러스터 내부 Service 포트로 착각하면 어떤 증상이 나타나는지 알아 보자.
서빙 최적화 기법의 출발점인 배칭의 큰 흐름을 실행 단위, 동기, 구조, 재구성 시점 순으로 잡아 보자.
NVIDIA 밖 AI 가속기 지형과 메모리 벽 완화 트렌드를 살펴보고 5장을 정리해 보자.
모델 로딩의 메모리 용량 제약과 실행 단계의 병목을 산술 강도로 분석해 보자.
GPU 인터커넥트의 대역폭 계층을 이해하고 모델 크기별 GPU 선택 기준을 세워 보자.
GPU 스펙의 연산·메모리 속성을 읽고 H100 SXM과 NVL을 비교해 보자.
LLM 서빙 최적화가 고객 경험·비용·확장성을 어떻게 좌우하는지 알아 보자.
Roofline 모델을 LLM 서빙 워크로드에 세 점으로 나눠 찍고, 실제 서빙에 적용해 그래프를 그려 보자.
Roofline 모델에 대해 알아 보자.