[LLM] LLM 서빙과 최적화: LLM 서빙의 도전 과제 - 5.5. AI 가속기 지형과 메모리 벽
NVIDIA 밖 AI 가속기 지형과 메모리 벽 완화 트렌드를 살펴보고 5장을 정리해 보자.
NVIDIA 밖 AI 가속기 지형과 메모리 벽 완화 트렌드를 살펴보고 5장을 정리해 보자.
모델 로딩의 메모리 용량 제약과 실행 단계의 병목을 산술 강도로 분석해 보자.
GPU 인터커넥트의 대역폭 계층을 이해하고 모델 크기별 GPU 선택 기준을 세워 보자.
GPU 스펙의 연산·메모리 속성을 읽고 H100 SXM과 NVL을 비교해 보자.
LLM 서빙 최적화가 고객 경험·비용·확장성을 어떻게 좌우하는지 알아 보자.
Roofline 모델을 LLM 서빙 워크로드에 적용해 보자.
Roofline 모델에 대해 알아 보자.
스펙표의 TFLOPS가 어디서 나오는지 SM 구조로 분해해 보자.
GPU 인터커넥트의 경계가 무엇으로 정해지는지 die부터 랙까지 따라가 보자.
prefill과 decode 개념에 대해 알아 보자.
트랜스포머 학습을 서빙과 잇고, 왜 프레임워크 없이 서빙 시스템을 직접 만드는지 그려 보자.
GPU ECC 발생 사례를 통해 VRAM DBE 발생부터 분산 학습 실패, row remapping과 리셋 복구까지 알아 보자.