[LLM] LLM 서빙과 최적화: 단일 모델 서빙 시스템 - 3.2. 배치 요청: 정적 배칭의 효과와 한계
배치의 의미를 정리하고, 실습으로 정적 배칭의 처리량 향상과 한계를 측정해 보자.
배치의 의미를 정리하고, 실습으로 정적 배칭의 처리량 향상과 한계를 측정해 보자.
서비스를 직접 기동해 프로세스 구조를 관찰하고, 부하 테스트로 단일 워커의 순차 처리 병목을 재현해 보자.
단일 모델 서빙 서비스의 코드를 컴포넌트 단위로 해부하며, 프로세스 분리와 큐 기반 IPC가 어떻게 구현되는지 살펴보자.
트랜스포머 학습을 서빙과 잇고, 왜 프레임워크 없이 서빙 시스템을 직접 만드는지 그려 보자.
GPU ECC 발생 사례를 통해 VRAM DBE 발생부터 분산 학습 실패, row remapping과 리셋 복구까지 알아 보자.
CoreDNS 레플리카 하나가 반환한 공용 IP, 그 간헐 실패의 진단과 해결 기록
트랜스포머 블록의 출력이 토큰이 되는 과정에 대해 알아 보자.
어텐션이 모아 온 정보를 토큰별로 비선형 가공하는 MLP 서브레이어에 대해 알아 보자.
Q·K·V 생성부터 멀티헤드 분할, 스케일링·마스킹·softmax, V 가중합과 출력 사영까지 — 셀프 어텐션의 실제 계산을 수식과 shape 변화로 하나씩 뜯어 보자.
트랜스포머 블록의 첫 서브레이어인 멀티헤드 셀프 어텐션에 대해 알아 보자.
트랜스포머의 입구인 임베딩이 텍스트를 벡터로 바꾸는 과정을 줌인해 보자.
Transformer Explainer를 이용해 브라우저에서 GPT-2를 이용해 트랜스포머 내부를 들여다 보자.