[Nsight] Nsight 프로파일러: 4. ncu 수집과 커널 판정
ncu 리포트를 어느 순서로 읽고, 어떤 숫자가 병목 판정을 가르는지 정리해 보자.
ncu 리포트를 어느 순서로 읽고, 어떤 숫자가 병목 판정을 가르는지 정리해 보자.
nsys로 무엇을 어떻게 수집하고, 뷰어에 뜬 리포트를 어느 순서로 읽어 병목을 판정하는지 정리해 보자.
로컬·컨테이너·쿠버네티스·런타임 exec 환경에서 프로파일러를 붙일 때 마주치는 다섯 가지 문제를 정리해 보자.
맥에 뷰어를 깔고 Colab T4로 리포트를 하나 떠 보면서, Nsight가 무엇을 재고 그 측정 방식이 어떤 제약을 만드는지 정리해 보자.
LLMSO 스터디에서 정리한 GPU 스펙·인터커넥트 프레임 및 서빙 전략을 실제 클러스터에 적용해 보자.
vLLM에서 vanilla, n-gram, EAGLE-3 변형을 동시성 1과 16으로 실측해 보자.
추측과 병렬 검증으로 decode를 가속하는 speculative decoding의 원리에 대해 알아 보자.
LLM 서빙 고급 최적화 기법(speculative decoding, 멀티 GPU 분산, PD 분리, 고급 KV 캐싱)에 대해 알아 보자.
클러스터 밖으로 노출된 접속용 포트를 클러스터 내부 Service 포트로 착각하면 어떤 증상이 나타나는지 알아 보자.
서빙 최적화 기법의 출발점인 배칭의 큰 흐름을 실행 단위, 동기, 구조, 재구성 시점 순으로 잡아 보자.
NVIDIA 밖 AI 가속기 지형과 메모리 벽 완화 트렌드를 살펴보고 5장을 정리해 보자.
모델 로딩의 메모리 용량 제약과 실행 단계의 병목을 산술 강도로 분석해 보자.