[LLM] LLM 서빙과 최적화 - 2.7. Transformer: 출력층과 샘플링, 아키텍처 마무리
트랜스포머 블록의 출력이 토큰이 되는 과정에 대해 알아 보자.
트랜스포머 블록의 출력이 토큰이 되는 과정에 대해 알아 보자.
LLM 서빙을 이해하기 위한 언어 모델의 발전, 트랜스포머 아키텍처 개요에 대해 알아 보자.
가중치는 어떻게 학습되며, 그 숫자들이 모델의 판단 능력을 어떻게 결정하는지 알아보자.
Superb AI 세미나에서 들은 연속 학습 방법론을 정리하고, MLOps 플랫폼 엔지니어가 배워야 할 점에 대해 생각해 보자.
커널 메시지를 보관하는 링버퍼의 사본은 누가 어떻게 보존하는지 알아 보자.
커널 메시지는 누가 어디에 쓰고, dmesg는 무엇을 읽는지에 대해 알아 보자.
CI 스크립트에서 만난 python3 -m pytest를 계기로, 파이썬 실행 방식에 따라 sys.path와 import, 인터프리터 선택이 어떻게 달라지는지 정리하고 직접 확인해 보자.
서로 다른 기종의 GPU를 한 DDP 잡에 섞으면 어떻게 되는지 직접 확인하고, 동기 데이터 병렬에서 이기종 GPU가 손해인 이유를 정리해 보자.
ECC가 무엇이고 GPU에서 어떻게 동작하는지, 왜 중요한지 짚어 보자.
unattended-upgrades가 NVIDIA 드라이버 버전 불일치와 kube-proxy IPVS 장애를 연쇄적으로 일으킨 과정과 교훈을 정리해 보자.
soname/ABI 계약, RPATH와 RUNPATH의 우선순위 역전, 정적 링크 트레이드오프, NVIDIA pip 이중 구조를 정리해 보자.
NCCL 분산학습 종료 후 14/32 GPU가 Util 100%·메모리 0·프로세스 없음 상태에 빠졌다. CUDA context 잔류를 유력 가설로 두되, 직접 증거를 확보하지 못한 한계까지 함께 살펴보자.