[MLflow] 시스템 메트릭 로깅 - 3. 다른 도구와 런타임의 컨테이너 대응
컨테이너 안에서 켠 관측 도구가 노드 값을 보여 주는 문제를, 다른 도구와 언어 런타임은 어떻게 다뤘는지 찾아보자.
컨테이너 안에서 켠 관측 도구가 노드 값을 보여 주는 문제를, 다른 도구와 언어 런타임은 어떻게 다뤘는지 찾아보자.
MLflow 원본을 고치지 않고 pod 내 시스템 메트릭 로깅 문제를 해결한 과정에 대해 정리해 보자.
Envoy의 구조와 xDS 동적 설정, ext_proc 확장을 정리하고, llm-d Router가 ext_proc으로 Envoy에 붙는 방식을 살펴 보자.
노드도 파드도 늘릴 수 없는 환경에서 HPA Lab이 어디까지 가는지, 그리고 CPU 사용률이 추론 워크로드의 스케일 신호가 될 수 있는지 확인해 보자.
자작 스크립트와 llmperf로 vLLM에 부하를 걸고, 두 도구가 낸 수치를 나란히 놓을 수 있는지 확인해 보자.
워크샵이 쓰는 Trainium이 어떤 칩인지, Neuron SDK가 어떤 스택인지, NVIDIA 스택과 어디까지 대응되는지 정리해 보자.
EKS와 AWS Trainium 위에 vLLM을 올리는 워크샵의 목적과 클러스터 아키텍처를 살펴보자.
학습 플랫폼 SDK에 MLflow 시스템 메트릭 로깅 기능을 추가하며, pod 안에서 어떤 문제가 발생할 수 있는지 알아 보자.
맥에 뷰어를 깔고 Colab T4로 리포트를 하나 떠 보면서, Nsight가 무엇을 재고 그 측정 방식이 어떤 제약을 만드는지 정리해 보자.
LLMSO 스터디에서 정리한 GPU 스펙·인터커넥트 프레임 및 서빙 전략을 실제 클러스터에 적용해 보자.
vLLM에서 vanilla, n-gram, EAGLE-3 변형을 동시성 1과 16으로 실측해 보자.
추측과 병렬 검증으로 decode를 가속하는 speculative decoding의 원리에 대해 알아 보자.