전체 글

전체 글

    [7주차-LLMSO] llm-d 란 (2026.09.13)

    [7주차-LLMSO] llm-d 란 (2026.09.13)

    7W-2 · llm-d 들어가며 1 왜 라우터인가 2 세 부품 3 EPP ① 흐름 제어 4 EPP ② 스케줄러 5 KV 캐시 6 두 개의 라우터 7 실습 환경 8 벤치마크 9 설치와 비교 10 트레이싱 11 동작 확인 마치며 LLMSO 7주차 · [7W-2] llm-d 같은 모델 파드 여러 개 중누구에게 보낼 것인가. vLLM 파드를 두 개로 늘리면 쿠버네티스 Service가 알아서 나눠 줍니다. 그런데 Service는 어느 파드의 KV 캐시에 방금 그 프롬프트가 들어 있는지, 어느 파드 앞에 긴 요청이 줄 서 있는지 모릅니다. llm-d는 그걸 아는 라우터입니다. 부품 셋과 EPP의 안쪽을 열고, GPU 한 장을 반씩 나눈 실습 클러스터에서 실제로 무엇이 달라졌는지 봅니다..

    [7주차-LLMSO] Envoy: Agent Router (2026.09.13)

    [7주차-LLMSO] Envoy: Agent Router (2026.09.13)

    7W-1 · Envoy와 Agent Router 들어가며 1 Envoy 2 xDS 3 타임아웃·재시도 4 요청의 일생 5 필터 체인 6 속도 제한 7 AI Gateway 8 토큰 제한 9 ext_proc 10 실습 ① 11 실습 ② 마치며 LLMSO 7주차 · [7W-1] Envoy: Agent Router 프록시 하나로LLM 앞문을 세우기까지. OpenAI, Anthropic, 사내 vLLM. 모델이 늘어날수록 앱마다 키를 복사하고, 재시도 로직을 새로 짜고, 비용은 청구서가 와야 압니다. 10년 전 마이크로서비스가 겪은 일과 같은 문제이고, 그때 답이었던 Envoy가 이번에도 가운데에 있습니다. Envoy의 기본기부터 Agent Router(구 Envoy AI Gate..

    [6주차-LLMSO] Scaling LLM Inference with vLLM and AWS Trainium (2026.09.06)

    [6주차-LLMSO] Scaling LLM Inference with vLLM and AWS Trainium (2026.09.06)

    6W-1 · AWS Trainium 워크샵 들어가며 1 AWS Neuron 2 워크샵의 지도 3 클러스터 세우기 4 NVIDIA vs Neuron 5 vLLM 올리기 6 바깥에서 부르기 7 보이게 만들기 8 성능 재기 9 늘리기 10 치우기 마치며 LLMSO 6주차 · [6W-1] Scaling LLM Inference with vLLM and AWS Trainium AWS 위 CUDA가 없는 환경에서vLLM을 띄운다. 이번 주는 책이 아니라 손입니다. NVIDIA GPU가 한 장도 없는 EKS 클러스터에 AWS가 직접 설계한 칩을 꽂고, 그 위에 vLLM을 올려 OpenAI 호환 API까지 뽑아냅니다. 같은 vLLM인데 밑바닥이 통째로 다릅니다. 들어가며 읽는 ..

    [5주차-LLMSO]CH10. Advancements in LLM Serving (2026.08.30)

    [5주차-LLMSO]CH10. Advancements in LLM Serving (2026.08.30)

    CH10 · 서빙의 다음 단계 들어가며 1 시맨틱 캐싱·라우팅 2 LiteLLM 게이트웨이 3 성능 프로파일링 4 멀티모달 서빙 5 엣지 AI 6 Multi-LoRA 7 강화학습과 서빙 8 기법 총정리 마치며 LLMSO 5주차 · CH10 Advancements in LLM Serving 서빙 엔진이판단하기 시작했다. 지금까지 서빙은 "모델 하나를 빠르게 돌리는 일"이었습니다. 이 장에서는 요청의 의미를 읽고, 어떤 모델로 보낼지, 어떤 도구를 쥐여줄지, 어디서 실행할지까지 서빙 계층이 결정하기 시작합니다. 들어가며 읽는 시간 30분 대상 vLLM으로 서빙은 해봤고 다음이 궁금한 사람 사전 지식 KV 캐시·배칭·GPU라는 말을 아는 정도 그림 9개 +..

    [5주차-LLMSO]CH9. LLM Optimization in Practice (2026.08.30)

    [5주차-LLMSO]CH9. LLM Optimization in Practice (2026.08.30)

    CH9 · 실전 최적화 들어가며 1 최적화 계획 2 하드웨어 점검 3 벤치마크 트래픽 4 평가 지표 5 메모리 읽기 6 베이스라인 7 양자화 8 추가 튜닝 9 분산 서빙 10 트레이드오프 마치며 LLMSO 5주차 · CH9 LLM Optimization in Practice 처리량이 올랐다는 건계산이 빨라진 걸까,덜 계산한 걸까. Qwen3-14B 한 대를 vLLM으로 띄워놓고, 여덟 단계에 걸쳐 처리량을 2.7배까지 끌어올리는 과정입니다. 그리고 그 2.7배가 어디에서 왔는지를 프로파일러로 끝까지 따라가 봅니다. 들어가며 읽는 시간 35분 대상 vLLM은 띄워봤지만 튜닝은 안 해본 개발자 사전 지식 GPU·KV 캐시라는 말을 들어본 정도 그림 10..

    [4주차-LLMSO]CH8. LLM Serving Frameworks (2026.08.23)

    [4주차-LLMSO]CH8. LLM Serving Frameworks (2026.08.23)

    CH8 · LLM Serving Frameworks 들어가며 1 왜 전용인가 2 두 개의 티어 3 vLLM 두 얼굴 4 내부 계층 5 초기화 6 요청 실행 7 스케줄러 8 토큰 예산 9 4계층 최적화 10 TensorRT-LLM 11 SGLang 12 케이스북 13 llama.cpp 14 고르기 마치며 LLM 서빙 스터디 4주차 · CH8 학습자료 기법을 담는그릇을 열어보기. LLM Serving Frameworks — 5~7장이 "무엇을 어떻게 최적화하는가"였다면, 이 장은 "그 최적화들이 실제로 어느 코드에 어떻게 얹혀 있는가"입니다. 프레임워크가 넷입니다 — vLLM, TensorRT-LLM, SGLang, llama.cpp. 그중 vLLM은 안을 열어 봅니다..

    [4주차-LLMSO]CH7. Advanced LLM Optimization Techniques (2026.08.23)

    [4주차-LLMSO]CH7. Advanced LLM Optimization Techniques (2026.08.23)

    CH7 · Advanced LLM Optimization 들어가며 1 추측 디코딩 2 거부와 복원 3 드래프트 고르기 4 K 튜닝 5 추측 실측 6 병렬화 지도 7 텐서 병렬 8 파이프라인과 버블 9 NVLink와 선택 10 MoE와 EP 11 DP와 라우팅 12 P/D 분리 13 핸드오프 값 14 RAG vs CAG 15 LMCache 마치며 LLM 서빙 스터디 4주차 · CH7 학습자료 GPU 한 장의 경계를넘어가는 법. Advanced LLM Optimization Techniques — 6장이 "한 장 안에서 비율 하나를 움직이는 법"이었다면, 이 장은 "그 한 장으로 안 될 때 무엇을 쪼개고 무엇을 갈라놓는가"입니다. 기법이 넷입니다 — 추측적 디코딩, 병..

    [3주차-LLMSO]CH6. Essential LLM Optimization Techniques (2026.08.16)

    [3주차-LLMSO]CH6. Essential LLM Optimization Techniques (2026.08.16)

    CH6 · Essential LLM Optimization 들어가며 1 배칭의 원리 2 동적 배칭 3 연속 배칭 4 청크 프리필 5 세 파라미터 6 MHA→MLA 7 커널과 FlashAttention 8 PagedAttention 9 양자화 기초 10 W4A16 · W8A8 11 실측 벤치마크 12 증류와 가지치기 13 프리픽스 캐싱 14 캐시 인지 라우팅 15 vLLM 실습 마치며 LLM 서빙 스터디 3주차 · CH6 학습자료 가중치를 한 번 읽고몇 번 계산할 것인가. Essential LLM Optimization Techniques — 5장이 "어디가 병목인가"였다면, 이 장은 "그 병목을 어떻게 옮기는가"입니다. 기법 이름이 쏟아집니다 — continuous..

    [3주차-LLMSO]CH5. Challenges When Serving LLMs (2026.08.16)

    [3주차-LLMSO]CH5. Challenges When Serving LLMs (2026.08.16)

    CH5 · Challenges When Serving LLMs 들어가며 1 고객 체험 2 추론 비용 3 피크 부하 4 GPU 스펙 5 피자 가게 6 노드 안 7 노드 밖 8 GPU 고르기 9 모델 로딩 10 모델 크기 11 KV 캐시 12 루프라인 13 행렬곱 14 Prefill · Decode 15 메모리 벽 마치며 LLM 서빙 스터디 3주차 · CH5 학습자료 느린 이유가연산 부족이 아닐 때. Challenges When Serving LLMs — 3·4장이 "무엇을 어떻게 짓는가"였다면, 이 장은 "그게 왜 느리고 왜 비싼가"입니다. TFLOPS가 높은 GPU를 샀는데 느립니다. 메모리가 모델보다 큰데 OOM이 납니다. 이 장은 그런 일이 왜 벌어지는지를 숫..

    [2주차-LLMSO]CH4. Model Serving Best Practices (2026.08.09)

    [2주차-LLMSO]CH4. Model Serving Best Practices (2026.08.09)

    CH4 · Serving Best Practices 들어가며 1 왕복 네 번 2 에이전트 부품 3 9단계 워크플로우 4 RAG 5 CAG 6 일곱 개의 층 7 Public API 8 모델 선택 9 Ray Serve 10 멀티플렉싱 11 KubeRay 12 여섯 단계 13 손익분기점 14 Build or Buy 15 지연시간 16 처리량 마치며 LLM 서빙 스터디 2주차 · CH4 학습자료 질문은 하나였는데왕복은 네 번이었습니다. Model Serving Best Practices — 2·3장이 "모델을 어떻게 실행하는가"였다면, 이 장은 "프로덕션에서 무엇이 더 필요한가"입니다. 에이전트가 등장하면서 요청 한 건의 의미가 달라졌고, 그래서 서빙은 순수 추론 문제..