전체 글

전체 글

    [4주차-LLMSO]CH8. LLM Serving Frameworks (2026.08.23)

    [4주차-LLMSO]CH8. LLM Serving Frameworks (2026.08.23)

    CH8 · LLM Serving Frameworks 들어가며 1 왜 전용인가 2 두 개의 티어 3 vLLM 두 얼굴 4 내부 계층 5 초기화 6 요청 실행 7 스케줄러 8 토큰 예산 9 4계층 최적화 10 TensorRT-LLM 11 SGLang 12 케이스북 13 llama.cpp 14 고르기 마치며 LLM 서빙 스터디 4주차 · CH8 학습자료 기법을 담는그릇을 열어보기. LLM Serving Frameworks — 5~7장이 "무엇을 어떻게 최적화하는가"였다면, 이 장은 "그 최적화들이 실제로 어느 코드에 어떻게 얹혀 있는가"입니다. 프레임워크가 넷입니다 — vLLM, TensorRT-LLM, SGLang, llama.cpp. 그중 vLLM은 안을 열어 봅니다..

    [4주차-LLMSO]CH7. Advanced LLM Optimization Techniques (2026.08.23)

    [4주차-LLMSO]CH7. Advanced LLM Optimization Techniques (2026.08.23)

    CH7 · Advanced LLM Optimization 들어가며 1 추측 디코딩 2 거부와 복원 3 드래프트 고르기 4 K 튜닝 5 추측 실측 6 병렬화 지도 7 텐서 병렬 8 파이프라인과 버블 9 NVLink와 선택 10 MoE와 EP 11 DP와 라우팅 12 P/D 분리 13 핸드오프 값 14 RAG vs CAG 15 LMCache 마치며 LLM 서빙 스터디 4주차 · CH7 학습자료 GPU 한 장의 경계를넘어가는 법. Advanced LLM Optimization Techniques — 6장이 "한 장 안에서 비율 하나를 움직이는 법"이었다면, 이 장은 "그 한 장으로 안 될 때 무엇을 쪼개고 무엇을 갈라놓는가"입니다. 기법이 넷입니다 — 추측적 디코딩, 병..

    [3주차-LLMSO]CH6. Essential LLM Optimization Techniques (2026.08.16)

    [3주차-LLMSO]CH6. Essential LLM Optimization Techniques (2026.08.16)

    CH6 · Essential LLM Optimization 들어가며 1 배칭의 원리 2 동적 배칭 3 연속 배칭 4 청크 프리필 5 세 파라미터 6 MHA→MLA 7 커널과 FlashAttention 8 PagedAttention 9 양자화 기초 10 W4A16 · W8A8 11 실측 벤치마크 12 증류와 가지치기 13 프리픽스 캐싱 14 캐시 인지 라우팅 15 vLLM 실습 마치며 LLM 서빙 스터디 3주차 · CH6 학습자료 가중치를 한 번 읽고몇 번 계산할 것인가. Essential LLM Optimization Techniques — 5장이 "어디가 병목인가"였다면, 이 장은 "그 병목을 어떻게 옮기는가"입니다. 기법 이름이 쏟아집니다 — continuous..

    [3주차-LLMSO]CH5. Challenges When Serving LLMs (2026.08.16)

    [3주차-LLMSO]CH5. Challenges When Serving LLMs (2026.08.16)

    CH5 · Challenges When Serving LLMs 들어가며 1 고객 체험 2 추론 비용 3 피크 부하 4 GPU 스펙 5 피자 가게 6 노드 안 7 노드 밖 8 GPU 고르기 9 모델 로딩 10 모델 크기 11 KV 캐시 12 루프라인 13 행렬곱 14 Prefill · Decode 15 메모리 벽 마치며 LLM 서빙 스터디 3주차 · CH5 학습자료 느린 이유가연산 부족이 아닐 때. Challenges When Serving LLMs — 3·4장이 "무엇을 어떻게 짓는가"였다면, 이 장은 "그게 왜 느리고 왜 비싼가"입니다. TFLOPS가 높은 GPU를 샀는데 느립니다. 메모리가 모델보다 큰데 OOM이 납니다. 이 장은 그런 일이 왜 벌어지는지를 숫..

    [2주차-LLMSO]CH4. Model Serving Best Practices (2026.08.09)

    [2주차-LLMSO]CH4. Model Serving Best Practices (2026.08.09)

    CH4 · Serving Best Practices 들어가며 1 왕복 네 번 2 에이전트 부품 3 9단계 워크플로우 4 RAG 5 CAG 6 일곱 개의 층 7 Public API 8 모델 선택 9 Ray Serve 10 멀티플렉싱 11 KubeRay 12 여섯 단계 13 손익분기점 14 Build or Buy 15 지연시간 16 처리량 마치며 LLM 서빙 스터디 2주차 · CH4 학습자료 질문은 하나였는데왕복은 네 번이었습니다. Model Serving Best Practices — 2·3장이 "모델을 어떻게 실행하는가"였다면, 이 장은 "프로덕션에서 무엇이 더 필요한가"입니다. 에이전트가 등장하면서 요청 한 건의 의미가 달라졌고, 그래서 서빙은 순수 추론 문제..

    [2주차-LLMSO]CH3. Model Serving System Design A Deep Dive (2026.08.09)

    [2주차-LLMSO]CH3. Model Serving System Design A Deep Dive (2026.08.09)

    CH3 · Serving System Design 들어가며 1 여섯 부품 2 프로세스 격리 3 요청 한 건 4 대기실 5 ID 매핑 6 스트리밍 7 KV 캐시 8 vLLM 9 일반 설계 10 멀티모델 11 LRU 캐시 12 팩토리 13 Triton 14 트레이드오프 마치며 LLM 서빙 스터디 2주차 · CH3 학습자료 서빙 시스템은파일 여섯 개로 되어 있습니다. Model Serving System Design: A Deep Dive — 이 장은 프레임워크를 쓰는 법이 아니라, 서빙 시스템을 직접 만들어보며 각 부품이 왜 거기 있는지를 봅니다. 그래서 이 페이지는 소스코드의 파일 하나하나가 무엇을 맡고 있는지를 중심으로 갑니다. llm.py가 왜 필요한지, work..

    [1주차-LLMSO]LLM 기초 동작 원리 (2026.08.02)

    [1주차-LLMSO]LLM 기초 동작 원리 (2026.08.02)

    LLM 기초 · 동작 원리 들어가며 1 가중치 2 역전파 3 GPU 4 Transformer 5 텐서·임베딩 6 GPT-2 해부 7 입력 만들기 8 Attention 9 Head·MLP 10 Residual·LN 11 출력 12 Gradient 13 dtype·양자화 14 정리 마치며 LLM 서빙 스터디 1주차 · LLM 기초 학습자료 숫자 몇 개가말을 하게 되기까지. 가중치 하나짜리 신경에서 시작해서, GPT-2 Small의 124,439,808개 숫자가 다음 단어 하나를 고르는 순간까지 — 중간을 건너뛰지 않고 이어서 봅니다. 수식은 전부 실었습니다. 다만 본문에는 두지 않고 접는 상자 안에 넣었고, 기호 하나하나를 한국어로 읽는 법까지 붙였습니다. 맨 끝에 수..

    [1주차-LLMSO]CH2. Large Language Model Serving (2026.08.02)

    [1주차-LLMSO]CH2. Large Language Model Serving (2026.08.02)

    CH2 · LLM Serving 들어가며 1 LLM 발전 2 자기회귀 3 Decoder-only 4 Attention 5 생성 루프 6 KV Cache 7 Prefill·Decode 8 vLLM 9 PagedAttention 10 Streaming 11 Batching 12 정리 마치며 LLM 서빙 스터디 1주차 · CH2 학습자료 토큰 하나가 나오기까지안에서 벌어지는 일. Large Language Model Serving — Transformer 안을 열어보고, 토큰 생성 루프를 직접 돌려보고, KV Cache · PagedAttention · streaming · batching이 왜 그렇게 생겼는지까지. 수학은 거의 안 나옵니다. 나오는 것은 전부 접는 상자 안에..

    [1주차-LLMSO]CH1. Introduction to Model Serving and Optimization (2026.08.02)

    [1주차-LLMSO]CH1. Introduction to Model Serving and Optimization (2026.08.02)

    CH1 · Model Serving 들어가며 1 구성요소 2 생명주기 3 서빙이란 4 왜 공부하나 5 최적화 6 vLLM 7 On-Device 8 Single 9 Multi 10 Platform 11 정리 마치며 LLM 서빙 스터디 1주차 · CH1 학습자료 학습이 끝난 모델을진짜 서비스로 만드는 일. Introduction to Model Serving and Optimization — 모델이 무엇으로 이루어져 있는지부터, 그것을 API로 내보내고 빠르고 싸게 굴리는 네 가지 방법까지. 수학은 거의 나오지 않습니다. 나오는 것은 전부 접는 상자 안에 넣었고, 본문은 덧셈과 곱셈만으로 따라갈 수 있게 썼습니다. 이 자료가 지키는 것 ① 전문 용어는 영어 그..

    [1주차-LLMSO]트랜스포머 모델을 이해하기 위한 기초 수학 정리

    [1주차-LLMSO]트랜스포머 모델을 이해하기 위한 기초 수학 정리

    순서 1. 벡터 2. 회전 3. 사원수 4. 합과 곱 5. 내적·외적 6. 어텐션 7. 위치 8. 확률 9. 학습 정리 안녕하세요, Devlos 입니다. 오랜만에 CloudNet@에서 진행하는 Hands-On LLM Serving and Optimization Study에 참여하게 되었습니다. 항상 공부할때마다 아리송한 Transformer 모델을 이해하고자 필요한 내용을 정리해 보았어요. 스터디에서 추천해 주신 침착맨과 정승재 강사님의 영상 개념이 곱의 법칙과 합의 법칙을 상기하는데 도움이 많이 되었어요 ㅎㅎ 수학적 개념들을 최대한 풀어서, 이런 개념들이 왜 Transformer 모델에 필요한지에 대한 설명을 정리해 보았습니다 Transformer Mod..