llm
[2주차-LLMSO]CH4. Model Serving Best Practices (2026.08.09)
CH4 · Serving Best Practices 들어가며 1 왕복 네 번 2 에이전트 부품 3 9단계 워크플로우 4 RAG 5 CAG 6 일곱 개의 층 7 Public API 8 모델 선택 9 Ray Serve 10 멀티플렉싱 11 KubeRay 12 여섯 단계 13 손익분기점 14 Build or Buy 15 지연시간 16 처리량 마치며 LLM 서빙 스터디 2주차 · CH4 학습자료 질문은 하나였는데왕복은 네 번이었습니다. Model Serving Best Practices — 2·3장이 "모델을 어떻게 실행하는가"였다면, 이 장은 "프로덕션에서 무엇이 더 필요한가"입니다. 에이전트가 등장하면서 요청 한 건의 의미가 달라졌고, 그래서 서빙은 순수 추론 문제..
[2주차-LLMSO]CH3. Model Serving System Design A Deep Dive (2026.08.09)
CH3 · Serving System Design 들어가며 1 여섯 부품 2 프로세스 격리 3 요청 한 건 4 대기실 5 ID 매핑 6 스트리밍 7 KV 캐시 8 vLLM 9 일반 설계 10 멀티모델 11 LRU 캐시 12 팩토리 13 Triton 14 트레이드오프 마치며 LLM 서빙 스터디 2주차 · CH3 학습자료 서빙 시스템은파일 여섯 개로 되어 있습니다. Model Serving System Design: A Deep Dive — 이 장은 프레임워크를 쓰는 법이 아니라, 서빙 시스템을 직접 만들어보며 각 부품이 왜 거기 있는지를 봅니다. 그래서 이 페이지는 소스코드의 파일 하나하나가 무엇을 맡고 있는지를 중심으로 갑니다. llm.py가 왜 필요한지, work..
[1주차-LLMSO]CH2. Large Language Model Serving (2026.08.02)
CH2 · LLM Serving 들어가며 1 LLM 발전 2 자기회귀 3 Decoder-only 4 Attention 5 생성 루프 6 KV Cache 7 Prefill·Decode 8 vLLM 9 PagedAttention 10 Streaming 11 Batching 12 정리 마치며 LLM 서빙 스터디 1주차 · CH2 학습자료 토큰 하나가 나오기까지안에서 벌어지는 일. Large Language Model Serving — Transformer 안을 열어보고, 토큰 생성 루프를 직접 돌려보고, KV Cache · PagedAttention · streaming · batching이 왜 그렇게 생겼는지까지. 수학은 거의 안 나옵니다. 나오는 것은 전부 접는 상자 안에..
[1주차-LLMSO]CH1. Introduction to Model Serving and Optimization (2026.08.02)
CH1 · Model Serving 들어가며 1 구성요소 2 생명주기 3 서빙이란 4 왜 공부하나 5 최적화 6 vLLM 7 On-Device 8 Single 9 Multi 10 Platform 11 정리 마치며 LLM 서빙 스터디 1주차 · CH1 학습자료 학습이 끝난 모델을진짜 서비스로 만드는 일. Introduction to Model Serving and Optimization — 모델이 무엇으로 이루어져 있는지부터, 그것을 API로 내보내고 빠르고 싸게 굴리는 네 가지 방법까지. 수학은 거의 나오지 않습니다. 나오는 것은 전부 접는 상자 안에 넣었고, 본문은 덧셈과 곱셈만으로 따라갈 수 있게 썼습니다. 이 자료가 지키는 것 ① 전문 용어는 영어 그..