Hands-On LLM Serving and Optimization 책 스터디 2주차
·
ETC
Chapter 3. Model Serving System Design: A Deep Dive1장(서빙 패러다임), 2장(LLM 추론 원리)의 기초를 실제 운영 환경에 적용하는 방법을 다루는 장특정 프레임워크 사용법이 아니라 기본 원리에서 직관을 키우는 것이 목적서빙 시스템의 구조를 근본적으로 이해하면 어떤 프레임워크·관리형 서비스도 평가/적용/확장할 수 있음단순화된 대표 시스템 2개를 직접 구현하며 학습단일 모델 LLM 서빙 (배치 + 스트리밍 지원)멀티 모델 서빙 (라우팅, 격리, 리소스 관리)마지막에 멀티 모델 서빙의 두 가지 설계 변형(비용 최적화 vs 지연시간 최적화)을 비교1. Build an Online LLM Serving Service from Scratch 1.1 설계 목표시작 시 단일 ..