Hands-On LLM Serving and Optimization 책 스터디 2주차
·
ETC
Chapter 3. Model Serving System Design: A Deep Dive1장(서빙 패러다임), 2장(LLM 추론 원리)의 기초를 실제 운영 환경에 적용하는 방법을 다루는 장특정 프레임워크 사용법이 아니라 기본 원리에서 직관을 키우는 것이 목적서빙 시스템의 구조를 근본적으로 이해하면 어떤 프레임워크·관리형 서비스도 평가/적용/확장할 수 있음단순화된 대표 시스템 2개를 직접 구현하며 학습단일 모델 LLM 서빙 (배치 + 스트리밍 지원)멀티 모델 서빙 (라우팅, 격리, 리소스 관리)마지막에 멀티 모델 서빙의 두 가지 설계 변형(비용 최적화 vs 지연시간 최적화)을 비교1. Build an Online LLM Serving Service from Scratch 1.1 설계 목표시작 시 단일 ..
Hands-On LLM Serving and Optimization 책 스터디 1주차
·
ETC
1. Introduction to Model Serving and OptimizationAnatomy of a Model엔지니어링 관점에서 모델은 정적 데이터 파일이 아니라 실행 가능한 프로그램이며, 아래와 같은 세 가지 구성 요소로 나뉜다.모델 데이터: 가중치 & 편향, 그리고 임베딩 & 레이블 클래스 & max_batch_size & 입출력 텐서 같은 구성(메타데이터)모델 아키텍처: 레이어의 종류와 개수, 레이어 간 연결, 수행 연산 등 모델의 구조와 설계모델 실행 코드: 아키텍처를 초기화하고 가중치를 로드해 예측을 실행하는 과정아키텍처와 가중치를 별도 파일로 분리해 저장하면 유연성이 높아진다. 버전 간 구조가 바뀌어 '일치하지 않는 키'가 생겨도 부분 로딩이 가능해, 미세 조정이나 점진적 아키텍처 ..
[AI 시대에 개발자가 알아야 할 인프라 구성 배포 with 클로드코드]스터디 4주차
·
ETC
스터디 3주차 까지는 캐시 서버 & 시크릿 & 카나리 배포 전략을 테스트했었는데 7장부터는 SMB에서 엔터프라이즈 급으로 규모가 확장되었을 때 어떤 것들을 고려해야하는지, 고도화를 위해서는 어떤 서비스를 추가해서 어떻게 운영해야하는지 실습해보도록 한다.1주차: https://canaryrelease.tistory.com/122 2주차: https://canaryrelease.tistory.com/123 3주차: https://canaryrelease.tistory.com/1247장. 규모 확장7.1 성장통: SMB 구조의 한계지금까지 Notiflex는 단일 노드풀(default-pool)에 모든 워크로드가 섞여 있고, 테넌트는 smb 하나뿐이다. 관측 스택, ArgoCD, Valkey, 앱이..
[AI 시대에 개발자가 알아야 할 인프라 구성 배포 with 클로드코드]스터디 3주차
·
ETC
스터디 2주차에는 지난번에 이어서 GKE 클러스터 위에서 클로드 코드를 활용해서 배포 파이프라인과 모니터링 스택을 구축한다.1주차: https://canaryrelease.tistory.com/122 2주차: https://canaryrelease.tistory.com/123 5장. 무중단 배포5.1 Rolling Update는 왜 서비스가 끊기는가Rolling Update는 파드를 하나씩 갈아끼우니 언뜻 무중단처럼 보인다. 문제는 세 가지다. Ready와 "진짜 준비됨"의 간극. readinessProbe가 통과했다고 앱이 트래픽을 완벽히 처리할 수 있는 건 아니다. 커넥션 풀 워밍업, 캐시 로딩 같은 것들이 끝나기 전에 트래픽이 꽂히면 그 요청들은 느리거나 실패한다.검증 창구가 없다. 새 버전..