vLLM이란?LLM 서빙의 처리량·지연을 극적으로 개선한 오픈소스 추론 서버다.핵심 기술PagedAttention — KV cache를 페이지 단위 관리Continuous batching — 요청 단위 동적 묶음OpenAI 호환 APIHugging Face TGI, SGLang과 경쟁.