TECH NOTES
기술노트
현장에서 검증된 개발 지식을 기록합니다.
321
AI
KV 캐시 — LLM이 토큰을 하나씩 뱉어도 빠른 이유
LLM이 긴 답변을 빠르게 만드는 비결인 KV 캐시의 원리와, 시퀀스·배치에 비례해 불어나는 메모리 부담, PagedAttention으로 낭비를 줄이는 법까지 정리했다.
AI
vLLM 1.1 LoRA 핫스왑 — 멀티 테넌트 LLM 서빙, 비용 50%↓
vLLM 1.1의 LoRA 핫스왑 기능으로 테넌트별 미세조정 모델을 한 GPU에 동거시켜 인프라 비용을 절반으로 줄인 운영기.
AI
vLLM 1.0 vs SGLang vs TGI — LLM 추론 서버 실측 비교
vLLM 1.0·SGLang·TGI 3대 LLM 추론 서버 실측. Llama 70B 처리량·레이턴시·메모리, 양자화 지원과 운영 부담을 워크로드별로 비교.