본문 바로가기
Y
S
영삼넷
youngsam.net
자체 개발
기술노트
뉴스
자료실
커뮤니티
소개
TECH NOTES
기술노트
현장에서 검증된 개발 지식을 기록합니다.
전체
AI
Frontend
Backend
Database
Infra
Etc
전체
1
건
최신순
조회순
추천순
#GPU 메모리 ✕
1
AI
16분 읽기
로컬 LLM 서빙 — Ollama·vLLM·llama.cpp 비교와 운영 기준
로컬 LLM 서빙 도구 Ollama·vLLM·llama.cpp를 처리량·연속 배칭·양자화·GPU 메모리 기준으로 비교한다. KV 캐시 계산법, OpenAI 호환 API 붙이는 법, 상황별로 언제 무엇을 써야 하는지까지 실무 관점에서 정리했다.
#로컬 LLM
#vLLM
#Ollama
2026.09.03