한줄평
“로컬 LLM 여러 개를 하나의 엔드포인트로 정리하려는 개발자에게 잘 맞습니다. GUI 가 없고 추론 백엔드를 따로 갖춰야 하므로 일반 사용자에게는 문턱이 있습니다.”
이런 분께 로컬 LLM 여러 개를 한 서버에서 갈아 쓰려는 개발자께
좋은 점
- 모델 전환을 요청 단위로 자동 처리
- 여러 추론 백엔드를 한 API 로 통합
아쉬운 점
- 명령줄·설정 파일 기반이라 초심자에게 어렵다
라마스왑 소개
llama.cpp·vLLM 처럼 OpenAI/Anthropic 호환 API 를 내는 로컬 추론 서버 앞에 두는 프록시입니다. 요청에 지정된 모델에 맞춰 백엔드 프로세스를 자동으로 띄우고 내려 GPU 메모리 한 몫으로 여러 모델을 돌려 씁니다. GUI 없이 설정 파일과 명령줄로 구동하는 서버형 도구라, 여러 모델을 한 서버에서 갈아 끼우며 쓰고 싶을 때 유용합니다.