본문 바로가기
Q&A2026년 8월 11일1분 읽기

ollama로 로컬 LLM 돌리는데 GPU 메모리 부족(OOM)으로 자꾸 죽습니다. 양자화하면 되나요

o
ollama_seunghyun
조회 400댓글 1

로컬에서 LLM을 돌려보려고 ollama를 쓰고 있는데 GPU 메모리가 부족하다면서 자꾸 죽습니다. 그래픽카드는 RTX 4070 12GB고요, 13B급 모델을 올려보려고 했어요.

모델 로드하고 조금 긴 프롬프트를 넣으면 CUDA out of memory 가 나거나, 아니면 죽진 않는데 갑자기 응답이 엄청 느려집니다. nvidia-smi 보면 로드는 됐는데 추론할 때 뭔가 이상하고요.

양자화라는 걸 하면 메모리를 줄일 수 있다고 들었는데, 그냥 하면 되는 건지 품질이 많이 깎이는 건지 감이 안 옵니다. 12GB에서 13B는 무리인 걸까요? 어떻게 접근해야 할지 조언 부탁드려요.

댓글 0

아직 댓글이 없습니다.
Ctrl+Enter로 등록