TECH NOTES
기술노트
현장에서 검증된 개발 지식을 기록합니다.
321
Mobile
온디바이스 AI — 폰에서 도는 소형 LLM의 실전화(지연·프라이버시·비용을 뒤집다)
4비트로 양자화된 소형 LLM이 스마트폰 NPU 위에서 실전화됐다. 왜 온디바이스인지, 양자화·증류·LoRA·런타임·하이브리드 라우팅까지 앱 개발자 관점에서 2026년 기준으로 정리한다.
AI
LLM 양자화 — GPTQ·AWQ·GGUF, INT4가 뭘 버리고 뭘 지키나
가중치를 4비트로 줄여도 왜 멀쩡한지, GPTQ·AWQ·GGUF의 차이와 Q4_K_M 같은 이름 읽는 법, 품질과 크기의 스위트스폿까지 정리한 로컬 LLM 양자화 가이드.
AI
Llama.cpp 로컬 LLM 최적화 — 양자화와 GGUF 포맷
llama.cpp를 활용한 로컬 LLM 실행 시 양자화 수준별 성능 차이와 GGUF 포맷의 구조를 분석하고 최적 설정을 찾는 방법입니다.