TECH NOTES
기술노트
현장에서 검증된 개발 지식을 기록합니다.
54321
AI
와트당 지능 — 로컬 AI 추론 효율을 측정하는 법
토큰/초만으로는 로컬 추론 성능을 설명할 수 없다. 메모리 대역폭 한계, 프리필과 디코드의 차이, 전력당 처리량, 배치 효과까지 실제로 측정하고 비교하는 기준을 정리한다.
AI
LLM 양자화 — GPTQ·AWQ·GGUF, INT4가 뭘 버리고 뭘 지키나
가중치를 4비트로 줄여도 왜 멀쩡한지, GPTQ·AWQ·GGUF의 차이와 Q4_K_M 같은 이름 읽는 법, 품질과 크기의 스위트스폿까지 정리한 로컬 LLM 양자화 가이드.
AI
Gemma 4 완벽 가이드 — Ollama로 설치부터 실전 활용까지
Google Gemma 4를 Ollama로 설치하고 실전에서 활용하는 완벽 가이드. 속도, 안정성, 한국어 성능 테스트와 API 연동까지.
AI
Llama.cpp 로컬 LLM 최적화 — 양자화와 GGUF 포맷
llama.cpp를 활용한 로컬 LLM 실행 시 양자화 수준별 성능 차이와 GGUF 포맷의 구조를 분석하고 최적 설정을 찾는 방법입니다.
AI
Ollama 로컬 LLM 실행 — Llama 2·Mistral·Phi
Ollama 로컬 LLM 실행 — Llama 2·Mistral·Phi — 실무에서 바로 적용할 수 있는 가이드입니다.