TECH NOTES
기술노트
현장에서 검증된 개발 지식을 기록합니다.
4321
AI
와트당 지능 — 로컬 AI 추론 효율을 측정하는 법
토큰/초만으로는 로컬 추론 성능을 설명할 수 없다. 메모리 대역폭 한계, 프리필과 디코드의 차이, 전력당 처리량, 배치 효과까지 실제로 측정하고 비교하는 기준을 정리한다.
AI
1.58비트 삼진 LLM — 극단 양자화가 실제로 이기는 지점과 지지 않는 지점
가중치를 -1, 0, +1 세 값으로 표현하는 삼진(ternary) 양자화의 원리와 현실을 정리한다. 메모리·연산 이득이 어디서 나오는지, 왜 사후 양자화로는 어려운지, 현재 어떤 조건에서 실용적인지 따져 본다.
AI
스페큘러티브 디코딩 — 드래프트 모델과 수용률의 경제학
작은 드래프트 모델이 미리 짓고 큰 모델이 검증하는 스페큘러티브 디코딩. 품질은 왜 안 깎이는지, 이득을 좌우하는 수용률과 제안 길이 k의 저울질을 설명한다.
AI
GQA·MQA — KV 캐시를 줄이는 어텐션 헤드 공유
여러 어텐션 헤드가 키·값을 공유해 KV 캐시를 몇 배 줄이는 GQA와 MQA. 품질 손실은 왜 작은지, 긴 컨텍스트·동시 요청에서 왜 이득이 큰지 정리했다.