TECH NOTES
기술노트
현장에서 검증된 개발 지식을 기록합니다.
4321
AI
와트당 지능 — 로컬 AI 추론 효율을 측정하는 법
토큰/초만으로는 로컬 추론 성능을 설명할 수 없다. 메모리 대역폭 한계, 프리필과 디코드의 차이, 전력당 처리량, 배치 효과까지 실제로 측정하고 비교하는 기준을 정리한다.
AI
1.58비트 삼진 LLM — 극단 양자화가 실제로 이기는 지점과 지지 않는 지점
가중치를 -1, 0, +1 세 값으로 표현하는 삼진(ternary) 양자화의 원리와 현실을 정리한다. 메모리·연산 이득이 어디서 나오는지, 왜 사후 양자화로는 어려운지, 현재 어떤 조건에서 실용적인지 따져 본다.
AI
HBM4와 AI 가속기 — 메모리 대역폭 전쟁의 다음 라운드, 병목의 진짜 위치
AI 추론의 진짜 병목은 연산이 아니라 메모리 대역폭이다. memory wall과 roofline, HBM의 적층 원리, HBM3E에서 HBM4로의 변화, 공급망 3사 구도, 그리고 양자화·KV캐시·배치라는 개발자 관점의 함의까지 2026년 시점에서 정리한다.
AI
플래시 어텐션(FlashAttention) — 어텐션을 메모리로 다시 설계하다
결과는 똑같이 내면서 GPU 메모리 왕복을 줄인 플래시 어텐션의 원리. 타일링과 online softmax로 n×n 행렬을 저장하지 않고 같은 값을 더 빠르게 얻는 법을 설명한다.