TECH NOTES
기술노트
현장에서 검증된 개발 지식을 기록합니다.
321
AI
GQA·MQA — KV 캐시를 줄이는 어텐션 헤드 공유
여러 어텐션 헤드가 키·값을 공유해 KV 캐시를 몇 배 줄이는 GQA와 MQA. 품질 손실은 왜 작은지, 긴 컨텍스트·동시 요청에서 왜 이득이 큰지 정리했다.
AI
플래시 어텐션(FlashAttention) — 어텐션을 메모리로 다시 설계하다
결과는 똑같이 내면서 GPU 메모리 왕복을 줄인 플래시 어텐션의 원리. 타일링과 online softmax로 n×n 행렬을 저장하지 않고 같은 값을 더 빠르게 얻는 법을 설명한다.
AI
KV 캐시 — LLM이 토큰을 하나씩 뱉어도 빠른 이유
LLM이 긴 답변을 빠르게 만드는 비결인 KV 캐시의 원리와, 시퀀스·배치에 비례해 불어나는 메모리 부담, PagedAttention으로 낭비를 줄이는 법까지 정리했다.