TECH NOTES
기술노트
현장에서 검증된 개발 지식을 기록합니다.
54321
AI
HBM4와 AI 가속기 — 메모리 대역폭 전쟁의 다음 라운드, 병목의 진짜 위치
AI 추론의 진짜 병목은 연산이 아니라 메모리 대역폭이다. memory wall과 roofline, HBM의 적층 원리, HBM3E에서 HBM4로의 변화, 공급망 3사 구도, 그리고 양자화·KV캐시·배치라는 개발자 관점의 함의까지 2026년 시점에서 정리한다.
AI
플래시 어텐션(FlashAttention) — 어텐션을 메모리로 다시 설계하다
결과는 똑같이 내면서 GPU 메모리 왕복을 줄인 플래시 어텐션의 원리. 타일링과 online softmax로 n×n 행렬을 저장하지 않고 같은 값을 더 빠르게 얻는 법을 설명한다.
AI
Llama 5 405B Multimodal — 자체 호스팅 비용·성능 벤치마크
Llama 5 405B 멀티모달의 자체 호스팅 인프라 비용과 처리량 측정. 8×H200 대비 4×B200 비교, API 대비 손익분기점.
Infra
Kubernetes 1.33 GPU 스케줄링 실전 가이드 — AI 워크로드 비용 60% 절감
Kubernetes 1.33의 GPU 스케줄링 & DRA(Dynamic Resource Allocation) GA를 활용하여 AI 추론 서버를 효율적으로 운영하는 방법을 실습합니다.
Frontend
WebGPU — 브라우저에서 GPU 연산 활용하기
WebGPU API로 브라우저에서 고성능 그래픽과 범용 GPU 연산을 수행하는 방법.