본문 바로가기
전체 5
5
AI15분 읽기
HBM4와 AI 가속기 — 메모리 대역폭 전쟁의 다음 라운드, 병목의 진짜 위치
AI 추론의 진짜 병목은 연산이 아니라 메모리 대역폭이다. memory wall과 roofline, HBM의 적층 원리, HBM3E에서 HBM4로의 변화, 공급망 3사 구도, 그리고 양자화·KV캐시·배치라는 개발자 관점의 함의까지 2026년 시점에서 정리한다.
#HBM#HBM4#AI가속기
2026.08.27
4
AI6분 읽기
플래시 어텐션(FlashAttention) — 어텐션을 메모리로 다시 설계하다
결과는 똑같이 내면서 GPU 메모리 왕복을 줄인 플래시 어텐션의 원리. 타일링과 online softmax로 n×n 행렬을 저장하지 않고 같은 값을 더 빠르게 얻는 법을 설명한다.
#FlashAttention#어텐션#트랜스포머
2026.08.14
3
AI3분 읽기
Llama 5 405B Multimodal — 자체 호스팅 비용·성능 벤치마크
Llama 5 405B 멀티모달의 자체 호스팅 인프라 비용과 처리량 측정. 8×H200 대비 4×B200 비교, API 대비 손익분기점.
#Llama#SelfHosting#Inference
2026.05.19
2
Infra6분 읽기
Kubernetes 1.33 GPU 스케줄링 실전 가이드 — AI 워크로드 비용 60% 절감
Kubernetes 1.33의 GPU 스케줄링 & DRA(Dynamic Resource Allocation) GA를 활용하여 AI 추론 서버를 효율적으로 운영하는 방법을 실습합니다.
#Kubernetes#GPU#AI
2026.03.30
1
Frontend1분 읽기
WebGPU — 브라우저에서 GPU 연산 활용하기
WebGPU API로 브라우저에서 고성능 그래픽과 범용 GPU 연산을 수행하는 방법.
#WebGPU#GPU#Performance
2025.11.13