TECH NOTES
기술노트
현장에서 검증된 개발 지식을 기록합니다.
7654321
AI
토크나이저와 BPE — LLM이 글자가 아니라 토큰을 보는 이유
LLM이 글자 대신 토큰을 보는 이유와 BPE의 병합 원리. 한국어가 토큰을 더 먹는 까닭, 숫자 계산 실수, 프롬프트 공백까지 토큰화가 부르는 실전 함정을 짚었다.
Infra
테일 샘플링 — 에러 트레이스는 남기고 트레이스 저장 비용은 줄이는 법
head 샘플링은 에러 트레이스를 확률에 맡긴다. OTel Collector의 tail_sampling으로 트레이스 내용을 보고 저장을 결정해, 에러는 보존하고 저장 비용은 줄이는 법.
AI
추론 모델은 언제 쓰나 — effort와 비용의 균형
추론 모델을 언제 켜고 끄나. effort와 적응형 사고로 생각의 깊이를 조절하는 법, 작업 유형별 라우팅, 출력 토큰이 잘리는 max_tokens 함정까지 지능과 지연과 비용의 삼각형을 저울질하는 실전 감각을 정리했다.
AI
Claude API 프롬프트 캐싱 완벽 활용 — 비용 90% 절감 실전 패턴 6가지
Claude API의 프롬프트 캐싱은 시스템 프롬프트·도구 정의·긴 문서 재사용 시 비용을 최대 90% 절감한다. cache_control 사용법과 실전 6가지 패턴을 정리한다.
Infra
Kubernetes 1.33 GPU 스케줄링 실전 가이드 — AI 워크로드 비용 60% 절감
Kubernetes 1.33의 GPU 스케줄링 & DRA(Dynamic Resource Allocation) GA를 활용하여 AI 추론 서버를 효율적으로 운영하는 방법을 실습합니다.
Infra
AWS S3 비용 최적화 — 스토리지 클래스와 라이프사이클
AWS S3의 스토리지 클래스별 특성을 비교하고, 라이프사이클 정책과 Intelligent-Tiering으로 스토리지 비용을 최대 90%까지 절감하는 전략을 소개합니다.
AI
LLM 토큰 최적화 — 비용 50% 절감하는 프롬프트 기법
LLM API 비용의 핵심인 토큰 사용량을 효과적으로 줄이는 프롬프트 설계 기법과 시스템 수준 최적화 전략을 다룹니다.