본문 바로가기
전체 71
71
AI7분 읽기
시맨틱 캐싱 — LLM 응답을 임베딩으로 재사용해 비용 줄이기
같은 뜻 다른 표현의 질문에 과거 답을 재사용하는 시맨틱 캐싱. 유사도 임계값 튜닝, 캐시하면 안 되는 질문, 프롬프트 캐싱과의 차이를 실전 로그 기반으로 정리.
#시맨틱 캐싱#semantic cache#LLM
2026.08.22
70
AI6분 읽기
LLM 샘플링 파라미터 — top-k, min-p, 반복 페널티까지
temperature와 top-p 너머의 샘플링 손잡이. top-k와 min-p로 꼬리를 자르고 frequency·presence 페널티로 반복을 다스리는, 작업별 실전 레시피를 정리했다.
#샘플링#temperature#top-p
2026.08.20
69
AI7분 읽기
컨텍스트 엔지니어링 — 프롬프트가 아니라 컨텍스트를 설계하는 법
프롬프트 문장이 아니라 컨텍스트 윈도우에 무엇을·얼마나·어떤 순서로 넣을지 설계하는 컨텍스트 엔지니어링. 토큰 예산 함수, 롤링 요약, 캐시 정렬까지 실전 정리.
#컨텍스트 엔지니어링#context engineering#LLM
2026.08.20
68
AI5분 읽기
지식 증류(Distillation) — 큰 모델의 지능을 작은 모델에 옮기기
큰 교사 모델의 확률 분포를 작은 학생이 따라 배우는 지식 증류. 부드러운 라벨이 왜 강한지, 온도의 역할과 데이터 증류의 라이선스 주의점까지 짚었다.
#지식증류#Distillation#교사학생
2026.08.19
67
AI5분 읽기
전문가 혼합(MoE) — 파라미터는 크게, 계산은 조금만
토큰마다 일부 전문가만 켜서 파라미터는 키우고 계산은 아끼는 MoE 구조. 라우팅과 로드 밸런싱, 그리고 메모리는 왜 못 아끼는지 그 대가까지 정리했다.
#MoE#전문가혼합#라우팅
2026.08.18
66
AI5분 읽기
토크나이저와 BPE — LLM이 글자가 아니라 토큰을 보는 이유
LLM이 글자 대신 토큰을 보는 이유와 BPE의 병합 원리. 한국어가 토큰을 더 먹는 까닭, 숫자 계산 실수, 프롬프트 공백까지 토큰화가 부르는 실전 함정을 짚었다.
#토크나이저#BPE#서브워드
2026.08.17
65
AI6분 읽기
RoPE(회전 위치 임베딩) — 컨텍스트 길이를 늘리는 위치 인코딩
위치를 벡터에 더하지 않고 회전으로 심는 RoPE의 원리와, base 조정·보간으로 학습보다 긴 컨텍스트로 확장하는 트릭까지. 상대 거리가 자연히 드러나는 이유를 설명한다.
#RoPE#위치임베딩#트랜스포머
2026.08.16
64
AI5분 읽기
GQA·MQA — KV 캐시를 줄이는 어텐션 헤드 공유
여러 어텐션 헤드가 키·값을 공유해 KV 캐시를 몇 배 줄이는 GQA와 MQA. 품질 손실은 왜 작은지, 긴 컨텍스트·동시 요청에서 왜 이득이 큰지 정리했다.
#GQA#MQA#어텐션
2026.08.15
63
AI6분 읽기
에이전트 툴 호출 — 병렬 호출·에러 복구·툴 남용 방지
에이전트 툴 호출 실전 — 병렬 호출 결과를 한 메시지로 묶어야 하는 이유, is_error로 실패를 되돌려 복구하기, tool_choice와 도구 설명으로 남용·과소 사용을 제어하는 법, 루프 종료까지 도구 연동의 함정을 정리했다.
#에이전트#tool calling#병렬호출
2026.08.13
62
AI5분 읽기
긴 컨텍스트 관리 — lost in the middle과 압축 전략
긴 컨텍스트 관리 — lost in the middle 현상, 가지치기·요약 압축·외부 메모리, 중요한 문서의 배치 전략, 현재 시각 하나로 무너지는 프롬프트 캐시 함정까지. 창이 크다고 다 넣으면 왜 안 되는지 실전으로 정리했다.
#컨텍스트#long context#lost in the middle
2026.08.10
61
AI6분 읽기
LLM 스트리밍 UX — 토큰이 흐를 때의 경험 설계
LLM 스트리밍 UX 설계를 다룬다. TTFT와 체감 지연, 멈춤 버튼과 렌더 버퍼링, 추론·도구 호출 중 생기는 침묵을 메우는 법, 스트림 끊김과 최종본 확인까지 토큰이 흐를 때 사용자 경험을 좌우하는 결정들을 정리했다.
#스트리밍#streaming#LLM
2026.08.04
60
AI6분 읽기
구조화 출력 신뢰성 — 스키마 강제·검증·재시도
LLM 구조화 출력을 100% 믿을 수 없을 때의 방어법. 스키마 강제·검증·재시도 3단 구조, 토큰 잘림과 안전 거부처럼 강제로 못 막는 실패의 처리, enum과 additionalProperties 활용까지 JSON 출력을 튼튼하게 만드는 실전이다.
#구조화출력#structured output#JSON
2026.07.31