본문 바로가기
전체 77건
65
AI6분 읽기
RoPE(회전 위치 임베딩) — 컨텍스트 길이를 늘리는 위치 인코딩
위치를 벡터에 더하지 않고 회전으로 심는 RoPE의 원리와, base 조정·보간으로 학습보다 긴 컨텍스트로 확장하는 트릭까지. 상대 거리가 자연히 드러나는 이유를 설명한다.
#RoPE#위치임베딩#트랜스포머
2026.08.16
64
AI5분 읽기
GQA·MQA — KV 캐시를 줄이는 어텐션 헤드 공유
여러 어텐션 헤드가 키·값을 공유해 KV 캐시를 몇 배 줄이는 GQA와 MQA. 품질 손실은 왜 작은지, 긴 컨텍스트·동시 요청에서 왜 이득이 큰지 정리했다.
#GQA#MQA#어텐션
2026.08.15
63
AI6분 읽기
에이전트 툴 호출 — 병렬 호출·에러 복구·툴 남용 방지
에이전트 툴 호출 실전 — 병렬 호출 결과를 한 메시지로 묶어야 하는 이유, is_error로 실패를 되돌려 복구하기, tool_choice와 도구 설명으로 남용·과소 사용을 제어하는 법, 루프 종료까지 도구 연동의 함정을 정리했다.
#에이전트#tool calling#병렬호출
2026.08.13
62
AI5분 읽기
긴 컨텍스트 관리 — lost in the middle과 압축 전략
긴 컨텍스트 관리 — lost in the middle 현상, 가지치기·요약 압축·외부 메모리, 중요한 문서의 배치 전략, 현재 시각 하나로 무너지는 프롬프트 캐시 함정까지. 창이 크다고 다 넣으면 왜 안 되는지 실전으로 정리했다.
#컨텍스트#long context#lost in the middle
2026.08.10
61
AI6분 읽기
LLM 스트리밍 UX — 토큰이 흐를 때의 경험 설계
LLM 스트리밍 UX 설계를 다룬다. TTFT와 체감 지연, 멈춤 버튼과 렌더 버퍼링, 추론·도구 호출 중 생기는 침묵을 메우는 법, 스트림 끊김과 최종본 확인까지 토큰이 흐를 때 사용자 경험을 좌우하는 결정들을 정리했다.
#스트리밍#streaming#LLM
2026.08.04
60
AI6분 읽기
구조화 출력 신뢰성 — 스키마 강제·검증·재시도
LLM 구조화 출력을 100% 믿을 수 없을 때의 방어법. 스키마 강제·검증·재시도 3단 구조, 토큰 잘림과 안전 거부처럼 강제로 못 막는 실패의 처리, enum과 additionalProperties 활용까지 JSON 출력을 튼튼하게 만드는 실전이다.
#구조화출력#structured output#JSON
2026.07.31
59
AI6분 읽기
추론 모델은 언제 쓰나 — effort와 비용의 균형
추론 모델을 언제 켜고 끄나. effort와 적응형 사고로 생각의 깊이를 조절하는 법, 작업 유형별 라우팅, 출력 토큰이 잘리는 max_tokens 함정까지 지능과 지연과 비용의 삼각형을 저울질하는 실전 감각을 정리했다.
#추론모델#reasoning#effort
2026.07.29
58
AI3분 읽기
AI 코딩 도구 잘 쓰는 법 — 프롬프트보다 컨텍스트 관리
Copilot·Cursor·Claude Code가 엉뚱한 코드를 낸다면 프롬프트가 아니라 컨텍스트 문제일 때가 많다. 좋은 결과를 얻는 실전 습관을 정리한다.
#AI#Coding#Productivity
2026.07.10
57
AI3분 읽기
LLM temperature와 top_p — 출력이 매번 다를 때 조절법
같은 질문에 답이 들쭉날쭉하거나 너무 뻔하다면 샘플링 파라미터를 만질 때다. temperature와 top_p가 무엇을 조절하는지, 용도별 권장값까지.
#LLM#Temperature#Sampling
2026.07.10
56
AI3분 읽기
LLM 컨텍스트 윈도우 — 길다고 다 좋은 게 아니다
컨텍스트 윈도우가 크면 다 넣으면 될까? "중간을 잊는" 현상과 비용·지연 때문에 무작정 채우면 오히려 답이 나빠진다. 제대로 쓰는 법.
#LLM#Context#Prompt
2026.07.09
55
AI2분 읽기
LLM 함수 호출(tool calling) 설계 — 안정적으로 도구 쓰기
모델이 외부 도구를 부르게 하는 tool calling. 스키마 설계·검증·에러 복구·무한 루프 방지로 신뢰성을 확보한다.
#LLM#ToolCalling#Agent
2026.06.25
54
AI2분 읽기
LLM 환각(hallucination) 줄이는 실전 방법
모델은 모르는 것도 자신 있게 지어낸다. 근거 제공(RAG)·"모르면 모른다"·출력 구조화·검증으로 환각을 억제한다.
#LLM#Hallucination#RAG
2026.06.22