본문 바로가기
전체 77건
77
AI10분 읽기
코딩 에이전트 하네스 설계 — 같은 모델로 결과가 달라지는 이유
에이전트 성능은 모델만으로 결정되지 않는다. 도구 설계, 컨텍스트 구성, 검증 루프, 실패 복구 같은 하네스(harness) 요소가 결과를 좌우한다. 직접 만들 때의 설계 원칙과 흔한 실패를 정리한다.
#AI에이전트#하네스#도구설계
2026.09.16
76
AI8분 읽기
1.58비트 삼진 LLM — 극단 양자화가 실제로 이기는 지점과 지지 않는 지점
가중치를 -1, 0, +1 세 값으로 표현하는 삼진(ternary) 양자화의 원리와 현실을 정리한다. 메모리·연산 이득이 어디서 나오는지, 왜 사후 양자화로는 어려운지, 현재 어떤 조건에서 실용적인지 따져 본다.
#양자화#삼진#BitNet
2026.09.15
75
AI16분 읽기
파인튜닝 vs RAG vs 프롬프트 엔지니어링 — 언제 무엇을 선택하나
파인튜닝, RAG, 프롬프트 엔지니어링을 비용·데이터·최신성·정확도 네 축으로 비교한다. 어떤 상황에서 무엇을 골라야 하는지 의사결정 플로우와 셋을 섞는 하이브리드 전략, 그리고 내가 직접 데인 실제 실패 사례와 교훈까지 정리했다.
#파인튜닝#RAG#프롬프트 엔지니어링
2026.09.01
74
Mobile15분 읽기
온디바이스 AI — 폰에서 도는 소형 LLM의 실전화(지연·프라이버시·비용을 뒤집다)
4비트로 양자화된 소형 LLM이 스마트폰 NPU 위에서 실전화됐다. 왜 온디바이스인지, 양자화·증류·LoRA·런타임·하이브리드 라우팅까지 앱 개발자 관점에서 2026년 기준으로 정리한다.
#온디바이스AI#SLM#양자화
2026.08.29
73
AI18분 읽기
컨텍스트 엔지니어링 — 프롬프트 그다음, LLM의 컨텍스트 윈도우를 설계하는 법
프롬프트 한 줄 튜닝을 넘어, 컨텍스트 윈도우를 고정 예산으로 보고 설계하는 법을 정리한다. RAG 청킹 전략과 오버랩, 임베딩·리트리벌·재순위, 컨텍스트 압축과 요약, lost in the middle 문제, 도구·메모리 배치, 프롬프트 캐싱, 평가까지 실전 코드로 다룬다.
#Context Engineering#RAG#LLM
2026.08.26
72
AI21분 읽기
에이전트 메모리 완전 정복 — LLM 에이전트가 장기 기억을 갖는 법
컨텍스트 윈도우만으론 왜 부족한가. 단기·장기 기억, 메모리 4유형, 벡터·요약·지식그래프, 저장·회수·망각과 반영, MemGPT식 계층 메모리, 실무 함정까지 2026년 관점으로 정리한다.
#AI#에이전트#LLM
2026.08.26
71
AI7분 읽기
시맨틱 캐싱 — LLM 응답을 임베딩으로 재사용해 비용 줄이기
같은 뜻 다른 표현의 질문에 과거 답을 재사용하는 시맨틱 캐싱. 유사도 임계값 튜닝, 캐시하면 안 되는 질문, 프롬프트 캐싱과의 차이를 실전 로그 기반으로 정리.
#시맨틱 캐싱#semantic cache#LLM
2026.08.22
70
AI6분 읽기
LLM 샘플링 파라미터 — top-k, min-p, 반복 페널티까지
temperature와 top-p 너머의 샘플링 손잡이. top-k와 min-p로 꼬리를 자르고 frequency·presence 페널티로 반복을 다스리는, 작업별 실전 레시피를 정리했다.
#샘플링#temperature#top-p
2026.08.20
69
AI7분 읽기
컨텍스트 엔지니어링 — 프롬프트가 아니라 컨텍스트를 설계하는 법
프롬프트 문장이 아니라 컨텍스트 윈도우에 무엇을·얼마나·어떤 순서로 넣을지 설계하는 컨텍스트 엔지니어링. 토큰 예산 함수, 롤링 요약, 캐시 정렬까지 실전 정리.
#컨텍스트 엔지니어링#context engineering#LLM
2026.08.20
68
AI5분 읽기
지식 증류(Distillation) — 큰 모델의 지능을 작은 모델에 옮기기
큰 교사 모델의 확률 분포를 작은 학생이 따라 배우는 지식 증류. 부드러운 라벨이 왜 강한지, 온도의 역할과 데이터 증류의 라이선스 주의점까지 짚었다.
#지식증류#Distillation#교사학생
2026.08.19
67
AI5분 읽기
전문가 혼합(MoE) — 파라미터는 크게, 계산은 조금만
토큰마다 일부 전문가만 켜서 파라미터는 키우고 계산은 아끼는 MoE 구조. 라우팅과 로드 밸런싱, 그리고 메모리는 왜 못 아끼는지 그 대가까지 정리했다.
#MoE#전문가혼합#라우팅
2026.08.18
66
AI5분 읽기
토크나이저와 BPE — LLM이 글자가 아니라 토큰을 보는 이유
LLM이 글자 대신 토큰을 보는 이유와 BPE의 병합 원리. 한국어가 토큰을 더 먹는 까닭, 숫자 계산 실수, 프롬프트 공백까지 토큰화가 부르는 실전 함정을 짚었다.
#토크나이저#BPE#서브워드
2026.08.17