01-개념
01. 개념 — “Just-in-Time”이라는 새로운 기본값
섹션 제목: “01. 개념 — “Just-in-Time”이라는 새로운 기본값”사전 적재가 아니라 즉시 검색
섹션 제목: “사전 적재가 아니라 즉시 검색”Anthropic 응용 AI 팀의 “Effective Context Engineering” 글은 “사전 적재 vs 즉시 검색”의 패러다임 차이를 또렷하게 정리한다.
“Rather than pre-loading all data, agents using ‘just in time’ approaches maintain lightweight identifiers and retrieve data dynamically via tools — mirroring human cognition and enabling progressive discovery.”
의역: “모든 데이터를 미리 적재하는 대신, ‘즉시 검색’ 방식의 에이전트는 가벼운 식별자만 유지하고 도구를 통해 동적으로 데이터를 가져온다 — 인간의 인지를 닮아 점진적 발견을 가능하게 한다.”
이게 RAG(Retrieval-Augmented Generation)의 본질이다. 단순히 “벡터 DB”가 아니라 “필요할 때 가져오는 습관”.
도구 수와 성능의 정량 관계
섹션 제목: “도구 수와 성능의 정량 관계”Drew Breunig가 정리한 충격적인 수치들.
- 30개 이상 도구가 붙으면 모델 성능이 떨어지기 시작.
- Llama 3.1 8B 변종은 19개 도구로는 성공하지만 46개에서는 실패 — 컨텍스트 공간은 충분한데도.
- 의미 기반(semantic) 도구 선택만으로 정확도 44% 향상.
컨텍스트 격리(Quarantine)와 멀티 에이전트
섹션 제목: “컨텍스트 격리(Quarantine)와 멀티 에이전트”Anthropic의 “How We Built Our Multi-Agent Research System”은 RAG의 멀티 에이전트 변종을 보여준다.
- 각 서브에이전트는 “its own context window” — “자기만의 컨텍스트 윈도우” 를 가진다.
- 부모는 결과만 받는다 — 정보 손실(“game of telephone”)을 막는다.
- 서브에이전트 출력을 파일 시스템에 저장 하는 게 권장. 모든 걸 부모로 전달하지 않는다.
성능: 단일 에이전트 대비 +90.2%.
분리 평가 — Hamel Husain
섹션 제목: “분리 평가 — Hamel Husain”Hamel Husain의 RAG 평가 가이드는 두 단계를 분리한다.
| 단계 | 도구 | 지표 |
|---|---|---|
| 검색(Retrieval) 평가 | 전통 IR 메트릭 | Recall@k, Precision@k, MRR |
| 생성(Generation) 평가 | 에러 분석 + LLM-as-judge | 휴먼 라벨 검증 |
“Debug retrieval first using IR metrics, then tackle generation quality using properly validated LLM judges.”
의역: “먼저 IR 메트릭으로 검색을 디버그하고, 그 다음 검증된 LLM 저지로 생성 품질을 잡아라.”