콘텐츠로 이동

01-개념

01. 개념 — “Just-in-Time”이라는 새로운 기본값

섹션 제목: “01. 개념 — “Just-in-Time”이라는 새로운 기본값”

Anthropic 응용 AI 팀의 “Effective Context Engineering” 글은 “사전 적재 vs 즉시 검색”의 패러다임 차이를 또렷하게 정리한다.

“Rather than pre-loading all data, agents using ‘just in time’ approaches maintain lightweight identifiers and retrieve data dynamically via tools — mirroring human cognition and enabling progressive discovery.”

의역: “모든 데이터를 미리 적재하는 대신, ‘즉시 검색’ 방식의 에이전트는 가벼운 식별자만 유지하고 도구를 통해 동적으로 데이터를 가져온다 — 인간의 인지를 닮아 점진적 발견을 가능하게 한다.”

이게 RAG(Retrieval-Augmented Generation)의 본질이다. 단순히 “벡터 DB”가 아니라 “필요할 때 가져오는 습관”.

Drew Breunig가 정리한 충격적인 수치들.

  • 30개 이상 도구가 붙으면 모델 성능이 떨어지기 시작.
  • Llama 3.1 8B 변종은 19개 도구로는 성공하지만 46개에서는 실패 — 컨텍스트 공간은 충분한데도.
  • 의미 기반(semantic) 도구 선택만으로 정확도 44% 향상.

컨텍스트 격리(Quarantine)와 멀티 에이전트

섹션 제목: “컨텍스트 격리(Quarantine)와 멀티 에이전트”

Anthropic의 “How We Built Our Multi-Agent Research System”은 RAG의 멀티 에이전트 변종을 보여준다.

  • 각 서브에이전트는 “its own context window”“자기만의 컨텍스트 윈도우” 를 가진다.
  • 부모는 결과만 받는다 — 정보 손실(“game of telephone”)을 막는다.
  • 서브에이전트 출력을 파일 시스템에 저장 하는 게 권장. 모든 걸 부모로 전달하지 않는다.

성능: 단일 에이전트 대비 +90.2%.

Hamel Husain의 RAG 평가 가이드는 두 단계를 분리한다.

단계도구지표
검색(Retrieval) 평가전통 IR 메트릭Recall@k, Precision@k, MRR
생성(Generation) 평가에러 분석 + LLM-as-judge휴먼 라벨 검증

“Debug retrieval first using IR metrics, then tackle generation quality using properly validated LLM judges.”

의역: “먼저 IR 메트릭으로 검색을 디버그하고, 그 다음 검증된 LLM 저지로 생성 품질을 잡아라.”