02-구조
02. 구조 — 예산을 다루는 4가지 도구
섹션 제목: “02. 구조 — 예산을 다루는 4가지 도구”1. Server-side Compaction (자동)
섹션 제목: “1. Server-side Compaction (자동)”긴 대화에서 Claude는 서버 측에서 이전 부분을 자동으로 압축한다. “the primary strategy for context management” — “컨텍스트 관리의 1차 전략” 이라고 docs가 명시한다. 통합 작업이 거의 없다.
주의: Sonnet 3.7+ 이후 모델은 프롬프트와 출력의 합이 윈도우를 초과하면 유효성 검사 오류 를 반환한다 — 예전처럼 조용히 잘리지 않는다.
2. Context Editing
섹션 제목: “2. Context Editing”자동으로 “clears stale tool calls and results from within the context window when approaching token limits” — “한도에 가까워지면 컨텍스트 안의 오래된 도구 호출과 결과를 정리” 한다. Anthropic 자체 측정으로 100턴 웹 검색 테스트에서 토큰 사용량을 84% 감소, 그 단독으로 29% 성능 향상 을 냈다.
3. Memory Tool
섹션 제목: “3. Memory Tool”파일 시스템 기반 외부 저장소. Claude가 전용 디렉터리에 파일을 만들고 읽고 갱신·삭제할 수 있다. 세션을 넘는다. Context Editing과 결합 시 39% 성능 향상.
(Part 3/06에서 OMC notepad.md/project-memory.json과 함께 다룬다.)
4. Prompt Caching
섹션 제목: “4. Prompt Caching”자주 쓰는 컨텍스트 블록을 캐시한다. 비용·지연이 동시에 줄어든다.
| 항목 | 효과 |
|---|---|
| 비용 | 최대 90% 감소 |
| 지연 | 긴 프롬프트에서 최대 85% 감소 |
| 캐시 쓰기 비용 | 표준 입력의 125% |
| 캐시 읽기 비용 | 표준 입력의 10% |
대표 적용처: 대화형 에이전트, 코딩 어시스턴트, 대형 문서 처리, 상세 지시문 셋, 에이전트 검색, 지식 베이스. Notion AI는 초기 도입자 중 하나다.
토큰 예산을 어디에 쓰는가
섹션 제목: “토큰 예산을 어디에 쓰는가”| 슬롯 | 일반적 비중 | 줄이는 법 |
|---|---|---|
시스템 프롬프트 / CLAUDE.md | 1~3K | ≤300줄 원칙 |
| 도구 정의 | 5~30K | 작업별 도구 슬림화 (Part 3/04) |
| 메시지 이력 | 가변 (가장 빠르게 큼) | /compact, Context Editing |
| 도구 결과 | 가변 (큰 파일 읽기) | Reference vs Inline (요약/링크) |
| RAG 페치 | 가변 | Just-in-Time 검색 |
측정의 출발점
섹션 제목: “측정의 출발점”nilenso의 context-viewer 같은 옵저버빌리티 도구는 대화 JSON을 파싱해 토큰을 세고, 큰 메시지를 분절하며, 컴포넌트별로 분류한다. StoryMachine 사례에서 중복 명세가 컨텍스트의 약 13%, 재생성으로 인한 중복이 41% 까지 차지함을 발견했다. 보지 못하면 못 줄인다.