콘텐츠로 이동

checklist

  • 첫 접근이 Grep → 부분 Read인가?
  • 작업별 도구 세트가 12개 이하인가?
  • 키워드 + 의미 검색 하이브리드를 검토했는가?
  • 검색 결과를 인라인하기 전에 요약/가지치기했는가?
  • 폭(breadth-first) 작업은 서브에이전트로 격리했는가?
  • 평가 데이터셋(쿼리 30~50개)을 가지고 있는가?
  • Recall@k / Precision@k 베이스라인이 있는가?
  • 실패 시 “검색 → 생성” 순으로 디버그하는가?
  • 서브에이전트 결과를 파일에 떨어뜨려 부모 토큰을 아끼는가?