콘텐츠로 이동

checklist

  • 입력 30개 이상, 운영 로그 비중 ≥ 50%
  • 사람이 검증한 라벨
  • 슬라이스 태그(카테고리/길이/언어/난이도)
  • 적대적 케이스(인젝션/스팸) 포함
  • 시간 분할 — 평가 세트가 학습·튜닝 데이터와 분리
  • 정확도 / F1
  • 형식 적합률(parse rate)
  • 비용(평균 토큰)
  • 지연(p50, p95)
  • 슬라이스별 분리 보고
  • 임계값을 파일(metrics.yml)에 명시
  • 슬라이스별 임계값 별도
  • CI가 임계값 위반 시 자동 차단
  • LLM-as-judge 사용 시 사람 라벨과의 agreement 측정
  • judge 프롬프트도 별도 버전 관리
  • 평가 대상과 다른 모델/다른 sub-agent로 채점
  • 운영 로그에서 주기적으로 새 케이스 추가
  • 변경마다 reports/ 파일 커밋
  • 자기 검증 금지(CLAUDE.md §10)