checklist
체크리스트 — 평가 & 회귀
섹션 제목: “체크리스트 — 평가 & 회귀”평가 세트
섹션 제목: “평가 세트”- 입력 30개 이상, 운영 로그 비중 ≥ 50%
- 사람이 검증한 라벨
- 슬라이스 태그(카테고리/길이/언어/난이도)
- 적대적 케이스(인젝션/스팸) 포함
- 시간 분할 — 평가 세트가 학습·튜닝 데이터와 분리
메트릭
섹션 제목: “메트릭”- 정확도 / F1
- 형식 적합률(parse rate)
- 비용(평균 토큰)
- 지연(p50, p95)
- 슬라이스별 분리 보고
회귀 기준
섹션 제목: “회귀 기준”- 임계값을 파일(metrics.yml)에 명시
- 슬라이스별 임계값 별도
- CI가 임계값 위반 시 자동 차단
Judge
섹션 제목: “Judge”- LLM-as-judge 사용 시 사람 라벨과의 agreement 측정
- judge 프롬프트도 별도 버전 관리
- 평가 대상과 다른 모델/다른 sub-agent로 채점
운영 연결
섹션 제목: “운영 연결”- 운영 로그에서 주기적으로 새 케이스 추가
- 변경마다 reports/ 파일 커밋
- 자기 검증 금지(CLAUDE.md §10)