콘텐츠로 이동

01-평가가-먼저다

Anthropic의 Prompt engineering overview는 프롬프트 튜닝의 선행 조건을 단호하게 명시한다.

“This guide assumes that you have: 1) A clear definition of the success criteria for your use case, 2) Some ways to empirically test against those criteria, 3) A first draft prompt you want to improve. If not, we highly suggest you spend time establishing that first.” — Prompt engineering overview, Anthropic

의역: “이 가이드는 다음 세 가지가 있다고 전제한다. (1) 성공 기준의 명확한 정의, (2) 그 기준에 대해 경험적으로 테스트할 수단, (3) 개선하려는 초안 프롬프트. 그렇지 않다면 그것을 먼저 만드는 데 시간을 쓰기를 강력히 권한다.”

순서가 핵심이다. 평가 → 초안 → 튜닝. 그 반대가 아니다.

평가 없이는 “개선”이 정의되지 않는다

섹션 제목: “평가 없이는 “개선”이 정의되지 않는다”

프롬프트 튜닝에서 흔한 실패 흐름:

  1. 프롬프트를 한 번 손본다
  2. 한두 개 입력을 직접 돌려본다
  3. “좋아진 것 같다”고 느낀다
  4. 배포한다
  5. 운영에서 다른 입력이 깨진다
  6. 다시 손본다 → 이전에 잘 되던 게 깨진다 (회귀)

이 사이클의 근본 원인은 단 하나 — 측정 단위가 없다. 회귀 세트가 있다면 (3)에서 “F1이 0.78에서 0.81로 올랐는가, 다른 슬라이스가 떨어지지 않았는가”를 답할 수 있다.

모델 교체 vs 프롬프트 튜닝의 경계

섹션 제목: “모델 교체 vs 프롬프트 튜닝의 경계”

“Not every success criteria or failing eval is best solved by prompt engineering. For example, latency and cost can be sometimes more easily improved by selecting a different model.” — Prompt engineering overview, Anthropic

의역: “모든 성공 기준이나 실패 평가가 프롬프트 엔지니어링으로 가장 잘 풀리는 것은 아니다. 예를 들어 지연과 비용은 때때로 다른 모델을 고르는 것이 더 쉬운 해결책이다.”

평가 세트가 있어야 이 판단이 가능하다. “Sonnet에서 78%, Opus에서 89%“라는 수치가 있어야 모델 교체가 답인지, 프롬프트가 답인지 결정할 수 있다.

산업 환경의 평가는 학술 벤치마크에서 많은 것을 배울 수 있다.

  • SWE-bench (Jimenez et al., 2023) — 실제 GitHub 이슈와 PR 쌍으로 코딩 능력을 평가. “실제 데이터에 기반한 평가가 합성 데이터보다 신뢰할 수 있다.”
  • SWE-bench Verified (OpenAI, 2024) — 사람이 검증한 부분집합. “평가 세트의 라벨 품질이 결과를 좌우한다.”
  • LiveCodeBench (Jain et al., 2024) — 시간이 지나면서 새 문제로 갱신. “학습 데이터 누수를 막기 위해 시간 분할(time split)이 필요하다.”
  • RepoBench (Liu et al., 2023) — 단일 함수가 아닌 저장소 수준 문맥. “평가 단위가 작업 단위와 일치해야 한다.”
  • CrossCodeEval (Ding et al., 2023) — 여러 언어 간 일반화. “한 슬라이스의 향상이 다른 슬라이스의 회귀가 아닌지 확인하라.”
  • Commit0 (Zhao et al., 2024) — 빈 저장소에서 시작해 전체 리포지토리를 작성. “평가는 점진적 개선을 측정해야 한다.”

이 교훈들을 산업 환경에 의역하면:

학술 발견산업 적용
실제 데이터 기반합성 입력이 아닌 운영 로그에서 평가 세트 추출
사람 검증 라벨적어도 20% 이상은 도메인 전문가가 라벨링
시간 분할”지난주 데이터”로 학습/튜닝, “이번 주”로 평가
작업 단위 일치실제 호출 단위(예: 한 PR, 한 이슈)로 평가
여러 슬라이스카테고리·언어·길이별로 분리 측정
점진적 측정변경마다 회귀 점수 기록