콘텐츠로 이동

references

  • Prompt engineering overviewsources/08-prompt-engineering/anthropic-prompt-engineering-overview.md, sources/01-anthropic-official/prompting/prompt-engineering-overview.md
    • 매핑: “성공 기준 + 경험적 테스트 + 초안” 3 선행 조건. 모델 교체 vs 프롬프트 튜닝의 경계.
  • Prompting best practicessources/08-prompt-engineering/anthropic-prompting-best-practices.md
    • 매핑: 평가 기반 반복 개선의 일반 원칙.

학술 벤치마크 (산업 평가에 주는 교훈)

섹션 제목: “학술 벤치마크 (산업 평가에 주는 교훈)”
  • Jimenez et al. SWE-bench (2023) — sources/18-research-papers/eval/swe-bench-arxiv-2310-06770.md
    • 매핑: 실제 데이터 기반 평가. arXiv:2310.06770.
  • OpenAI SWE-bench Verified (2024) — sources/18-research-papers/eval/swe-bench-verified-openai-2024.md
    • 매핑: 사람 검증 라벨의 중요성.
  • Jain et al. LiveCodeBench (2024) — sources/18-research-papers/eval/livecodebench-arxiv-2403-07974.md
    • 매핑: 시간 분할로 데이터 누수 차단. arXiv:2403.07974.
  • Liu et al. RepoBench (2023) — sources/18-research-papers/eval/repobench-arxiv-2306-03091.md
    • 매핑: 평가 단위가 작업 단위와 일치해야 함. arXiv:2306.03091.
  • Ding et al. CrossCodeEval (2023) — sources/18-research-papers/eval/crosscodeeval-arxiv-2310-11248.md
    • 매핑: 슬라이스(언어)별 분리 측정. arXiv:2310.11248.
  • Zhao et al. Commit0 (2024) — sources/18-research-papers/eval/commit0-arxiv-2412-01769.md
    • 매핑: 점진적 개선 측정. arXiv:2412.01769.
  • SWE-bench Multimodalsources/18-research-papers/eval/swe-bench-multimodal-arxiv-2410-03859.md
    • 매핑: 평가 영역 확장.

영문 인용은 원문 + 한국어 의역 병기.