references
References — 평가 & 회귀
섹션 제목: “References — 평가 & 회귀”1차 자료 (Anthropic)
섹션 제목: “1차 자료 (Anthropic)”- Prompt engineering overview —
sources/08-prompt-engineering/anthropic-prompt-engineering-overview.md,sources/01-anthropic-official/prompting/prompt-engineering-overview.md- 매핑: “성공 기준 + 경험적 테스트 + 초안” 3 선행 조건. 모델 교체 vs 프롬프트 튜닝의 경계.
- Prompting best practices —
sources/08-prompt-engineering/anthropic-prompting-best-practices.md- 매핑: 평가 기반 반복 개선의 일반 원칙.
학술 벤치마크 (산업 평가에 주는 교훈)
섹션 제목: “학술 벤치마크 (산업 평가에 주는 교훈)”- Jimenez et al. SWE-bench (2023) —
sources/18-research-papers/eval/swe-bench-arxiv-2310-06770.md- 매핑: 실제 데이터 기반 평가. arXiv:2310.06770.
- OpenAI SWE-bench Verified (2024) —
sources/18-research-papers/eval/swe-bench-verified-openai-2024.md- 매핑: 사람 검증 라벨의 중요성.
- Jain et al. LiveCodeBench (2024) —
sources/18-research-papers/eval/livecodebench-arxiv-2403-07974.md- 매핑: 시간 분할로 데이터 누수 차단. arXiv:2403.07974.
- Liu et al. RepoBench (2023) —
sources/18-research-papers/eval/repobench-arxiv-2306-03091.md- 매핑: 평가 단위가 작업 단위와 일치해야 함. arXiv:2306.03091.
- Ding et al. CrossCodeEval (2023) —
sources/18-research-papers/eval/crosscodeeval-arxiv-2310-11248.md- 매핑: 슬라이스(언어)별 분리 측정. arXiv:2310.11248.
- Zhao et al. Commit0 (2024) —
sources/18-research-papers/eval/commit0-arxiv-2412-01769.md- 매핑: 점진적 개선 측정. arXiv:2412.01769.
- SWE-bench Multimodal —
sources/18-research-papers/eval/swe-bench-multimodal-arxiv-2410-03859.md- 매핑: 평가 영역 확장.
인용 규칙
섹션 제목: “인용 규칙”영문 인용은 원문 + 한국어 의역 병기.