checklist
체크리스트 — 학습·정렬·RLHF
섹션 제목: “체크리스트 — 학습·정렬·RLHF”- 사전학습·SFT·RLHF의 산물을 한 줄씩 말할 수 있는가?
- 보상 모델이 직접 점수가 아닌 비교 선호로 학습되는 이유는?
- PPO 보상 함수의 두 항(
r_θ,r_KL)은 각각 무엇을 막는가? - “RLHF는 환각을 줄인다/늘린다” 중 어느 쪽이며 왜인가?
- Constitutional AI의 핵심 차이점은 무엇인가?
- 모델 거절을 만났을 때의 첫 대응은?
- “정렬은 안전 보증이 아니다”의 운영적 함의는?