콘텐츠로 이동

checklist

  • 사전학습·SFT·RLHF의 산물을 한 줄씩 말할 수 있는가?
  • 보상 모델이 직접 점수가 아닌 비교 선호로 학습되는 이유는?
  • PPO 보상 함수의 두 항(r_θ, r_KL)은 각각 무엇을 막는가?
  • “RLHF는 환각을 줄인다/늘린다” 중 어느 쪽이며 왜인가?
  • Constitutional AI의 핵심 차이점은 무엇인가?
  • 모델 거절을 만났을 때의 첫 대응은?
  • “정렬은 안전 보증이 아니다”의 운영적 함의는?