콘텐츠로 이동

학습·정렬·RLHF

사전학습된 LLM은 사실 “정중하지도 안전하지도 않은 거대한 텍스트 자동 완성기”다. 우리가 ChatGPT·Claude에서 보는 대화하는 인격 은, 그 위에 덧입혀진 두 단계의 추가 학습으로 만들어진다 — 지도 미세조정(SFT)과 인간 피드백 강화학습(RLHF).

LLM은 ① 사전학습으로 언어 통계를, ② 지도 미세조정(SFT)으로 행동 양식을, ③ 인간 피드백 강화학습(RLHF)으로 인간 선호를 학습한다. Claude의 “정중함·도움됨·안전성”은 이 3단계의 산물이다.

전 사용자. “왜 같은 모델인데 어떤 답변은 거절하고 어떤 답변은 도와주는지”의 메커니즘을 이해하기 위함.

  • 사전학습 → SFT → RLHF의 3단계를 한 줄씩 설명할 수 있다.
  • 보상 모델(reward model)이 직접 점수 가 아니라 비교 선호 로 학습되는 이유를 안다.
  • KL 발산 페널티가 왜 필요한지(reward hacking 방지) 안다.
  • “RLHF는 환각을 오히려 키운다”는 paradox를 이해한다.
  • Constitutional AI와 RLAIF가 RLHF의 어떤 한계를 푸는지 안다.