02-구조
02 · SFT와 RLHF의 3단계
섹션 제목: “02 · SFT와 RLHF의 3단계”단계 1 — 사전학습(Pretraining)
섹션 제목: “단계 1 — 사전학습(Pretraining)”수십억~수조 토큰의 인터넷 텍스트로 다음 토큰 예측을 반복한다. Hugging Face의 정리에 따르면 대표적인 시작 모델 규모는 다음과 같다.
원문: “Examples: OpenAI used GPT-3 variants, Anthropic used 10M-52B parameter models, DeepMind used Gopher (280B parameters).”
의역: “예: OpenAI는 GPT-3 변형을, Anthropic은 10M~52B 파라미터 모델을, DeepMind는 Gopher(280B)를 사전학습 출발점으로 썼다.” — Illustrating RLHF
이 단계의 산물은 “언어를 흉내 낼 줄 아는” 모델일 뿐, 특정 작업에 맞춰진 어시스턴트는 아직 아니다.
단계 2 — 지도 미세조정(SFT)
섹션 제목: “단계 2 — 지도 미세조정(SFT)”큐레이션된 (프롬프트, 모범 답변) 쌍을 가지고 사전학습 모델을 추가 학습한다. Chip Huyen의 표현으로는 “behavior cloning”이다 — 모델에게 원하는 행동의 시범 을 보여 주고, 다음 토큰 예측으로 그 시범을 따라 하게 만든다. 이 단계만으로도 모델은 이미 상당히 “어시스턴트답게” 변한다.
Anthropic의 Constitutional AI 같은 변형은 이 단계에서 사람 시범 외에 모델 스스로 작성한 자기 비평/수정 을 함께 사용한다. 이 부분은 02장 끝에서 다시 짚는다.
단계 3 — 인간 피드백 강화학습(RLHF)
섹션 제목: “단계 3 — 인간 피드백 강화학습(RLHF)”세부 절차는 두 단계로 쪼개진다.
3-A. 보상 모델(Reward Model) 학습
섹션 제목: “3-A. 보상 모델(Reward Model) 학습”- SFT 모델에게 같은 프롬프트로 여러 답변을 만들게 한다.
- 사람이 답변 쌍을 비교해 더 나은 쪽을 표시한다.
- 이 비교 데이터로 별도의 신경망(보상 모델)을 학습한다. 보상 모델은 임의의 (프롬프트, 답변)에 스칼라 보상을 부여한다.
원문: “Models vary in size relative to the generation model (e.g., OpenAI: 175B LM with 6B reward model).”
의역: “보상 모델은 본 LM보다 훨씬 작은 경우도 흔하다(예: OpenAI 175B LM에 6B 보상 모델).” — Illustrating RLHF
3-B. 정책(Policy) 최적화
섹션 제목: “3-B. 정책(Policy) 최적화”보상 모델이 손에 들어오면, 본 모델(정책)을 강화학습으로 미세조정한다. 표준 알고리즘은 PPO(Proximal Policy Optimization)다. 보상 함수는 두 항의 합/차로 만든다.
final_reward = r_θ - λ · r_KLr_θ— 보상 모델이 매긴 선호 점수.r_KL— 현재 정책과 원래 SFT 모델 사이의 KL 발산. 정책이 너무 멀리 벗어나는 것을 막는 페널티.
원문: “KL divergence keeps the model coherent and aligned with pretraining.”
의역: “KL 발산 항이 모델을 일관되고 사전학습 분포에 가깝게 묶어 둔다.” — Illustrating RLHF
이 페널티가 없으면 정책은 보상 모델을 속이는 출력으로 도망친다(reward hacking) — 사람 보기엔 의미 없는 토큰 반복인데 보상 모델만 높은 점수를 주는 식이다. KL 항이 이 도주를 막는다.
한계 — RLHF가 만능이 아닌 이유
섹션 제목: “한계 — RLHF가 만능이 아닌 이유”같은 두 글이 짚는 한계는 다음과 같다.
- 사람 라벨이 비싸다 — 고품질 비교 데이터는 모으기 어렵고 느리다.
- 라벨러 간 의견 차이 — Huyen의 통계로 합의율 약 73%. 학습 데이터에 본질적 노이즈가 있다.
- 여전히 해롭거나 부정확한 출력 발생 — 정렬은 완벽한 안전 이 아니라 통계적 향상 이다.
- 환각이 오히려 늘 수 있다 — Huyen이 인용하는 paradox: “RLHF improves performance significantly compared to SFT alone, though it paradoxically increases hallucination while improving overall quality.”
의역: “RLHF는 SFT 단독보다 전반적 품질을 끌어올리지만, 역설적으로 환각은 오히려 늘기도 한다.”
이 paradox는 05장(환각) 챕터의 출발점이 된다.
변형 — Constitutional AI / RLAIF
섹션 제목: “변형 — Constitutional AI / RLAIF”사람 라벨이 비싼 문제를 풀기 위해 Anthropic은 Constitutional AI(CAI) 라는 변형을 제안했다. 핵심 아이디어는 사람 비교 라벨 대신, 미리 정한 규범(“constitution”)을 따라 모델 자신이 답변을 비평·수정하는 데이터를 생성 한다는 것이다. 이 기법은 일반화하면 RLAIF(Reinforcement Learning from AI Feedback)라고 불리며, 본 위키의 Part 7·Part 10에서 다시 다룬다.
정리 — 한 표
섹션 제목: “정리 — 한 표”| 단계 | 데이터 | 목적 | 산물 |
|---|---|---|---|
| 사전학습 | 인터넷 텍스트(수조 토큰) | 언어 통계 학습 | 베이스 LM |
| SFT | (프롬프트, 모범 답변) 쌍 | 행동 양식 시범 | 어시스턴트형 LM |
| RLHF | (프롬프트, 답변쌍, 선호) | 주관적 품질 정렬 | 정렬된 모델 |