콘텐츠로 이동

02-구조

수십억~수조 토큰의 인터넷 텍스트로 다음 토큰 예측을 반복한다. Hugging Face의 정리에 따르면 대표적인 시작 모델 규모는 다음과 같다.

원문: “Examples: OpenAI used GPT-3 variants, Anthropic used 10M-52B parameter models, DeepMind used Gopher (280B parameters).”
의역: “예: OpenAI는 GPT-3 변형을, Anthropic은 10M~52B 파라미터 모델을, DeepMind는 Gopher(280B)를 사전학습 출발점으로 썼다.” — Illustrating RLHF

이 단계의 산물은 “언어를 흉내 낼 줄 아는” 모델일 뿐, 특정 작업에 맞춰진 어시스턴트는 아직 아니다.

큐레이션된 (프롬프트, 모범 답변) 쌍을 가지고 사전학습 모델을 추가 학습한다. Chip Huyen의 표현으로는 “behavior cloning”이다 — 모델에게 원하는 행동의 시범 을 보여 주고, 다음 토큰 예측으로 그 시범을 따라 하게 만든다. 이 단계만으로도 모델은 이미 상당히 “어시스턴트답게” 변한다.

Anthropic의 Constitutional AI 같은 변형은 이 단계에서 사람 시범 외에 모델 스스로 작성한 자기 비평/수정 을 함께 사용한다. 이 부분은 02장 끝에서 다시 짚는다.

단계 3 — 인간 피드백 강화학습(RLHF)

섹션 제목: “단계 3 — 인간 피드백 강화학습(RLHF)”

세부 절차는 두 단계로 쪼개진다.

  • SFT 모델에게 같은 프롬프트로 여러 답변을 만들게 한다.
  • 사람이 답변 쌍을 비교해 더 나은 쪽을 표시한다.
  • 이 비교 데이터로 별도의 신경망(보상 모델)을 학습한다. 보상 모델은 임의의 (프롬프트, 답변)에 스칼라 보상을 부여한다.

원문: “Models vary in size relative to the generation model (e.g., OpenAI: 175B LM with 6B reward model).”
의역: “보상 모델은 본 LM보다 훨씬 작은 경우도 흔하다(예: OpenAI 175B LM에 6B 보상 모델).” — Illustrating RLHF

보상 모델이 손에 들어오면, 본 모델(정책)을 강화학습으로 미세조정한다. 표준 알고리즘은 PPO(Proximal Policy Optimization)다. 보상 함수는 두 항의 합/차로 만든다.

final_reward = r_θ - λ · r_KL
  • r_θ — 보상 모델이 매긴 선호 점수.
  • r_KL — 현재 정책과 원래 SFT 모델 사이의 KL 발산. 정책이 너무 멀리 벗어나는 것을 막는 페널티.

원문: “KL divergence keeps the model coherent and aligned with pretraining.”
의역: “KL 발산 항이 모델을 일관되고 사전학습 분포에 가깝게 묶어 둔다.” — Illustrating RLHF

이 페널티가 없으면 정책은 보상 모델을 속이는 출력으로 도망친다(reward hacking) — 사람 보기엔 의미 없는 토큰 반복인데 보상 모델만 높은 점수를 주는 식이다. KL 항이 이 도주를 막는다.

한계 — RLHF가 만능이 아닌 이유

섹션 제목: “한계 — RLHF가 만능이 아닌 이유”

같은 두 글이 짚는 한계는 다음과 같다.

  1. 사람 라벨이 비싸다 — 고품질 비교 데이터는 모으기 어렵고 느리다.
  2. 라벨러 간 의견 차이 — Huyen의 통계로 합의율 약 73%. 학습 데이터에 본질적 노이즈가 있다.
  3. 여전히 해롭거나 부정확한 출력 발생 — 정렬은 완벽한 안전 이 아니라 통계적 향상 이다.
  4. 환각이 오히려 늘 수 있다 — Huyen이 인용하는 paradox: “RLHF improves performance significantly compared to SFT alone, though it paradoxically increases hallucination while improving overall quality.”
    의역: “RLHF는 SFT 단독보다 전반적 품질을 끌어올리지만, 역설적으로 환각은 오히려 늘기도 한다.”

이 paradox는 05장(환각) 챕터의 출발점이 된다.

사람 라벨이 비싼 문제를 풀기 위해 Anthropic은 Constitutional AI(CAI) 라는 변형을 제안했다. 핵심 아이디어는 사람 비교 라벨 대신, 미리 정한 규범(“constitution”)을 따라 모델 자신이 답변을 비평·수정하는 데이터를 생성 한다는 것이다. 이 기법은 일반화하면 RLAIF(Reinforcement Learning from AI Feedback)라고 불리며, 본 위키의 Part 7·Part 10에서 다시 다룬다.

단계데이터목적산물
사전학습인터넷 텍스트(수조 토큰)언어 통계 학습베이스 LM
SFT(프롬프트, 모범 답변) 쌍행동 양식 시범어시스턴트형 LM
RLHF(프롬프트, 답변쌍, 선호)주관적 품질 정렬정렬된 모델