콘텐츠로 이동

anti-patterns

안티패턴 — 정렬을 잘못 이해할 때

섹션 제목: “안티패턴 — 정렬을 잘못 이해할 때”

1. “Claude는 원래 거절하는 모델”이라는 단정

섹션 제목: “1. “Claude는 원래 거절하는 모델”이라는 단정”

거절은 정렬 단계에서 학습된 정책의 산물이지 모델 본성이 아니다. 맥락 명시·역할 부여로 풀리는 거절이 많다(단, 사용 정책 위반은 아니다).

2. 사용 정책 위반을 “맥락”으로 우회

섹션 제목: “2. 사용 정책 위반을 “맥락”으로 우회”

범죄·자해·사이버 공격·아동 안전 침해 등 사용 정책 위반은 어떤 프롬프트 기교로도 정당화되지 않는다. 시도 자체가 계정·법적 책임 문제를 만든다(08장).

3. “정렬되었으니 안전하다”는 가정

섹션 제목: “3. “정렬되었으니 안전하다”는 가정”

정렬은 통계적 향상이지 절대적 보증이 아니다. 보안·법적 책임이 걸린 출력은 사람·테스트·다른 모델의 검증 루프 필수.

4. RLHF가 환각을 해결 한다고 생각하기

섹션 제목: “4. RLHF가 환각을 해결 한다고 생각하기”

RLHF는 환각을 늘리기도 한다(Huyen). 정렬과 사실성은 다른 축이다. 05장과 결합해 다뤄야 한다.

5. 자기 검증 모델을 신뢰의 종착점으로 두기

섹션 제목: “5. 자기 검증 모델을 신뢰의 종착점으로 두기”

Constitutional AI·자기 비평 루프는 효과적이지만, 같은 편향을 강화할 수 있다. CLAUDE.md §10 “자기 승인 금지”는 이 위험에 직접 대응한다.