← 목차Part 00 · AI·LLM·에이전트 이론 기초·00-4 · 10분
이 클립 · AI·LLM·에이전트 이론 기초

랜덤성과 창의성 — 같은 질문에 다른 답이 나오는 이유

학습목표: 같은 질문에 답이 달라지는 이유를 다음 토큰 예측, temperature, top-p 샘플링으로 이해하고, 정확성이 중요한 작업과 아이디어가 필요한 작업에서 설정을 다르게 고르는 감각을 익힌다. [TH-001, TH-009, TH-010, TH-011]

1. 핵심 개념 — 한 문장 정의 + 비유

AI의 답변은 정해진 문장을 꺼내는 과정이 아니라, 매 위치에서 “다음에 올 토큰”의 후보 분포를 만들고 그중 하나를 고르는 과정이다. [TH-001, TH-002]

여기서 토큰은 단어 하나가 아니라 토크나이저가 쪼갠 작은 글자 조각 또는 단어 조각을 뜻한다. [TH-002]

랜덤성은 이 후보들 중 무엇을 고를지에 여지를 남기는 성질이고, 창의성은 그 여지가 문체·아이디어·구성의 다양성으로 보이는 현상이다. [TH-003, TH-009, TH-011]

비유하자면 AI는 매 순간 객관식 문제를 푸는 학생이고, temperature는 1번 답만 고집할지 2번과 3번도 살펴볼지 정하는 긴장도 조절 손잡이다. [TH-009]

top-p는 후보 전체를 다 열어두지 않고 “가능성이 높은 후보들이 누적확률 p에 도달할 때까지만” 남기는 울타리다. [TH-010]

2. 자세히 들여다보기 — 작동 원리·배경을 초보자 눈높이로

LLM은 거대한 문장 자동완성 장치처럼 보이지만, 실제 학습 목표는 텍스트의 각 위치에서 다음 토큰을 맞히는 지도학습 문제다. [TH-001]

이 단순한 훈련만으로 문법, 사실, 문체, 코드, 추론 구조 같은 능력이 함께 배운 것처럼 나타난다. [TH-003]

logit은 모델이 후보 토큰마다 붙이는 원점수이고, softmax는 그 원점수를 확률처럼 더하면 1이 되도록 바꾸는 계산이라고 보면 된다. [TH-009]

temperature는 softmax 전에 logit을 스케일링해서 확률 분포를 더 뾰족하게 만들거나 더 평평하게 만든다. [TH-009]

temperature를 낮추면 점수가 높은 후보 쪽으로 선택이 더 쏠리고, 반대로 올리면 중간 후보에게도 뽑힐 기회가 돌아간다. [TH-009]

top-p 샘플링, 또는 뉴클리어스 샘플링은 확률이 높은 후보부터 더해 누적확률 p에 도달할 때까지만 후보를 남기는 방식이다. [TH-010]

이 방식은 가능성이 아주 낮은 토큰이 갑자기 뽑히는 일을 막는 안전망 역할을 한다. [TH-010]

중요한 순서는 temperature가 먼저 분포의 모양을 바꾸고, 그다음 top-k나 top-p가 후보를 거른 뒤, 마지막에 남은 후보 중에서 추첨이 일어난다는 점이다. [TH-011]

같은 질문에 답이 매번 달라지는 까닭이 여기서 드러난다. 모델은 정해진 문장을 어딘가에 저장해 두었다가 그대로 꺼내는 것이 아니라, 그때그때 후보 분포를 만들어 거기서 하나를 뽑는다. [TH-001, TH-011]

결정성은 같은 입력에서 같은 결과가 나오도록 변동을 줄이는 방향이고, 다양성은 여러 가능한 답을 탐색하도록 변동을 허용하는 방향이다. [TH-009, TH-011]

재현성은 나중에 같은 작업을 다시 했을 때 결과를 비교할 수 있을 만큼 입력, 문맥, 설정, 검토 기준을 안정적으로 유지하는 운영 감각이다. [TH-004, TH-015]

3. 2026년 지금은 — 최신 동향·주의점

2026년에 중요한 변화는 답변 품질을 단순히 “창의적으로 써줘”라는 말에 맡기지 않고, 추론 시간의 토큰 사용과 컨텍스트 관리까지 함께 보는 방향이다. [TH-015, TH-020]

추론 모델은 답을 내기 전에 thinking 토큰을 더 쓰며, 이것은 시험 볼 때 암산 공간을 더 쓰는 것과 비슷하게 이해할 수 있다. [TH-020]

다만 추론 모델은 쉬운 문제에도 토큰을 많이 쓰는 과잉사고 문제가 있을 수 있다. [TH-022]

GPT-5는 빠른 모델, 추론 모델, 실시간 라우터가 결합된 통합 시스템으로 설명된다. [TH-040]

GPT-5.1은 작업 복잡도에 따라 생각 시간을 동적으로 조절해 효율을 높이는 방향으로 설명된다. [TH-023]

이 흐름에서 temperature와 top-p는 여전히 중요하지만, 답변의 일관성은 샘플링 설정만이 아니라 컨텍스트 안에 무엇이 들어가 있는지에도 크게 영향을 받는다. [TH-004, TH-015, TH-017]

컨텍스트 윈도우는 프롬프트, 이전 대화, 첨부, 답변까지 모든 토큰의 합이다. [TH-004]

컨텍스트가 길어질수록 그 안의 정보를 정확히 회상하는 능력이 떨어지는 context rot이 생길 수 있다. [TH-017]

환각은 단순히 temperature가 높아서만 생기는 문제가 아니라, 학습과 평가가 “모름을 인정하기”보다 “그럴듯하게 찍기”를 보상하는 구조와도 연결된다. [TH-012]

잘못된 내용이 컨텍스트에 들어가 반복 참조되면, 이후 답변이 그 거짓 위에 전략을 쌓는 컨텍스트 오염이 생길 수 있다. [TH-033]

4. 비개발자에게 무슨 의미인가 — 코덱스 앱과 어떻게 연결되나

비개발자에게 첫 번째 의미는 “AI가 달라졌다”가 아니라 “내 작업에 맞는 샘플링 성격을 골라야 한다”는 것이다. [TH-009, TH-010, TH-011]

계약서 요약, 회의록 정리, 비용 비교처럼 정확성과 재현성이 생명인 일이라면 후보 분포를 뾰족하게 죄는 쪽이 맞다. [TH-009, TH-011]

반대로 광고 문구, 제목 후보, 강의 예시, 발표 비유처럼 선택지가 많을수록 좋은 일이라면 후보가 다양하게 보이도록 풀어 주는 쪽이 맞다. [TH-009, TH-011]

top-p는 창의성을 완전히 끄는 장치가 아니라, 너무 낮은 확률의 엉뚱한 후보를 바깥에 세워두는 울타리로 이해하는 편이 좋다. [TH-010]

Codex에서 Skills, Automations, Sites(프리뷰, Business·Enterprise 한정), Memory(프리뷰, Enterprise·Edu·EU·UK 한정), Plugins 같은 기능 이름을 보더라도 이 원리는 그대로 남는다. [TH-015, TH-016]

반복 작업은 좋은 프롬프트 한 줄보다 전체 컨텍스트 상태를 관리하는 방식으로 안정화해야 한다. [TH-015, TH-016]

긴 작업에서는 압축, 구조화 노트, 서브에이전트 같은 방법으로 컨텍스트를 관리해야 한다. [TH-036, TH-037]

실행이 들어가는 작업에서는 모델의 추론과 실제 실행을 분리하고, 부작용이 생기기 전에 사람 승인을 두는 패턴이 가장 신뢰적이다. [TH-038, TH-039]

그러니 실무의 순서는 분명하다. “이 일은 정확해야 하나, 다양해야 하나, 몇 번이고 검증해야 하나”를 먼저 묻고 나서 temperature와 top-p, 컨텍스트 정리 방식을 한 묶음으로 고른다. [TH-009, TH-010, TH-015]

5. 한 줄 정리 + 용어 미니사전

한 줄 정리: AI의 답이 매번 달라지는 이유는 다음 토큰 후보 분포를 만든 뒤 temperature로 모양을 바꾸고 top-p로 후보를 거른 다음 샘플링하기 때문이다. [TH-001, TH-009, TH-010, TH-011]

temperature: softmax 전 logit을 조절해 확률 분포를 뾰족하게 또는 평평하게 만드는 설정이다. [TH-009]

top-p: 누적확률 p에 들어오는 후보만 남겨 낮은 확률 후보를 막는 뉴클리어스 샘플링 방식이다. [TH-010]

샘플링: 조정되고 걸러진 후보들 중 하나를 실제 다음 토큰으로 뽑는 단계다. [TH-011]

결정성: 같은 조건에서 비슷하거나 같은 결과를 얻기 위해 후보 선택의 흔들림을 줄이는 방향이다. [TH-009, TH-011]

다양성: 여러 후보가 선택될 여지를 넓혀 표현, 아이디어, 구성의 변화를 얻는 방향이다. [TH-009, TH-011]

컨텍스트: 프롬프트, 이력, 첨부, 답변을 모두 합친 토큰 묶음이다. [TH-004]

출처

본문의 [...] 표기는 아래 근거에서 확인할 수 있습니다.

코덱스 100가지 스킬스 활용 바이블 · 00-4 · 근거 기반 교재 · 2026-06 기준