Project NEUROVERSE
목차

기초 이론 편 · 3부 ChatGPT는 어떻게 대답을 만들까? — 3.6

글 이어쓰기 기계가 채팅봇이 되기까지

다음 토큰 맞히기만 배운 모델은 질문에 대답하지 않습니다. 대답하는 법은 따로 더 배웁니다.

지금까지 LLM은 “다음 토큰 맞히기”를 엄청난 양의 글로 배운다고 했습니다. 그런데 그렇게만 배운 모델에게 질문을 하면, 의외로 대답을 안 합니다. 인터넷에는 질문 다음에 꼭 대답이 오는 글만 있는 게 아니니까요.

ChatGPT 같은 채팅봇은 보통 세 단계를 거쳐서 만들어집니다.

같은 질문에 학습 단계마다 어떻게 답하는지 단계를 눌러 비교해보세요.

질문 김치찌개 맛있게 끓이는 법 알려줘

김치찌개 맛있게 끓이는 법 알려줘
된장찌개 맛있게 끓이는 법 알려줘
부대찌개 맛있게 끓이는 법 알려줘
자취생 간단 요리 모음 | 조회수 1.2만

질문에 답하지 않고, 인터넷 글의 다음에 올 법한 내용을 이어 써요. 질문 목록이 이어지는 웹페이지처럼요.

답은 설명을 위해 직접 쓴 예시예요. 실제 모델의 출력이 아니에요.

1단계: 사전학습

엄청난 양의 글로 다음 토큰 맞히기를 학습합니다. 3.1에서 본 그 학습입니다. 시간과 비용이 가장 많이 드는 단계입니다. 이 단계가 끝난 모델은 언어와 지식을 많이 알지만, 하는 일은 “그럴듯하게 이어 쓰기”입니다. 질문을 주면 질문 목록이 이어지는 웹페이지처럼 다른 질문을 이어 쓸 수도 있습니다.

2단계: 지시 따르기 학습

“질문 → 좋은 대답” 모양의 예시를 모아서 추가로 학습합니다. 사람이 직접 쓴 좋은 대답들입니다. 학습 방법은 1단계와 같아요(다음 토큰 맞히기). 달라진 건 예시의 모양뿐입니다. 이걸 배우면 모델은 질문 다음에 대답이 오는 글을 이어 쓰게 됩니다. 이렇게 이미 학습된 모델을 특정 목적에 맞게 추가로 학습하는 걸 파인튜닝(fine-tuning) 이라고 합니다.

3단계: 사람이 고른 답 반영

같은 질문에 모델이 낸 답 여러 개를 사람에게 보여주고 어느 쪽이 더 나은지 고르게 합니다. 이 선택들을 모아서 “사람이 좋아할 답”을 점수로 매기는 방법을 배우고, 모델이 그 점수가 높은 답을 내도록 조정합니다. 이걸 RLHF (Reinforcement Learning from Human Feedback, 사람 피드백을 이용한 강화학습)라고 부릅니다.

좋은 대답을 처음부터 다 써주는 것보다 둘 중 하나 고르기가 사람에게 훨씬 쉽습니다. 그래서 더 많은 피드백을 모을 수 있습니다. 해로운 요청을 거절하는 태도 같은 것도 주로 이 단계들에서 다듬습니다.

더 깊게 · 이 방법은 언제 알려졌을까

OpenAI는 2022년에 “InstructGPT” 연구에서 사람의 피드백으로 지시를 잘 따르게 학습하는 방법을 발표했고, 같은 해 말 공개된 ChatGPT도 비슷한 방법을 썼다고 밝혔습니다. 그 뒤로 이 흐름(사전학습 → 지시 따르기 → 선호 반영)이 채팅봇을 만드는 기본 틀로 널리 쓰이고 있습니다.

사람이 고른 답을 학습에 반영하는 방법도 여러 가지가 나왔습니다. 점수 매기는 모델을 따로 만들지 않고 “고른 답 / 안 고른 답” 쌍에서 바로 배우는 방법(DPO 같은)도 많이 쓰입니다. 이름은 달라도 “사람이 더 좋다고 고른 쪽으로 조금씩 조정한다”는 생각은 같습니다.

정리

  • 사전학습: 엄청난 글로 다음 토큰 맞히기. 지식과 언어를 배우지만, 대답하는 법은 모릅니다.
  • 지시 따르기 학습: “질문 → 좋은 대답” 예시로 추가 학습(파인튜닝). 대답하는 모양을 배웁니다.
  • 사람이 고른 답 반영(RLHF 등): 둘 중 더 나은 답을 고른 데이터로 조정. 더 도움 되는 쪽으로 다듬습니다.

여기까지가 “ChatGPT는 어떻게 대답을 만들까?”입니다. 다음 4부에서는 이 모델을 실제로 쓸 때 일어나는 일들을 보겠습니다.

이 장을 복사합니다. ChatGPT나 Claude 같은 AI에 붙여넣고 그대로 보내면 AI가 다 읽었다고 답합니다. 그다음 궁금한 걸 물어보세요.