← 학습 경로

RL · 2026-09-25

토큰 생성은 어떻게 강화학습의 행동이 되는가

미로에서 이동을 고르는 일과 LLM이 다음 토큰을 고르는 일을 비교하고, 여러 토큰으로 만든 응답에 보상이 붙는 과정을 살펴봅니다.

강화학습을 떠올리면 게임을 하는 인공지능이나 움직이는 로봇이 먼저 생각날 수 있습니다. 이들은 현재 상황을 보고 행동을 선택하고, 그 결과를 바탕으로 다음에는 더 나은 선택을 하도록 학습합니다. 그렇다면 문장을 만드는 LLM에서는 무엇이 행동이고, 어떤 결과를 평가할까요?

이 연재에서는 문맥을 보고 다음 토큰 하나를 선택하는 일을 행동으로 보겠습니다. 토큰은 모델이 텍스트를 다루는 단위로, 단어나 단어의 일부, 문장부호 등이 될 수 있습니다. 먼저 미로에서의 이동을 토큰 선택에 대응시킨 뒤, 여러 선택이 모여 응답 하나가 되고 그 응답이 평가되는 과정을 따라갑니다. 이 흐름을 이해하면 이후의 보상, 학습 알고리즘, 추론·학습 시스템도 같은 과정의 어느 부분을 담당하는지 연결할 수 있습니다.

상황을 보고 행동을 고르는 정책

작은 미로에서 출발점부터 목표 지점까지 이동하는 문제를 생각해보겠습니다. 현재 위치와 미로 지도가 주어지고, 위·아래·왼쪽·오른쪽 중 한 방향을 선택합니다. 한 칸 움직인 뒤에는 새 위치를 보고 다시 방향을 고릅니다. 여기서는 정해진 이동 횟수 안에 목표에 도달하면 성공으로 평가한다고 하겠습니다.

이때 현재 상황을 상태(state), 선택하는 이동을 행동(action)이라고 합니다. 상태를 보고 어떤 행동을 선택할지 정하는 규칙이 정책(policy)입니다. 정책은 “오른쪽으로만 이동한다”처럼 단순할 수도 있고, 지도와 위치를 입력받아 각 방향의 선택 확률을 계산하는 신경망일 수도 있습니다.

정책이 해야 할 일과 평가가 해야 할 일은 다릅니다. 정책은 다음 이동을 고릅니다. 평가는 그 선택들이 목표 달성에 도움이 되었는지를 점수로 나타냅니다. 이 점수를 보상(reward)이라고 부릅니다. 학습은 실제로 선택한 행동들과 받은 보상을 이용해, 앞으로 더 좋은 결과를 얻을 수 있도록 정책을 바꾸는 과정입니다.

LLM에도 같은 역할을 대응시킬 수 있습니다. 아래 그림은 미로 이동과 토큰 생성을 같은 순서로 배치한 것입니다. Nathan Lambert의 RLHF Book에서 설명하는 관점을 참고해 직접 재구성했습니다.

미로에서는 현재 위치와 지도를 보고 이동을 선택해 위치가 바뀐다. LLM에서는 질문과 생성한 토큰을 보고 다음 토큰을 선택해 문맥이 늘어난다. 두 예시 모두 완료한 결과를 평가하고 경험과 보상으로 이후 정책을 학습한다.

그림의 두 예시에는 모두 달라진 상황에서 정책이 다시 행동을 고르는 순환이 있습니다. 행동을 한 번 고르면 다음에 보게 될 상황이 달라지고, 정책은 그 바뀐 상황에서 다시 선택합니다. 완료 후 평가에서 정책으로 이어지는 점선은 그 경험을 이후 학습에 사용한다는 뜻입니다. 매 행동 직후에 반드시 가중치를 갱신한다는 뜻은 아닙니다. RLHF Book — Training Overview

LLM이 선택하는 것은 다음 토큰

LLM에 “2+3은?”이라는 질문을 넣었다고 해보겠습니다. 모델은 입력 문맥을 처리하고, 어휘에 있는 다음 토큰 후보들의 점수를 계산합니다. 점수에서 확률을 구하고 생성 규칙에 따라 토큰 하나를 선택합니다. 여기서는 후보를 확률에 따라 뽑는 생성을 생각하면 됩니다.

임베딩 층에서 LM Head까지에서 살펴본 모델을 강화학습의 관점에서 어떤 문맥에서 어떤 토큰을 고를지 정하는 정책이라고 부르는 것입니다. 기존 LLM이 이 역할을 맡습니다.

첫 토큰을 선택한 뒤의 입력은 원래 질문만이 아닙니다. 방금 선택한 토큰까지 포함한 문맥입니다. 두 번째 토큰을 고른 뒤에는 그 토큰도 문맥에 추가됩니다. 같은 LLM이 늘어난 문맥을 읽으며 선택을 반복합니다.

이 단일 턴 예시에서 상태는 질문과 지금까지 생성한 토큰을 포함한 문맥입니다. 행동은 다음 토큰의 선택이고, 토큰을 문맥에 붙이는 것이 다음 상태로의 변화입니다. 미로에서는 위치가 바뀌었다면, 여기서는 다음 선택의 입력이 되는 토큰 이력이 바뀝니다.

논문이나 설명 그림에 따라서는 응답 전체를 하나의 행동으로 묶기도 합니다. 질문 하나를 받아 응답 하나를 내고 평가받는 바깥 과정을 요약한 것입니다. 이 연재는 나중에 토큰별 확률과 학습 신호를 설명해야 하므로, 그 응답을 만드는 내부 선택까지 펼쳐 보겠습니다.

여러 토큰으로 만든 응답에 보상 붙이기

이제 같은 과정을 시간 순서대로 따라가겠습니다. 그림의 x₁과 x₂는 첫 번째와 두 번째로 선택한 토큰을 뜻하는 기호입니다. “2+3=5”라는 문자열이 특정 토크나이저에서 어떻게 나뉘는지를 표시한 것은 아닙니다.

같은 LLM이 질문에서 x1을 선택하고, 질문에 x1을 붙인 문맥에서 x2를 선택한다. 선택이 반복되어 응답 2+3=5를 완성한다. 정답 검증을 거친 응답에 보상 +1을 한 번 부여한다.

먼저 질문을 보고 x₁을 선택합니다. 다음에는 질문과 x₁을 함께 보고 x₂를 선택합니다. 이 과정을 반복하다가 응답이 끝나면, 완성된 내용을 평가 함수에 전달합니다. 여기서는 최종 답이 5인지 검증하고 맞으면 +1을 주는 간단한 규칙을 사용했습니다.

+1은 완성된 응답에 붙은 점수입니다. 모든 토큰에 각각 독립적인 +1을 받았다는 뜻도, 각 토큰이 정답에 얼마나 기여했는지 알아냈다는 뜻도 아닙니다. 같은 정답을 만드는 표현은 여러 가지일 수 있고, 길게 생성한 응답 안에는 도움이 된 선택과 불필요한 선택이 함께 있을 수도 있습니다.

따라서 응답의 평가 결과를 얻는 것과, 그 결과로 각각의 생성 선택을 어떻게 학습할지 정하는 것은 별도의 단계입니다. 이 구분이 다음 글에서 다룰 어드밴티지와 손실의 출발점입니다.

좋은 응답을 판단하는 방법

“2+3은?”처럼 답을 확인할 수 있는 문제에서는 정답과 비교하는 규칙을 사용할 수 있습니다. 코드 작성 문제라면 코드를 실행하고 정해진 테스트를 통과했는지 확인할 수 있습니다. 이런 검증 가능한 결과를 보상으로 사용하는 접근을 RLVR(Reinforcement Learning with Verifiable Rewards)이라고 부릅니다. 실제 사례로 DeepSeek-R1-Zero는 수학 답의 정확도와 코드 실행 결과 등을 확인하는 규칙 기반 보상을 사용했습니다. DeepSeek-R1 §2.2.2

설명이 더 친절한지, 요청을 더 잘 따르는지처럼 정답 하나로 판단하기 어려운 기준도 있습니다. 이때는 사람들이 여러 응답을 비교한 데이터를 이용해 선호를 예측하는 보상 모델(reward model)을 학습하고, 그 모델의 점수를 사용할 수 있습니다. InstructGPT는 이런 보상 모델로 언어 모델이 생성한 응답을 평가하고 정책을 학습했습니다. InstructGPT

둘 다 그림에서는 완성된 응답을 평가하는 위치에 들어갑니다. 보상 모델과 정답 검증기를 반드시 함께 실행해야 하는 것은 아닙니다. 어떤 행동을 더 자주 하도록 학습할 것인지에 맞춰 평가 방법을 정합니다. 그림에서도 토큰을 붙여 문맥을 바꾸는 과정과, 완성된 응답에 점수를 매기는 과정을 구별해 표시했습니다.

생성한 경험으로 다음 선택을 바꾸기

응답을 만드는 동안에는 토큰을 순서대로 선택합니다. 학습 단계에서는 이렇게 만든 경험과 점수를 모아, 그때의 선택이 앞으로 어느 정도의 확률로 나오도록 할지 모델의 가중치를 조정합니다. 이번 글의 예에서는 응답을 생성하는 동안 같은 가중치를 사용하고, 생성과 평가 뒤에 정책을 갱신한다고 보면 됩니다.

실제 LLM RL은 보통 이미 언어를 생성할 수 있는 사전학습 모델이나 지도 미세조정(SFT)을 거친 모델에서 출발합니다. 갖고 있는 생성 능력이 과제의 평가 기준에 더 잘 맞도록 선택을 조정하는 것입니다.

이 글은 단일 턴 응답을 완료한 뒤 한 번 평가하는 경우를 사용했습니다. 다른 강화학습 과제에서도 마지막에만 보상을 줄 수 있고, LLM에서도 중간 보상이나 도구 호출·멀티턴 상호작용을 사용할 수 있습니다. 어느 경우든 현재 상황에서 행동을 선택하고, 그 경험을 학습에 사용한다는 연결을 먼저 찾으면 됩니다.

다음 글에서는 이 연결의 학습 쪽을 펼쳐봅니다. 응답의 점수에서 어드밴티지를 구하고, 선택한 토큰의 현재 확률과 결합해 가중치를 갱신하는 과정을 하나씩 살펴보겠습니다.

용어: SFT도 넓은 의미의 post-training에 포함됩니다. 이 사이트에서는 지도학습과 RL의 원리를 단계적으로 설명하기 위해 학습과 RL 연재로 나누어 다룹니다.

목차로 돌아가기 ↑