← 학습 경로

RL · 2026-09-27

RL과 OPD를 조합하는 학습 전략

DeepSeek V4의 전문 모델 학습과 OPD 통합에서 출발해, RL의 출발 정책을 준비하는 역할과 MiMo MOPD²의 교사·문맥 선택을 살펴봅니다.

앞 글에서는 학생이 만든 문맥에서 교사의 확률을 읽어 학생을 업데이트했습니다. 이제 이 학습을 전체 모델 개발 과정의 어디에 배치할지 보겠습니다. 보상으로 전문 능력을 발전시킨 모델들을 교사로 삼을 수도 있고, 교사에게 먼저 배운 학생을 다시 RL로 개선할 수도 있습니다.

이번 글의 중심 사례는 DeepSeek V4의 분야별 전문화와 OPD를 통한 능력 통합입니다. 그 구조를 먼저 보고, 사전학습과 SFT가 RL의 출발점을 준비한다는 관점으로 돌아가겠습니다. 이어서 OPD를 RL 앞에 놓는 연구와, 교사뿐 아니라 학생이 생성할 시작 문맥까지 고르는 MiMo MOPD²를 살펴보겠습니다. 학습 순서를 외우기보다 각 단계에서 어떤 모델이 무엇을 배우는지 따라가는 것이 목적입니다.

전문 능력을 키우고 하나의 학생에 통합하기

DeepSeek V4의 흐름을 사전학습 → SFT → RL → OPD라고 줄일 수는 있습니다. 다만 이 표기만 보면 모델 하나가 끝까지 같은 경로를 지나는 것처럼 읽힙니다. 보고서의 핵심은 여러 전문 모델로 갈라졌다가, 교사의 정보를 이용한 학생 학습으로 능력을 통합한다는 데 있습니다.

사전학습 기반 모델에서 분야별 모델을 준비하고, 각 분야의 SFT와 GRPO 학습을 수행합니다. 이렇게 얻은 전문 교사들의 분포를 이용해 하나의 학생을 OPD로 학습합니다. 보고서는 분야들을 섞어 수행하던 mixed RL 단계를 이 통합 방식으로 대체했다고 설명합니다. RL 자체가 사라진 것은 아닙니다. DeepSeek V4 §5.1

사전학습 모델에서 분야별 SFT와 RL로 전문 교사를 준비한다. 전문 교사들은 학생 문맥의 확률 정보를 제공하고 OPD가 하나의 학생을 학습한다. 실선은 모델 학습 진행이고 점선은 교사 정보 전달이다.

그림에서 파란 실선을 따라가면 모델이 학습되는 과정을 볼 수 있습니다. 보라 점선은 학습된 교사가 학생에게 확률 정보를 제공하는 연결입니다. 교사 A의 가중치와 교사 B의 가중치를 평균내서 새 모델을 만드는 연산이 아닙니다. 학생은 자기 응답을 만들고, 그 문맥의 교사 분포를 학습 목표로 삼아 자기 가중치를 갱신합니다.

Multi-teacher OPD(MOPD)는 여러 교사를 활용하는 OPD라는 뜻으로 읽으면 됩니다. 분야별로 잘하는 교사에게 배운다는 큰 구조와, 한 샘플에 어떤 교사를 붙이고 각 손실을 얼마나 반영할지는 구별해야 합니다. 이름만으로 모든 질문을 모든 교사에게 동시에 평가시킨다고 판단할 수는 없습니다.

DeepSeek V4는 이 단계에서 전체 어휘의 logits를 이용하는 증류를 사용합니다. 4편의 Miles 예시처럼 실제 선택된 토큰 하나의 로그비를 어드밴티지에 더하는 구현과 같지는 않습니다. 학생 문맥에서 교사의 분포를 배운다는 목적은 이어지지만, 손실을 계산하는 방법은 달라질 수 있습니다. DeepSeek V4 §5.1.2

RL이 배울 수 있는 출발점 만들기

왜 그 앞에 사전학습과 SFT가 있을까요? 2편의 업데이트는 이미 생성한 토큰의 확률을 조절합니다. 따라서 어떤 응답을 생성할 수 있는지가, 이번에 어떤 피드백으로 배울 수 있는지를 결정합니다.

한 문제에 여덟 번 답할 예산이 있다고 해보겠습니다. 정답이면 보상 1, 오답이면 0입니다. 어떤 출발 정책에서는 이번 여덟 응답이 전부 틀릴 수 있습니다. 다른 출발 정책에서는 성공과 실패가 섞일 수 있습니다. 두 경우 모두 여덟 번 생성했지만, 기본 GRPO가 그룹 안에서 비교할 보상 차이는 다릅니다.

같은 질문에 여덟 응답을 생성한다. 모두 보상 0이면 기본 GRPO의 그룹 상대 신호가 0이다. 보상 0과 1이 섞이면 평균을 기준으로 성공과 실패의 생성 확률을 다르게 조절할 신호가 생긴다. 가상 표본이며 측정 결과가 아니다.

왼쪽에서는 모든 보상에서 그룹 평균 0을 빼도 0입니다. 오른쪽에서는 평균 3/8보다 성공 응답의 보상이 높고 실패 응답의 보상이 낮습니다. 3편의 상대 비교가 작동할 재료가 생긴 것입니다. 전부 성공한 그룹 역시 이 기본 상대 보상 항에는 차이를 주지 않습니다. 별도로 넣은 교사 신호나 KL 항까지 사라진다는 뜻은 아닙니다.

Daniel Han은 영상에서 좋은 답을 생성할 가능성과 SFT·사전학습의 준비 역할을 연결해 설명합니다. 이 직관은 유한한 생성 예산 안에서 유용한 피드백을 받을 경험을 만들 수 있는가라는 질문으로 읽으면 도움이 됩니다. 그림은 그 관점을 설명하기 위한 가상 예시이며, 특정 학습 전후의 측정값은 아닙니다. 영상 2:05:26–2:06:29

사전학습은 언어와 지식, 여러 생성 패턴을 형성합니다. SFT는 시범을 통해 과제의 형식과 행동 패턴을 익히게 할 수 있습니다. 예를 들어 도구 호출 형식을 몰라 매번 실행에 실패한다면, 먼저 그 형식을 익히는 것이 이후 과제 보상을 얻을 기회를 바꿉니다. 이는 PT·SFT를 RL과 연결해 보는 한 관점이지, 두 학습의 목적이 RL 준비에만 있다는 뜻은 아닙니다. 모든 RL에 별도 SFT가 반드시 필요한 것도 아닙니다.

이 관점에서 RL은 시도한 결과의 보상으로 정책을 개선하는 과정, OPD는 교사의 행동 분포를 이용해 학생을 개선하는 과정입니다. “RL로 해결 방법을 탐색하고, OPD로 그 능력을 배운다”는 직관은 전문화·통합 경로를 이해하는 데 유용합니다. 다만 OPD도 학생이 직접 생성하며, RL도 이미 할 수 있는 행동을 더 안정적으로 만드는 데 쓰이므로 두 방법을 탐색과 복사로만 나눌 수는 없습니다.

OPD를 RL 앞에 놓을 수도 있다

앞의 경로에서 OPD의 목적은 교사의 능력 전달과 통합이었습니다. 학생이 이후에도 과제 보상으로 학습할 예정이라면 다른 순서를 고려할 수 있습니다. 교사에게 배운 학생을 RL의 출발점으로 사용하는 것입니다.

한 경로는 교사의 RL 이후 학생 OPD로 능력을 전달하고 학생을 평가한다. 다른 경로는 학생이 먼저 OPD를 수행한 뒤 같은 학생을 과제 보상으로 RL 학습한다. 두 경로에서 RL을 받는 모델이 다르다.

RL Starts before RL은 동일한 후속 RL 설정에서 OPD로 준비한 학생이 직접 RL을 하거나 SFT 후 RL을 하는 비교군보다 높은 최종 성능을 얻은 실험을 보고합니다. 이 결과를 모든 모델·과제에 보장되는 순서로 받아들이기보다, 증류의 가치를 후속 학습까지 포함해 평가해야 한다는 근거로 읽겠습니다.

논문의 결과를 단순히 “OPD가 시작 정확도를 올렸기 때문”으로 설명할 수도 없습니다. OPD 직후 정확도 개선이 작아도 후속 RL에서 이득이 나타났고, RL 전 Pass@k만으로도 그 차이가 모두 설명되지 않았습니다. 저자들은 가장 확률이 높은 답 하나의 일치를 넘어 교사의 분포에 맞추는 효과를 가능한 설명으로 제시합니다. 인과 기제가 확정되었다는 뜻은 아닙니다.

따라서 OPD의 준비 효과는 후속 RL까지 마친 뒤에 평가해야 합니다. 준비 단계 직후 가장 높은 점수를 주는 선택과, 이후 RL까지 끝났을 때 가장 좋은 선택이 같을 필요는 없습니다. 실제 비교에서는 같은 출발 모델과 후속 RL 조건을 맞추고, 준비 단계에 쓴 데이터·교사 계산·시간도 총비용에 포함해야 합니다.

여러 교사와 여러 시작 문맥에서 배우기

MiMo V2.6은 mixed RL 이후 능력을 넓히는 단계에 Multi-Prefix Multi-Teacher On-Policy Distillation(MOPD²)를 사용합니다. 여러 교사를 활용하는 데 더해, 학생이 어떤 이전 대화에서 생성을 시작할지도 설계합니다. 검증 가능한 과제에는 mixRL 교사를, 신뢰할 만한 보상을 만들기 어려운 개방형 과제에는 고품질 합성 시범으로 학습한 SFT 교사를 활용합니다. MiMo V2.6 §5.6

MiMo MOPD²는 질문부터 학생이 전체 rollout을 생성하는 경로와 P와 원본 2턴인 h1에서 새 3턴 y1을, P와 원본 3턴인 h2에서 새 4턴 y2를 독립적으로 생성하는 경로를 사용한다. 각 경로의 지정 교사는 학생과 같은 문맥을 조건으로 확률 정보를 주고 학생이 업데이트된다.

왼쪽은 앞 글에서 익숙해진 경로입니다. 학생이 질문에서 시작해 전체 rollout을 만들고 적합한 교사가 지도합니다. 오른쪽에서는 교사의 rollout이나 SFT 데이터에서 이전 대화를 가져옵니다. assistant 턴이 시작되기 직전마다 그때까지의 전체 이력을 하나의 prefix로 준비합니다.

그림에서는 이전 대화를 턴 블록으로 묶었습니다. 회색 원본 턴 하나에는 assistant의 응답과 그 뒤에 이어진 사용자 입력이나 도구 관측을 포함합니다. 따라서 각 이력은 다음 assistant 응답 직전에서 끝납니다. h₁은 P와 원본 12턴을 포함하며, 여기서 학생이 새 3턴 y₁을 생성합니다. h₂는 P와 원본 13턴을 포함하며, 여기서는 새 4턴 y₂를 생성합니다. 파란 블록은 학생이 새로 생성하는 assistant 응답입니다.

h₂의 원본 3턴은 학생이 새로 만든 y₁이 아닙니다. 두 행은 준비된 원본 이력에서 가져온 독립된 시작점입니다. 학생이 처음부터 전체 대화를 생성하지 않아도 서로 다른 단계의 문맥에서 다음 한 턴을 연습할 수 있습니다.

지정된 교사는 같은 hᵢ + 이번 턴에서 학생이 이미 생성한 토큰을 보고 지도합니다. SFT 데이터의 원래 다음 답을 정답으로 고정해 따라 쓰게 하는 경로와 다릅니다. 시작 문맥은 외부에서 가져오지만, 이번에 학습할 새 continuation은 학생이 생성합니다. 보고서는 이 방식이 긴 실행에서 학생이 여러 번 벗어난 이력에 대한 SFT 교사의 제한된 학습 범위를 보완한다고 설명합니다. MiMo V2.6 §5.6, Figure 13

학습 전략을 실행 시스템으로 옮기기

이제 OPD의 위치, 교사의 종류, 학생이 생성할 시작 문맥을 따로 볼 수 있습니다. DeepSeek 사례에서는 전문 교사의 능력을 통합하고, OPD→RL 경로에서는 학생의 후속 학습을 준비하며, MiMo 사례에서는 여러 분야와 대화 시작점으로 학습 경험을 넓힙니다. 이 선택들이 정해져야 어떤 생성과 평가, 업데이트를 반복해야 하는지도 구체적이 됩니다.

실제 실행에는 학생 응답 생성, 과제 채점이나 교사 확률 계산, 학생 역전파, 갱신된 가중치 전달이 필요합니다. 긴 에이전트 과제라면 도구와 환경 실행도 들어갑니다. 다음 글에서는 이 작업들이 추론 엔진과 학습 엔진, 데이터 전달과 weight sync로 어떻게 연결되는지 살펴보겠습니다.

목차로 돌아가기 ↑