컴백부터 K-뷰티까지 — K-컬쳐의 모든 것을 메일로 받아보세요메일로 받아보기

METAL MEDIA

정답 채점 강화학습과 선생님 모방 학습을 그냥 더하면 AI가 모험을 멈춘다 - SAF는 그 폭주하는 신호를 다듬어 더 나은 결과를 낸다

arXiv:2607.292092026-07-30

SAF-OPD: Stable Advantage Fusion for On-Policy Distillation

정답 채점 강화학습과 선생님 모방 학습을 그냥 더하면 AI가 모험을 멈춘다 - SAF는 그 폭주하는 신호를 다듬어 더 나은 결과를 낸다

언어모델을 훈련시킬 때 정답 여부로 점수를 주는 방식(RLVR)과 더 강한 선생님 모델을 따라하게 하는 방식(OPD)을 단순히 더해서 섞으면 훈련 초반에 모델이 다양한 시도를 멈추고 획일화되는 문제(엔트로피 붕괴)가 생긴다. 저자는 이 원인을 두 가지 불일치, 즉 신호 크기가 안 맞는 문제와 시간이 지나도 강도가 안 줄어드는 문제로 진단하고, 각각을 다루는 4단계 파이프라인 SAF를 제안한다. Qwen3 모델들로 수학과 코드 생성 문제에서 실험한 결과 고정 비율로 섞는 방식보다 꾸준히 더 나은 성능을 보였다.

METAL MEDIA 해설 도표

SAF의 4단계 파이프라인

증거 상태측정 결과가 보고됨

  1. 입력: 두 종류의 점수응답 전체에 하나의 값을 주는 검증 기반 점수(GRPO)와 토큰마다 선생님과 비교해 계산되는 점수(OPD)가 함께 들어온다
  2. 1~2단계: 크기 조절OPD 점수 중 상위 일부만 남기고 나머지는 0으로 만든 뒤, tanh 함수로 값의 범위를 제한해 소수 토큰이 학습을 지배하지 못하게 한다
  3. 3~4단계: 시간 조절학습 초반에는 학생-선생님 KL 발산 감소를 지켜보며 OPD 세기를 점점 올리다가, 목표 감소량에 도달하면 이후 점진적으로 세기를 낮춘다
  4. 합산 및 정책 업데이트조정된 OPD 점수를 원래의 GRPO 점수에 더해 최종 점수를 만들고, 이를 이용해 정책을 업데이트한다
METAL MEDIA이 원문을 바탕으로 재구성한 해설 도표이며, 논문 저자의 원문 figure가 아닙니다.

무엇을 했나

  1. 문제 제기: 정답 채점 기반 강화학습(RLVR)은 응답 전체에 하나의 점수만 주고, 선생님 모델 모방 학습(OPD)은 토큰 하나하나에 점수를 주지만 선생님 실력 이상으로는 못 간다는 한계가 있어 둘을 섞으면 좋을 것 같지만, 고정된 비율로 단순히 더하면 학습 초반에 모델이 다양성을 잃는 현상(엔트로피 붕괴)이 나타났다.
  2. 원인 진단: 이 현상은 두 가지 어긋남 때문이다. 하나는 크기 불일치로, OPD 점수가 이따금 RLVR 점수보다 훨씬 크게 튀어서 RLVR 신호를 지워버리는 것이고, 다른 하나는 시간 불일치로, 선생님을 따라가는 신호가 계속 강하게 유지되어 학생 모델이 선생님을 넘어서는 탐색을 못하게 막는 것이다.
  3. 해결 방법: SAF는 OPD 점수에만 적용하는 4단계 처리(상위 몇 퍼센트만 남기고 나머지는 0으로 만드는 희소화, tanh 함수로 범위를 눌러 압축, 학습 초반에는 KL 발산 감소를 보며 점진적으로 세기를 올리는 예열, 이후 점진적으로 세기를 낮추는 감쇄)를 거쳐 원래의 RLVR 신호에 더하며, 각 단계는 독립적으로 켜고 끌 수 있다.
  4. 실험: Qwen3-1.7B, 4B, 8B 모델로 수학 추론과 코드 생성 총 7개 벤치마크에서 실험한 결과, SAF는 고정 비율로 섞은 방식보다 여섯 개의 모델-분야 조합 전체에서 평균 점수를 0.51~2.70%포인트 더 높였고, 학습 중 다양성 붕괴 없이 더 안정적으로 훈련되었다.
  5. 구조 분석: 학습 과정을 들여다보니 고정 비율 방식은 학생이 선생님을 가장 가깝게 따라가면서도(가장 낮은 KL 발산) 정작 최종 정확도는 가장 낮았고, SAF는 중간 수준의 다양성과 KL 발산을 유지하면서 더 높은 정확도로 끝났다.
Figure 1: Fixed-coefficient fusion versus SAF. SAF pairs the OPD advantage’s magnitude and temporal mismatches with dedicated control mechanisms, avoiding entropy collapse, preserving exploration, and improving final performance.
Figure 1: Fixed-coefficient fusion versus SAF. SAF pairs the OPD advantage’s magnitude and temporal mismatches with dedicated control mechanisms, avoiding entropy collapse, preserving exploration, and improving final performance.
Table 1: Results on mathematical reasoning and code generation. All entries are accuracies (%). Within each model scale and column, the best result is bold and the second best is underlined.
Mathematical ReasoningCode Generation
MethodAIME-24AIME-25HMMT25-FebHMMT25-NovAvg.HumanEval+MBPP+LiveCodeBenchAvg.
Teacher: Qwen3-30B-A3B-Instruct-250773.6561.9843.8557.8159.3282.9378.3145.0068.75
Student: Qwen3-8B
Base26.5621.2511.359.7917.2480.4972.4923.7158.90
GRPO-only61.1549.0628.6537.5044.0981.1072.2228.8560.72
OPD-only59.5850.5227.6040.7344.6184.1571.9633.2963.13
GRPO+OPD (fixed)60.8351.2528.4443.3345.9678.6671.6934.8661.74
SAF (ours)64.7951.2530.0041.6746.9381.1071.6937.4363.41
Student: Qwen3-4B
Base23.0221.8811.679.1716.4479.2763.4924.5755.78
GRPO-only58.9650.6230.1037.6044.3280.4968.7832.1460.47
OPD-only57.8151.5629.3837.7144.1278.6669.3130.7159.56
GRPO+OPD (fixed)57.1951.9829.9038.4444.3879.8866.1433.8659.96
SAF (ours)60.2153.9631.1538.2345.8982.9370.6334.4362.66
Student: Qwen3-1.7B
Base12.8110.835.943.548.2860.9854.2315.1443.45
GRPO-only36.2531.3517.1916.8825.4265.2453.7017.5745.50
OPD-only35.1028.5415.8316.3523.9670.7358.7325.8651.77
GRPO+OPD (fixed)34.7929.6917.5016.5624.6470.1256.0826.4350.88
SAF (ours)36.6731.9818.0219.2726.4970.7357.1426.2951.39
Figure 2: Overview of SAF. SAF modifies only the OPD branch through four stages before it is added to the unchanged GRPO advantage for the policy-gradient update.
Figure 2: Overview of SAF. SAF modifies only the OPD branch through four stages before it is added to the unchanged GRPO advantage for the policy-gradient update.
Table 2: Representative SAF ablations on Qwen3-4B mathematical reasoning after 300 training steps.
ConfigurationAIME-24AIME-25HMMT25-FebHMMT25-NovAvg.
GRPO+OPD (fixed)57.1951.9829.9038.4444.38
+ top-k and tanh (fixed weight)58.7550.9430.1037.6044.35
+ warm-up (no annealing)58.9651.4629.6936.1544.07
+ annealing59.2752.6031.2537.8145.23
SAF (δ=0.2, selected)60.2153.9631.1538.2345.89
SAF (δ=0.3)58.7552.8129.3837.0844.51
Figure 3: Empirical distribution of the absolute token-level OPD advantages, |Ai,tOPD|, collected during the first 10 training steps of Qwen3-4B on mathematical reasoning tasks.
Figure 3: Empirical distribution of the absolute token-level OPD advantages, |Ai,tOPD|, collected during the first 10 training steps of Qwen3-4B on mathematical reasoning tasks.
Table 3: Training hyperparameters of the GRPO-based methods: GRPO-only, GRPO+OPD (fixed), and SAF.
HyperparameterMathematicsCode
Train batch size128128
Micro batch size128128
Responses per prompt (G)88
Maximum prompt length2,0482,048
Maximum response length16,3848,192
Rollout temperature1.01.0
Rollout top-p1.01.0
Actor learning rate1×10−61×10−6
Optimization steps300200
Actor KL-loss coefficient0.00.0
Figure 4: Training dynamics of Qwen3-4B on mathematical reasoning tasks over 300 optimization steps: (a) actor entropy, (b) student–teacher KL divergence, (c) mean critic score, (d) mean response length, (e) AIME-24 accuracy, and (f) AIME-25 accuracy. Curves compare GRPO, OPD, fixed-coefficient GRPO+OPD, and SAF under the same task setting.
Figure 4: Training dynamics of Qwen3-4B on mathematical reasoning tasks over 300 optimization steps: (a) actor entropy, (b) student–teacher KL divergence, (c) mean critic score, (d) mean response length, (e) AIME-24 accuracy, and (f) AIME-25 accuracy. Curves compare GRPO, OPD, fixed-coefficient GRPO+OPD, and SAF under the same task setting.
Table 4: Training hyperparameters of OPD-only for mathematical reasoning and code generation.
HyperparameterMathematicsCode
Batch size1,0241,024
Responses per prompt11
Maximum prompt length2,0482,048
Maximum response length16,3848,192
Rollout temperature1.01.0
Rollout top-p1.01.0
Learning rate1×10−61×10−6
Optimization steps10050
Figure 5: Supplementary parameter-space update geometry for the GRPO-only and OPD-only checkpoints of Qwen3-4B on mathematical reasoning: (a) mean stable rank of the update matrices, (b) output (left-singular) subspace overlap, and (c) input (right-singular) subspace overlap between the two methods.
Figure 5: Supplementary parameter-space update geometry for the GRPO-only and OPD-only checkpoints of Qwen3-4B on mathematical reasoning: (a) mean stable rank of the update matrices, (b) output (left-singular) subspace overlap, and (c) input (right-singular) subspace overlap between the two methods.
Table 5: Method-specific hyperparameters for the selected SAF configuration.
HyperparameterValue
Per-response retention ratio k20%
tanh compression coefficient c0.1
Maximum warm-up steps Swarmup100
Relative KL-drop threshold δ0.2
Initial OPD coefficient1.0
Annealing floor cmin0.0
Annealing durationRemaining training steps
Figure 6: Layer-wise L2 weight drift ‖Δ​Wℓ(t)‖2 over transformer layers (x-axis) and optimization steps (y-axis) for the four training regimes of Qwen3-4B on mathematical reasoning: (a) GRPO-only, (b) OPD-only, (c) fixed-coefficient GRPO+OPD, and (d) SAF.
Figure 6: Layer-wise L2 weight drift ‖Δ​Wℓ(t)‖2 over transformer layers (x-axis) and optimization steps (y-axis) for the four training regimes of Qwen3-4B on mathematical reasoning: (a) GRPO-only, (b) OPD-only, (c) fixed-coefficient GRPO+OPD, and (d) SAF.

실제로 확인된 결과

  • Qwen3-8B/4B/1.7B에 대해 수학·코드 총 7개 벤치마크에서 SAF는 고정 비율 융합(GRPO+OPD fixed) 대비 수학은 각각 0.97%, 1.51%, 1.85%, 코드는 각각 1.67%, 2.70%, 0.51% 향상되었고 여섯 모델-분야 조합 평균으로는 49.46%를 기록해 고정 융합, GRPO 단독, OPD 단독 대비 각각 1.54%, 2.71%, 1.60% 높았다.
  • Qwen3-4B 수학 추론에서 300 스텝 기준 절제 실험 결과, 크기 조절만 적용한 경우 44.35%로 고정 융합(44.38%)과 비슷했고, 예열만 추가한 경우 44.07%, 감쇄까지 켠 경우 45.23%, 임계값 δ=0.2인 완전한 SAF 구성은 45.89%였다.
  • 학습 초반 10스텝 동안 관찰한 OPD 점수 절대값은 대부분 0에 가깝게 몰려 있었고, 조사한 180개의 최대 크기 토큰 전부가 해당 응답의 GRPO 점수 절대값(최대 2.4749)보다 큰 값(최대 20.3585)을 보여 고정 1:1 융합에서 소수 토큰이 업데이트를 지배할 수 있음을 확인했다.
  • 300 스텝 학습 동역상, 고정 융합은 엔트로피를 약 0.35에서 0.30까지 빠르게 낮추고 학생-선생님 KL을 네 방식 중 가장 낮게 유지했지만 정확도는 AIME-24 약 0.57, AIME-25 약 0.51로 가장 낮게 마무리됐고, SAF는 엔트로피 약 0.35~0.38, 더 높은 정확도(AIME-24 약 0.59, AIME-25 약 0.53)로 끝났다.
  • 레이어별 가중치 변화량 분석에서 고정 융합이 300스텝 시점에 절대 변화량 최대치(약 0.03)로 가장 크게 나타났고 SAF는 이보다 작은 변화(약 0.04)를 보이면서도 GRPO 단독보다는 큰 변화를 보여, SAF가 과도한 파라미터 이동을 억제하되 완전히 없애지는 않음을 시사했다.
Figure 7: Layer-wise relative weight drift ‖Δ​Wℓ(t)‖2/(‖Wℓ0‖2+ϵ) over transformer layers (x-axis) and optimization steps (y-axis) for the same four training regimes and checkpoints as Figure 6: (a) GRPO-only, (b) OPD-only, (c) fixed-coefficient GRPO+OPD, and (d) SAF.
Figure 7: Layer-wise relative weight drift ‖Δ​Wℓ(t)‖2/(‖Wℓ0‖2+ϵ) over transformer layers (x-axis) and optimization steps (y-axis) for the same four training regimes and checkpoints as Figure 6: (a) GRPO-only, (b) OPD-only, (c) fixed-coefficient GRPO+OPD, and (d) SAF.

어디에 쓸 수 있나

  • 정답 검증 보상과 더 강한 교사 모델의 토큰 단위 점수를 함께 쓰는 언어모델 후속 학습 파이프라인에서 두 신호를 섞는 방식을 설계할 때 참고할 수 있다.
  • 훈련 중 정책 엔트로피가 급격히 떨어지거나 학생-선생님 KL이 지나치게 빨리 좁아지는 증상을 진단하는 지표로 활용할 수 있다.
  • 기존 GRPO+OPD 훈련 루프에 추가 모델이나 손실 함수 없이 대체 가능한 경량 모듈로 적용을 검토할 수 있다.

한계와 남은 검증

  • 실험은 Qwen3-1.7B/4B/8B 모델과 Qwen3-30B-A3B-Instruct-2507 교사 모델, 수학 및 코드 생성 총 7개 벤치마크에 한정되어 다른 모델 계열이나 과제로의 일반화는 확인되지 않았다.
  • SAF가 모든 벤치마크에서 최고 성능을 낸 것은 아니며, 예를 들어 Qwen3-8B의 MBPP+와 Qwen3-1.7B의 코드 평균 일부 항목에서는 GRPO 단독이나 OPD 단독이 더 높았다.
  • 레이어별 가중치 변화량 및 업데이트 행렬 기하 분석은 저자 스스로 보완적·탐색적 관찰로 규정했으며 SAF 설계의 근거가 된 메커니즘은 아니라고 밝혔다.
  • 임계값 δ, 상위 비율 k, 압축 계수 c 등 하이퍼파라미터 선택이 성능에 영향을 주는 것으로 나타났으며(δ=0.3에서 성능 하락), 이 값들의 최적 범위나 다른 과제·모델에 대한 민감도는 충분히 탐구되지 않았다.

왜 중요한가

정답 검증 신호와 더 강한 모델의 모방 신호를 함께 쓰는 훈련 방식이 늘어나는 가운데, 이 연구는 둘을 아무렇게나 더하면 왜 실패하는지 원인을 짚어주고 저비용으로 적용 가능한 교정 장치를 제시한다. 언어모델 후속 학습(post-training) 파이프라인을 설계하는 실무자에게 두 신호를 섞을 때 생기는 함정과 그 대응법을 구체적으로 보여준다.

이 논문의 용어

  • RLVR (검증 가능한 보상을 이용한 강화학습) · 정답 여부처럼 규칙으로 확인 가능한 채점 결과를 응답 전체에 하나의 점수로 주는 강화학습 방식
  • OPD (온폴리시 증류) · 학생 모델이 직접 생성한 응답에 대해 더 강한 선생님 모델의 확률과 비교해 토큰 단위로 점수를 매기는 학습 방식
  • 엔트로피 붕괴 · 모델이 다양한 답변 경로를 시도하지 못하고 비슷한 답만 내놓게 되는 훈련 실패 현상
  • GRPO · 같은 문제에 대해 여러 응답을 샘플링해 그룹 내 상대 점수로 정규화하는 대표적인 RLVR 알고리즘
  • KL 발산 · 두 확률분포(여기서는 학생과 선생님 모델의 다음 토큰 예측 분포)가 얼마나 다른지를 재는 지표

저자 · Yifan Ding

arXiv에서 원문 보기

최신 논문

논문 전체 보기 →

METAL MEDIA 최신 기사

그림 출처: Yifan Ding et al., arXiv:2607.29209, CC BY 4.0