AI 에이전트 학습에서 별도 비평가 모델과 여러 번의 시행 없이도 한 번의 시도만으로 더 잘 배우게 만드는 방법
AI 에이전트 학습에서 별도 비평가 모델과 여러 번의 시행 없이도 한 번의 시도만으로 더 잘 배우게 만드는 방법
SAPO는 언어모델 하나로 정책(행동을 고르는 부분)과 가치(그 행동이 얼마나 좋은지 평가하는 부분)를 동시에 뽑아내는 학습 방식이다. 기존 방식들은 같은 과제를 여러 번 시도해 비교하거나 별도의 평가 모델을 따로 두어야 했는데, SAPO는 문장을 생성하는 순서 그 자체를 이용해 한 번의 시도만으로 두 가지를 함께 학습한다. ALFWorld와 WebShop이라는 다단계 과제 환경에서 기존 PPO와 GRPO 방식보다 각각 평균 15.1점, 12.1점 더 높은 성공률을 보였고, 반복당 처리 시간도 PPO보다 33.2% 줄였다.
METAL MEDIA 해설 도표
AI 에이전트 학습에서 별도 비평가 모델과 여러 번의 시행 없이도 한 번의 시도만으로 더 잘 배우게 만드는 방법
- 01기존 그룹 상대 방식(GRPO 등)은 같은 과제를 여러 번 시도해 보상을 비교해야 하는데, 보상이 다 비슷하면 학습 신호가 사라지는 문제와 시도 횟수와 성능 사이의 비용 문제가 있었다
- 02SAPO는 하나의 언어모델이 문장을 만들어가는 순서(앞부분은 상태 요약, 중간은 행동 생성, 끝부분은 그 행동 평가) 안에서 정책과 가치를 동시에 읽어내도록 설계했다
- 03행동 하나마다 발생하는 보상을 뒤에서부터 거슬러 계산하는 방식(람다-리턴)과 배치 단위 정규화를 결합해 각 턴의 기여도를 안정적으로 추정한다
- 04Qwen2.5-1.5B와 7B 모델로 ALFWorld, WebShop에서 실험한 결과 PPO 대비 평균 15.1퍼센트포인트, GRPO 대비 12.1퍼센트포인트 성공률이 올랐고, 별도 비평가 모델의 메모리 비용이 없어졌으며 반복당 실행 시간이 PPO 대비 33.2% 줄었다
무엇을 했나
- 기존 그룹 상대 방식(GRPO 등)은 같은 과제를 여러 번 시도해 보상을 비교해야 하는데, 보상이 다 비슷하면 학습 신호가 사라지는 문제와 시도 횟수와 성능 사이의 비용 문제가 있었다
- SAPO는 하나의 언어모델이 문장을 만들어가는 순서(앞부분은 상태 요약, 중간은 행동 생성, 끝부분은 그 행동 평가) 안에서 정책과 가치를 동시에 읽어내도록 설계했다
- 행동 하나마다 발생하는 보상을 뒤에서부터 거슬러 계산하는 방식(람다-리턴)과 배치 단위 정규화를 결합해 각 턴의 기여도를 안정적으로 추정한다
- Qwen2.5-1.5B와 7B 모델로 ALFWorld, WebShop에서 실험한 결과 PPO 대비 평균 15.1퍼센트포인트, GRPO 대비 12.1퍼센트포인트 성공률이 올랐고, 별도 비평가 모델의 메모리 비용이 없어졌으며 반복당 실행 시간이 PPO 대비 33.2% 줄었다

| Type | Method | ALFWorld | WebShop | |||||||
|---|---|---|---|---|---|---|---|---|---|---|
| Pick | Look | Clean | Heat | Cool | Pick2 | All | Score | Succ. | ||
| Closed-Source Model | ||||||||||
| Prompting | GPT-4o | 75.3 | 60.8 | 31.2 | 56.7 | 21.6 | 49.8 | 48.0 | 31.8 | 23.7 |
| Prompting | Gemini-2.5-Pro | 92.8 | 63.3 | 62.1 | 69.0 | 26.6 | 58.7 | 60.3 | 42.5 | 35.9 |
| Qwen2.5-1.5B-Instruct | ||||||||||
| Prompting | ReAct | 17.4 | 20.5 | 15.7 | 6.2 | 7.7 | 2.0 | 12.8 | 40.1 | 11.3 |
| Prompting | Reflexion | 35.3 | 22.2 | 21.7 | 13.6 | 19.4 | 3.7 | 21.8 | 55.8 | 21.9 |
| RL Training | RLOO | 88.3±3.0 | 52.8±8.6 | 71.0±5.9 | 62.8±8.7 | 66.4±5.5 | 56.9±4.7 | 69.7±2.5 | 73.9±5.6 | 52.1±6.7 |
| RL Training | EMPG | 85.5 | 33.5 | 78.9 | 76.2 | 74.7 | 89.1 | 73.7 | 80.4 | 60.8 |
| RL Training | GiGPOw/ std | 94.4±5.9 | 67.5±4.6 | 94.8±3.8 | 94.4±7.8 | 79.8±4.7 | 76.4±5.4 | 86.7±1.7 | 83.1±1.6 | 65.0±3.2 |
| RL Training | GiGPOw/o std | 96.0±1.4 | 76.5±3.9 | 91.8±5.5 | 91.3±6.3 | 71.7±8.4 | 79.5±7.7 | 86.1±4.7 | 83.5±1.8 | 67.4±4.5 |
| RL Training | PPO (with critic) | 64.8±3.5 | 40.5±6.9 | 57.1±4.9 | 60.6±6.6 | 46.4±4.0 | 47.4±1.9 | 54.4±3.1 | 73.8±3.0 | 51.5±2.9 |
| RL Training | GRPO | 85.3±1.5 | 53.7±8.0 | 84.5±6.8 | 78.2±7.9 | 59.7±5.0 | 53.5±5.6 | 72.8±3.6 | 75.8±3.5 | 56.8±3.8 |
| RL Training | SAPO | 92.0±2.9 | 76.9±6.3 | 100.0±0.0 | 100.0±0.0 | 82.8±4.7 | 82.4±5.0 | 90.1±2.3 | 82.21.4 | 63.71.6 |
| Qwen2.5-7B-Instruct | ||||||||||
| Prompting | ReAct | 48.5 | 35.4 | 34.3 | 13.2 | 18.2 | 17.6 | 31.2 | 46.2 | 19.5 |
| Prompting | Reflexion | 62.0 | 41.6 | 44.9 | 30.9 | 36.3 | 23.8 | 42.7 | 58.1 | 28.8 |
| RL Training | RLOO | 87.6±4.3 | 78.2±8.3 | 87.3±5.8 | 81.3±7.6 | 71.9±5.2 | 48.9±8.4 | 75.5±4.6 | 80.3±3.2 | 65.7±4.0 |
| RL Training | EMPG | 92.9 | 75.2 | 74.8 | 86.3 | 73.7 | 65.3 | 78.5 | 81.0 | 69.3 |
| RL Training | GiGPOw/ std | 97.7±1.6 | 82.7±7.9 | 98.8±1.6 | 83.7±7.2 | 89.3±8.2 | 79.2±6.6 | 90.8±1.3 | 84.4±2.9 | 72.8±3.2 |
| RL Training | GiGPOw/o std | 91.8±5.4 | 88.6±6.3 | 95.9±3.2 | 90.2±2.6 | 86.5±5.5 | 85.2±7.5 | 90.2±2.3 | 86.2±2.6 | 75.2±3.8 |
| RL Training | PPO (with critic) | 92.3±4.0 | 64.0±8.4 | 92.5±2.4 | 89.5±7.0 | 80.3±2.0 | 68.8±8.3 | 80.4±2.7 | 81.4±3.1 | 68.7±5.1 |
| RL Training | GRPO | 90.8±5.1 | 66.1±6.7 | 89.3±5.4 | 74.7±6.9 | 72.5±5.4 | 64.7±7.3 | 77.6±5.2 | 79.3±2.8 | 66.1±3.7 |
| RL Training | SAPO | 99.0±1.4 | 82.3±2.1 | 100.0±0.0 | 97.9±4.7 | 79.7±3.9 | 91.7±1.6 | 94.0±1.7 | 88.6±1.8 | 82.4±2.0 |
왜 중요한가
여러 단계를 거쳐 문제를 해결해야 하는 AI 에이전트를 훈련시킬 때 드는 메모리와 계산 비용을 크게 줄이면서도 성능은 오히려 높일 수 있다는 뜻이다. 이는 제한된 컴퓨팅 자원으로 장기 상호작용 에이전트를 훈련해야 하는 연구자와 회사들에게 실질적인 비용 절감으로 이어질 수 있다.
이 논문의 용어
- 정책(policy) · 주어진 상황에서 어떤 행동을 할지 결정하는 AI의 규칙
- 가치함수(value function) · 어떤 상태나 행동이 앞으로 얼마나 좋은 결과를 가져올지 미리 예측하는 함수
- 비평가(critic) 모델 · 정책과 별도로 두어 행동의 좋고 나쁨을 평가하는 보조 모델
- PPO · 정책을 급격히 바꾸지 않도록 제한하며 학습하는 대표적인 강화학습 기법
- GRPO · 같은 문제를 여러 번 풀어본 결과들을 서로 비교해 비평가 모델 없이 학습하는 기법
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다
- AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다
- AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다
METAL MEDIA 최신 기사
그림 출처: Dayang Liang et al., arXiv:2608.19842, CC BY 4.0