여러 도구를 순서 상관없이 써야 하는 AI 에이전트, 실패 지점만 콕 집어 고쳐 가르치면 선생님보다 잘한다
arXiv:2608.185242026-08-20
DART-SD: Diamond-topology Aware Retrieval and Tuning for Self-Distillation of Multi-Turn Tool-Calling Agents
여러 도구를 순서 상관없이 써야 하는 AI 에이전트, 실패 지점만 콕 집어 고쳐 가르치면 선생님보다 잘한다
여러 개의 하위 작업을 아무 순서로나 처리해도 되는 도구 사용 과제에서, 기존 학습 방식은 성공한 예시 전체를 통째로 따라하게 시켜서 학생 모델이 스스로 찾은 좋은 대안 경로까지 지워버리는 문제가 있었다. DART-SD는 성공한 시도들을 그래프로 만들어 학생이 정확히 어디서부터 궤도를 벗어났는지(CTB, 결정적 이탈 지점) 찾아내고, 그 지점 이후만 골라서 복구 방법을 가르친다. 그 결과 Qwen3-4B와 Qwen3-8B 모델 모두에서 기존 지도학습·강화학습 방식보다 다섯 개 벤치마크에서 더 좋은 성능을 냈고, 일부 지표에서는 가르친 선생 모델보다도 더 나은 결과를 보였다.
METAL MEDIA 해설 도표
여러 도구를 순서 상관없이 써야 하는 AI 에이전트, 실패 지점만 콕 집어 고쳐 가르치면 선생님보다 잘한다
01문제의식: 여러 하위 목표를 어떤 순서로 처리해도 되는 작업은 정답 경로가 마름모(다이아몬드) 모양으로 여러 갈래로 갈라졌다 다시 합쳐지는 구조인데, 기존 SFT나 GRPO 같은 강화학습은 이걸 하나의 일자 경로로 뭉개서 학습시키는 바람에 학생이 스스로 찾은 유효한 다른 경로까지 틀렸다고 벌점을 준다
02방법: 선생 모델의 성공/실패 시도 기록들을 상호작용-상태 전이 그래프(ISTG)로 만들고, 학생 모델의 실패한 시도를 이 그래프 위에 겹쳐서 어디까지는 성공 가능한 영역에 있었는지 확인한 뒤, 처음으로 그 영역을 벗어난 지점(CTB)을 찾아 그 이후 부분만 다시 생성해 학습 손실을 계산한다. 이걸 여러 라운드에 걸쳐 반복하며 학생이 점점 더 긴 구간을 스스로 잘 해내도록 만든다
03검증: FTRL 데이터셋으로 훈련하고 FTRL, BFCL, ToolHop, τ-bench, RoTBench 다섯 개 벤치마크로 평가했으며, Qwen3-4B와 Qwen3-8B 두 크기 모델 모두에서 기존 증류 기법(SCoRe-SFT, OPSD 등)과 강화학습 기법(FTRL-GRPO, ToolRL, MatchTIR 등)보다 전반적으로 우수했다
04추가 결과: 학습이 반복될수록 성공한 궤적의 평균 도구 호출 횟수가 4.23회에서 3.55회로 줄면서도 성능은 계속 좋아졌고, 이는 사람이 만든 정답 경로의 평균 4.02회보다도 짧았다. 또한 실패 지점(CTB)이 점점 뒤로 밀려나 학생이 스스로 잘 해내는 구간이 계속 길어졌음을 확인했다
05일반 능력 평가에서도 지시 따르기, 수학 추론, 일반 지식 벤치마크 평균 점수가 43.92에서 49.89로 올라, 도구 사용 능력을 키우면서도 원래 모델의 다른 능력을 해치지 않았다
METAL MEDIA이 원문을 바탕으로 재구성한 해설 도표이며, 논문 저자의 원문 figure가 아닙니다.
무엇을 했나
문제의식: 여러 하위 목표를 어떤 순서로 처리해도 되는 작업은 정답 경로가 마름모(다이아몬드) 모양으로 여러 갈래로 갈라졌다 다시 합쳐지는 구조인데, 기존 SFT나 GRPO 같은 강화학습은 이걸 하나의 일자 경로로 뭉개서 학습시키는 바람에 학생이 스스로 찾은 유효한 다른 경로까지 틀렸다고 벌점을 준다
방법: 선생 모델의 성공/실패 시도 기록들을 상호작용-상태 전이 그래프(ISTG)로 만들고, 학생 모델의 실패한 시도를 이 그래프 위에 겹쳐서 어디까지는 성공 가능한 영역에 있었는지 확인한 뒤, 처음으로 그 영역을 벗어난 지점(CTB)을 찾아 그 이후 부분만 다시 생성해 학습 손실을 계산한다. 이걸 여러 라운드에 걸쳐 반복하며 학생이 점점 더 긴 구간을 스스로 잘 해내도록 만든다
검증: FTRL 데이터셋으로 훈련하고 FTRL, BFCL, ToolHop, τ-bench, RoTBench 다섯 개 벤치마크로 평가했으며, Qwen3-4B와 Qwen3-8B 두 크기 모델 모두에서 기존 증류 기법(SCoRe-SFT, OPSD 등)과 강화학습 기법(FTRL-GRPO, ToolRL, MatchTIR 등)보다 전반적으로 우수했다
추가 결과: 학습이 반복될수록 성공한 궤적의 평균 도구 호출 횟수가 4.23회에서 3.55회로 줄면서도 성능은 계속 좋아졌고, 이는 사람이 만든 정답 경로의 평균 4.02회보다도 짧았다. 또한 실패 지점(CTB)이 점점 뒤로 밀려나 학생이 스스로 잘 해내는 구간이 계속 길어졌음을 확인했다
일반 능력 평가에서도 지시 따르기, 수학 추론, 일반 지식 벤치마크 평균 점수가 43.92에서 49.89로 올라, 도구 사용 능력을 키우면서도 원래 모델의 다른 능력을 해치지 않았다
Table 1: Performance comparison of different training methods on five tool-use benchmarks using Qwen3-4B and Qwen3-8B backbones. Training-based baselines are organized into distillation-based ♠ and reinforcement learning ♢ paradigms. All trainable methods are trained on FTRL and evaluated on both the in-domain FTRL test set and four out-of-domain benchmarks. The best and second-best results within each backbone are highlighted.
Methods
FTRL
BFCL
ToolHop
τ-bench
RoTBench
Avg.
Solve-P
Solve-R
Solve-F1
Multi-Turn
AC
Pass^1
TS
PI
CF
Qwen3-4B
Base
21.00
26.54
21.81
10.14
20.20
15.15
69.52
26.31
16.07
25.19
♠ SFT
34.26
49.02
37.96
14.57
40.50
21.82
71.67
44.40
24.40
37.62
♠ SCoRe-SFT
23.79
28.20
24.61
12.75
25.83
11.52
60.36
31.19
18.33
26.29
♠ OPSD
22.37
29.21
23.50
11.00
20.20
23.03
68.93
35.24
21.67
28.35
♢ FTRL-GRPO
36.83
41.71
37.84
13.50
29.25
20.61
70.36
32.62
20.24
33.66
♢ ToolRL
26.89
33.23
28.47
9.88
20.60
18.18
69.64
38.21
24.05
29.91
♢ MatchTIR (OT)
23.55
29.27
24.95
10.38
26.23
16.36
72.02
32.74
20.36
28.43
♢ MatchTIR (KM)
25.54
31.10
26.50
10.00
26.63
21.82
72.02
33.81
21.43
29.87
♠ DART-SD (Ours)
36.70
48.16
39.77
23.88
42.11
23.03
72.02
42.38
24.52
39.17
Qwen3-8B
Base
21.18
30.71
23.48
18.38
28.54
10.13
75.52
36.29
22.19
29.60
♠ SFT
38.08
50.95
41.89
19.25
43.52
26.06
75.95
48.81
30.24
41.64
♠ SCoRe-SFT
31.28
34.48
31.58
19.25
30.25
18.18
70.36
40.48
24.52
33.38
♠ OPSD
24.37
34.88
26.68
20.50
41.11
21.21
75.24
43.21
27.38
34.95
♢ FTRL-GRPO
37.66
45.49
40.22
35.25
34.57
23.03
77.02
42.74
27.02
40.33
♢ ToolRL
32.49
41.07
35.00
20.50
44.72
25.45
75.71
51.43
33.10
39.94
♢ MatchTIR (OT)
29.45
34.89
30.65
21.38
38.79
24.24
75.00
40.36
25.36
35.57
♢ MatchTIR (KM)
33.07
40.42
35.37
23.25
41.71
26.06
75.71
42.26
26.90
38.31
♠ DART-SD (Ours)
42.00
54.13
45.66
27.63
45.03
27.12
75.83
57.38
35.48
45.58
Table 2: Average tool-call length of successful trajectories across progressive SFT iterations on the FTRL test set. DART-SD progressively improves Solve-F1 while shortening its tool traces, eventually producing more efficient traces than the golden solutions given during data construction.
Task
DART-SD
Golden
Iter1
Iter2
Iter3
Iter4
Iter5
Single
1.23
1.15
1.10
1.09
1.07
1.00
Multi
3.83
4.63
4.54
4.49
4.41
4.71
Para-Single
3.29
2.65
2.27
2.26
2.22
2.11
Para-Multi
7.25
6.48
5.97
5.82
5.62
6.97
Overall
4.23
3.99
3.71
3.65
3.55
4.02
Solve-F1
40.37
42.95
43.78
44.67
45.66
–
Table 3: Average CTB positions of failed training trajectories across progressive SFT. Larger values indicate that the first departure from empirically recoverable behavior occurs later, meaning that the model correctly executes a longer trajectory prefix before localized recovery is required.
Task
CTB Position
Iter1
Iter2
Iter3
Iter4
Iter5
Single
0.034
0.186
0.137
0.249
0.077
Multi
0.500
1.624
1.729
1.876
1.953
Para-Single
0.095
0.219
0.299
0.328
0.313
Para-Multi
0.395
1.524
1.692
1.791
1.816
Overall
0.348
1.185
1.310
1.421
1.452
Δ vs. Iter1
–
+0.837
+0.962
+1.073
+1.104
Table 4: Performance comparison under the thinking setting. Results are reported using FTRL Solve-F1, the average BFCL Multi-Turn score, and ToolHop AC.
Method
FTRL
BFCL
ToolHop
Qwen3-8B
29.74
40.00
42.21
FTRL-GRPO
32.85
41.50
36.72
ToolRL
26.72
34.25
32.93
MatchTIR (KM)
37.33
47.13
46.16
DART-SD
41.03
49.75
46.43
Table 5: General capability evaluation on representative benchmarks. The best results are highlighted.
Method
IFEval
AIME24
AIME25
MMLU
Avg.
Qwen3-8B
34.75
46.67
23.33
70.94
43.92
SFT
35.30
43.33
26.67
71.43
44.18
DART-SD
45.29
50.00
30.00
74.27
49.89
Table 6: Component ablation of DART-SD on the FTRL test set using Solve-P, Solve-R, and Solve-F1.
Method
Solve-P
Solve-R
Solve-F1
Qwen3-8B
21.18
30.71
23.48
+SD
36.23
44.46
38.10
+CTB
36.62
46.32
39.51
+Progressive SFT
41.32
49.65
43.93
+ISTG (Ours)
42.00
54.13
45.66
왜 중요한가
도구를 여러 번 호출해가며 문제를 푸는 AI 에이전트를 만들 때, 정답 하나만 통째로 외우게 시키는 기존 방식은 비효율적이고 모델이 갖고 있던 다양한 문제 해결 방식을 오히려 망가뜨릴 수 있다는 걸 보여준다. 실패한 부분만 정확히 찾아 고쳐주는 이런 방식은 더 적은 학습 비용으로 더 똑똑하고 효율적인 에이전트를 만드는 실용적인 방법을 제시한다.
이 논문의 용어
SFT(지도 미세조정) · 정답 예시를 그대로 따라 하도록 모델을 추가 학습시키는 방법
GRPO · 보상 신호를 이용해 모델의 행동을 조정하는 강화학습 기법 중 하나
ISTG(상호작용-상태 전이 그래프) · 도구 호출 과정에서 어떤 정보를 얻었는지를 노드로 표현한 그래프 구조
CTB(결정적 이탈 지점) · 학생 모델의 시도가 성공 가능한 경로에서 처음으로 벗어나는 지점
자기증류(self-distillation) · 모델이 스스로 생성한 결과를 이용해 자기 자신을 다시 학습시키는 방법
본문에 싣지 못한 그림
Figure 1: Comparison of training paradigms. (a) SFT Teacher Boosting applies an indiscriminate global loss, which overwrites valid exploration. (b) Standard-RL (GRPO) misassigns credit through a uniformly distributed reward spread. (c) DART-SD dynamically identifies the Critical Topological Breakpoints (CTB) and applies localized correction while preserving valid exploration.
Figure 2: Overview of DART-SD. (1) DART-SD constructs an ISTG from teacher rollouts, where main and auxiliary nodes model information acquisition and useless exploration. (2–3) Failed student rollouts are collected and replayed in the same interaction-state space, then projected onto the budget-filtered success-reachable region ℛx+, where the first projectable-to-non-projectable transition defines the CTB. (4–5) Conditioned on the retained student prefix and privileged teacher references, DART-SD generates a recovery continuation after the CTB and applies localized supervision only to the generated assistant tokens. (6) This CTB-guided SFT loop is progressively repeated across self-distillation rounds.
Figure 3: Performance comparison of Qwen3-8B, DART-SD, and the teacher across five tool-use benchmarks. DART-SD improves upon Qwen3-8B on all benchmarks and surpasses the teacher on FTRL, ToolHop, and τ-bench.