AI 상담 매뉴얼이 여러 번 대화를 주고받아야만 드러나는 실수를 스스로 고치도록 만든 방법
arXiv:2608.131202026-08-12
SkillEvo: Self-Renewing Evolution Gradients from Multi-Turn Interaction Feedback
AI 상담 매뉴얼이 여러 번 대화를 주고받아야만 드러나는 실수를 스스로 고치도록 만든 방법
AI 고객 상담 에이전트가 쓰는 '스킬'(작업 매뉴얼)은 한 번 만들고 나면 실제 실패 사례로부터 배우지 못하는 경우가 많다. 기존 방법들은 한 번의 질문-답변만으로 평가해서 초반 몇 번의 개선 뒤엔 더 이상 나아지지 않는 한계가 있었다. SkillEvo는 여러 턴에 걸친 모의 대화로 숨은 결함을 계속 찾아내고, 별도의 감시 장치로 매뉴얼이 망가지지 않게 지키면서 꾸준히 개선되도록 만들었다.
METAL MEDIA 해설 도표
AI 상담 매뉴얼이 여러 번 대화를 주고받아야만 드러나는 실수를 스스로 고치도록 만든 방법
01AI 상담 매뉴얼(스킬)은 보통 사람이 직접 쓰거나 AI가 한 번에 생성한 뒤 방치되어, 실제 상담 실패에서 배우는 순환 구조가 없었다.
02기존 개선 방법은 한 번의 질문-답변 평가로 피드백을 얻는데, 첫 라운드에서 눈에 보이는 문제를 고치고 나면 개선 신호가 사라져 더 이상 발전하지 않았다.
03SkillEvo는 가상의 사용자가 여러 턴에 걸쳐 후속 질문을 던지게 해서, 매뉴얼이 개선될 때마다 대화가 더 깊이 진행되며 이전엔 안 보이던 새로운 결함을 계속 드러나게 한다.
04단순 합격/불합격 점수 대신, 별도의 감시 장치가 지식 손실, 참조 깨짐, 사실이 애매해지는 문제를 진단해서 직접 고친다.
05텐센트 클라우드의 6개 서비스 분야, 9개 실제 매뉴얼, 98개 참조 파일로 검증한 결과, 자기반성 방식보다 23.0점, 한 번의 질문-답변 방식보다 15.4점 더 높은 성능을 보였다.
METAL MEDIA이 원문을 바탕으로 재구성한 해설 도표이며, 논문 저자의 원문 figure가 아닙니다.
무엇을 했나
AI 상담 매뉴얼(스킬)은 보통 사람이 직접 쓰거나 AI가 한 번에 생성한 뒤 방치되어, 실제 상담 실패에서 배우는 순환 구조가 없었다.
기존 개선 방법은 한 번의 질문-답변 평가로 피드백을 얻는데, 첫 라운드에서 눈에 보이는 문제를 고치고 나면 개선 신호가 사라져 더 이상 발전하지 않았다.
SkillEvo는 가상의 사용자가 여러 턴에 걸쳐 후속 질문을 던지게 해서, 매뉴얼이 개선될 때마다 대화가 더 깊이 진행되며 이전엔 안 보이던 새로운 결함을 계속 드러나게 한다.
단순 합격/불합격 점수 대신, 별도의 감시 장치가 지식 손실, 참조 깨짐, 사실이 애매해지는 문제를 진단해서 직접 고친다.
텐센트 클라우드의 6개 서비스 분야, 9개 실제 매뉴얼, 98개 참조 파일로 검증한 결과, 자기반성 방식보다 23.0점, 한 번의 질문-답변 방식보다 15.4점 더 높은 성능을 보였다.
Figure 1: The evaluation feedback modality determines the ceiling of skill evolution. Left: single-turn QA patches the gaps visible in the first exchange; the evolution gradient then decays and the TSR curve saturates around round 2. Right: multi-turn interaction keeps exposing latent failures—each round of revision lets the dialogue proceed further and reach the next layer of defects—so the gradient renews itself and TSR keeps climbing.
Table 1: Baselines and variants.
Method
Skill source and update mechanism
Multi-turn
Rounds
Original Skill
Hand-authored initial Skill, never updated
No
0
Self-Reflection
Model self-reflects and edits the Skill directly, no evaluation feedback
No
4
Single-turn QA
Single-turn QA evaluation-driven evolution (11)
No
4
SkillEvo
Iterative evolution driven by simulated multi-turn interaction
Yes
4
Figure 2: Overview of SkillEvo. The upper layer generates trustworthy feedback to drive revision; the lower layer governs structural degradation so that the knowledge carrier remains intact.
Table 2: Per-round TSR of each method on the evaluation set (%).
Method
Init
R1
R2
R3
R4
Original Skill
30.0
—
—
—
—
Self-Reflection
30.0
59.2
58.7
57.4
58.8
Single-turn QA
30.0
58.9
64.5
65.7
66.4
SkillEvo
30.0
59.4
71.3
77.9
81.8
Table 3: Ablation (evaluation-set TSR, %).
Variant
Overall TSR
SkillEvo (Full)
81.8
(a) Single-turn QA
66.4
(b) w/o Governance
78.6
Table 4: Dual-sided orthogonal evaluation (%).
Side / property
Metric
Value
Simulator, coverage
cU (intent coverage)
98.9
Simulator, fidelity
ρ (human-rated similarity)
95.3
Agent, accuracy
sC (exposed-intent accuracy)
71.1
Table 5: Cross-round regression rate RegR (%).
R1→2
R2→3
R3→4
First-to-last change
28.2
24.4
21.1
−7.1
Table 6: Knowledge bloat (cumulative growth relative to S0, %).
Setting
Cumulative bloat
Remark
With governance (SkillEvo Full)
+2.8
Growth concentrates in the first round and then tapers off
Without governance
+16.2
Bloat accumulates round after round with no dissolution mechanism
Table 7: Evaluation scenarios and dataset.
Scenario category
Skill
Cloud service
#Tickets
Marketing
dianshi-consultation
Dianshi campaign platform
400
Dev & collaboration tools
code-assistant-consultation
CodeBuddy coding assistant
400
Storage
cos-consultation
Cloud Object Storage (COS)
200
Storage
cbs-consultation
Cloud Block Storage (CBS)
160
Dev & collaboration tools
cloudbase-consultation
CloudBase
200
AI & LLM platforms
tokenhub-consultation
TokenHub LLM service platform
200
AI & LLM platforms
tencent-adp-consultation
Agent Development Platform (ADP)
200
Networking & edge
edgeone-consultation
EdgeOne edge security acceleration
200
Compute
scf-consultation
Serverless Cloud Function (SCF)
40
Total
9 Skills
6 categories
2,000
Table 8: Model assignment and evolution parameter configuration.
Component
Parameter
Value
Skill Editor (Generator)
Model family
A (deepseek-v4-pro)
Verifier / Attributor / User Agent / Governor (Evaluator)
Model family
B (minimax-m3)
Evolution loop
max_cycles (full loop rounds)
4
Evolution loop
max_iterations (edit iterations per round)
3
Evolution loop
max_turns (interaction turns per ticket)
10
Evolution loop
early_stop_avg_score
70.0
Evolution loop
early_stop_solved_ratio
0.7
Evolution loop
pass_threshold
60.0
Evaluation
Intent weight α
0.7
Signal merging
keyword_jaccard_threshold
0.3
왜 중요한가
고객 지원처럼 사람이 일일이 매뉴얼을 고쳐야 했던 영역에서, 실패 사례를 자동으로 개선 신호로 바꿔주는 이 방식은 유지보수 비용과 지연을 크게 줄일 수 있다. 실제 텐센트 클라우드 운영 환경에 적용됐다는 점에서 연구실 수준을 넘어선 실전 검증 사례이기도 하다.
이 논문의 용어
스킬(Skill) · AI 에이전트가 특정 업무를 처리할 때 참고하는 지식과 절차를 담은 문서 모듈
단일 턴 질문-답변 평가 · 대화 한 번(질문 하나, 답변 하나)만으로 성능을 평가하는 방식
다중 턴 상호작용 · 여러 번 질문과 답변을 주고받는 대화 방식으로, 깊이 있는 문제를 드러낼 수 있음