컴백부터 K-뷰티까지 — K-컬쳐의 모든 것을 메일로 받아보세요메일로 받아보기

METAL MEDIA

AI 코딩 에이전트가 실제 버그를 만나기 전에 스스로 '가짜 버그'를 만들어 연습해서 특정 프로젝트에 강해지는 방법

arXiv:2608.189332026-08-18

SkillForge: Self-Distilling Agents for Project-Specific Issue Resolution

AI 코딩 에이전트가 실제 버그를 만나기 전에 스스로 '가짜 버그'를 만들어 연습해서 특정 프로젝트에 강해지는 방법

SkillForge는 소프트웨어 버그를 자동으로 고치는 AI 에이전트가 특정 프로젝트(레포지토리)의 특성을 미리 익히도록, 그 레포지토리의 테스트 코드를 이용해 가짜 이슈를 스스로 만들어 풀어보고 그 경험에서 재사용 가능한 노하우(스킬)를 뽑아낸다. 기존 방법들은 과거에 실제로 해결된 이슈 기록이 있어야 하거나, 매번 새 이슈가 들어올 때마다 비싼 탐색을 반복해야 했는데, SkillForge는 이슈가 들어오기 전에 미리 지식을 쌓아둔다. SWE-bench Verified와 SWE-bench Pro라는 벤치마크에서 기존 최고 성능 방법들보다 일관되게 높은 성공률을 보였다.

METAL MEDIA 해설 도표

AI 코딩 에이전트가 실제 버그를 만나기 전에 스스로 '가짜 버그'를 만들어 연습해서 특정 프로젝트에 강해지는 방법

  1. 01레포지토리의 테스트가 실제로 실행하는 핵심 코드 부분을 찾아, AI가 원본을 보지 않고 그 기능을 다시 구현하게 만들어 자연스러운 실수(가짜 버그)를 유도하고 이를 합성 이슈로 만든다
  2. 02SWE 에이전트가 이 합성 이슈들을 풀게 한 뒤, 성공한 시도와 실패한 시도 모두에서 '이 코드 부분은 이렇게 접근해야 한다'는 전역 진단 지식과 '이 부분은 이렇게 고쳐야/이런 실수를 피해야 한다'는 지역 수정 지식을 뽑아 코드의 특정 부분(엔티티)에 연결해 저장한다
  3. 03실제 이슈를 풀 때는 이슈 설명으로 관련된 전역 지식을 먼저 검색해 제공하고, 에이전트가 실제로 특정 파일이나 함수에 접근하는 순간 그에 맞는 지역 수정 지식을 실시간으로 끼워 넣는다
  4. 04Mini-SWE-Agent에 적용해 DeepSeek-V3.2와 GPT-5-mini로 실험한 결과 SWE-bench Verified에서 기존 방법 대비 각각 +5.8%p, +5.6%p, SWE-bench Pro에서 +5.8%p, +4.1%p 성능(Pass@1)이 올랐고, 과거 이력 기반 방법이나 이슈마다 탐색을 반복하는 방법들을 모두 앞섰다
METAL MEDIA이 원문을 바탕으로 재구성한 해설 도표이며, 논문 저자의 원문 figure가 아닙니다.

무엇을 했나

  1. 레포지토리의 테스트가 실제로 실행하는 핵심 코드 부분을 찾아, AI가 원본을 보지 않고 그 기능을 다시 구현하게 만들어 자연스러운 실수(가짜 버그)를 유도하고 이를 합성 이슈로 만든다
  2. SWE 에이전트가 이 합성 이슈들을 풀게 한 뒤, 성공한 시도와 실패한 시도 모두에서 '이 코드 부분은 이렇게 접근해야 한다'는 전역 진단 지식과 '이 부분은 이렇게 고쳐야/이런 실수를 피해야 한다'는 지역 수정 지식을 뽑아 코드의 특정 부분(엔티티)에 연결해 저장한다
  3. 실제 이슈를 풀 때는 이슈 설명으로 관련된 전역 지식을 먼저 검색해 제공하고, 에이전트가 실제로 특정 파일이나 함수에 접근하는 순간 그에 맞는 지역 수정 지식을 실시간으로 끼워 넣는다
  4. Mini-SWE-Agent에 적용해 DeepSeek-V3.2와 GPT-5-mini로 실험한 결과 SWE-bench Verified에서 기존 방법 대비 각각 +5.8%p, +5.6%p, SWE-bench Pro에서 +5.8%p, +4.1%p 성능(Pass@1)이 올랐고, 과거 이력 기반 방법이나 이슈마다 탐색을 반복하는 방법들을 모두 앞섰다
Fig. 1: Overview of SkillForge.
Fig. 1: Overview of SkillForge.
TABLE I: Main results on SWE-bench Verified.
MethodModelPass@1Avg Cost
Mini-SWE-AgentDeepSeek-V3.266.4%$0.049
GPT-5-mini55.0%$0.031
History-driven project-specific knowledge acquisition
SWE-ExpDeepSeek-V3.269.0%†↑2.6%$0.090
GPT-5-mini56.6%†↑1.6%$0.065
EvoCoderDeepSeek-V3.267.0% ↑0.6%$0.064
GPT-5-mini58.4% ↑3.4%$0.052
MemGovernDeepSeek-V3.269.2%†↑2.8%
GPT-5-mini58.0%†↑3.0%
Online project-specific knowledge acquisition
SAGEDeepSeek-V3.267.2% ↑0.8%$0.081
GPT-5-mini56.0%†↑1.0%$0.052
SWE-DebateDeepSeek-V3.268.2% ↑1.8%$0.382
GPT-5-mini56.4% ↑1.4%$0.167
Live-SWE-agentDeepSeek-V3.267.0% ↑0.6%$0.050
GPT-5-mini55.6% ↑0.6%$0.042
Variants of SkillForge
SkillForge w/ SWE-SmithDeepSeek-V3.268.0% ↑1.6%$0.088
GPT-5-mini56.4%†↑1.4%$0.071
SkillForge w/ LLM SummaryDeepSeek-V3.268.7%†↑2.3%$0.069
GPT-5-mini54.4% ↓0.6%$0.065
SkillForgeDeepSeek-V3.272.2%†↑5.8%$0.074
GPT-5-mini60.6%†↑5.6%$0.066
†: p−v​a​l​u​e<0.05.
Fig. 2: Synthesize project-specific issues.
Fig. 2: Synthesize project-specific issues.
TABLE II: Main results on SWE-bench Pro.
DeepSeek-V3.2GPT-5-mini
MethodPass@1Avg CostPass@1Avg Cost
Mini-SWE-Agent28.3%$0.04747.6%$0.063
SWE-Exp29.4% ↑1.1%$0.08348.7% ↑0.9%$0.089
Live-SWE-agent32.4% ↑4.1%$0.05149.1%†↑1.5%$0.072
SkillForge34.1%†↑5.8%$0.06951.7%†↑4.1%$0.087
†: p−v​a​l​u​e<0.05.
Fig. 3: Skill distillation.
Fig. 3: Skill distillation.
TABLE III: Ablation study results.
ApproachDeepSeek-V3.2GPT-5-mini
w/o Global Diagnostic Skills68.4% (↓3.8%)57.6% (↓3.0%)
w/o Local Intervention Skills67.8% (↓4.4%)57.2% (↓3.4%)
SkillForge72.2%60.6%
Fig. 4: Hyperparameter study results on the Sphinx and Django repositories with GPT-5-mini. (a) BM25 skill retrieval count. (b) Code segment rewritten count during issue synthesis. Red stars mark the best-performing k in each setting.
Fig. 4: Hyperparameter study results on the Sphinx and Django repositories with GPT-5-mini. (a) BM25 skill retrieval count. (b) Code segment rewritten count during issue synthesis. Red stars mark the best-performing k in each setting.
TABLE IV: Cross-LLM skill transfer on SWE-bench Verified. Resolver LLM denotes the backbone used for real issue resolution, while Knowledge-source LLM denotes the backbone used to synthesize instances and distill skills.
Resolver LLMKnowledge-source LLMPass@1
GPT-5-miniGPT-5-mini60.6%
DeepSeek-V3.255.0%
DeepSeek-V3.2GPT-5-mini65.2%
DeepSeek-V3.272.2%
Fig. 5: Pass@1 performance comparison between Baseline and our method across seven repositories.
Fig. 5: Pass@1 performance comparison between Baseline and our method across seven repositories.

왜 중요한가

실무에서 AI 코딩 에이전트를 특정 회사나 오픈소스 프로젝트에 투입할 때 가장 큰 문제는 그 프로젝트만의 관례와 함정을 모른다는 점인데, 이 방법은 과거 이슈 데이터가 부족하거나 없는 프로젝트에서도 비용을 크게 늘리지 않고 에이전트를 미리 훈련시킬 수 있는 실용적인 길을 보여준다. 자동 버그 수정 도구를 실제 프로젝트에 적용하려는 개발팀이나 AI 에이전트 개발자에게 바로 참고할 수 있는 설계다.

Fig. 6: Case study for django-11206 with and without project-specifc knowledge (represented as skills).
Fig. 6: Case study for django-11206 with and without project-specifc knowledge (represented as skills).

이 논문의 용어

  • Pass@1 · 한 번의 시도로 이슈를 정확히 해결한 비율을 나타내는 평가 지표
  • SWE-bench · 실제 GitHub 이슈를 기반으로 AI 코딩 에이전트의 버그 수정 능력을 평가하는 벤치마크
  • BM25 · 검색어와 문서의 단어 일치도를 계산해 관련 문서를 찾아주는 전통적인 정보 검색 알고리즘
  • 엔티티 그라운딩(entity-grounded) · 추출한 지식을 코드의 특정 파일·함수·클래스 등 실제 요소에 직접 연결해두는 방식
  • 자기증류(self-distillation) · 모델(또는 에이전트)이 스스로 만든 데이터와 경험에서 재사용 가능한 지식을 뽑아내는 과정

저자 · Silin Chen

arXiv에서 원문 보기

최신 논문

논문 전체 보기 →

METAL MEDIA 최신 기사

그림 출처: Silin Chen et al., arXiv:2608.18933, CC BY 4.0