코딩 어시스턴트 안에서 13개 스킬만으로 논문을 처음부터 끝까지 쓰고, 실험 결과가 나쁘면 주장을 스스로 깎아내는 시스템
코딩 어시스턴트 안에서 13개 스킬만으로 논문을 처음부터 끝까지 쓰고, 실험 결과가 나쁘면 주장을 스스로 깎아내는 시스템
Spark-to-Paper는 별도의 에이전트 플랫폼 없이 기존 코딩 어시스턴트(Claude Code) 안에서 13개의 조합 가능한 스킬만으로 아이디어를 완성된 논문으로 바꾼다. 실험 설계를 먼저 정해두고 결과를 나중에 보고하도록 순서를 강제하며, 기계적으로 검증 가능한 오류는 결정론적 검사기로, 의미적 판단은 모델의 자기비판으로 나눠 처리한다. 8개 통제된 연구 주제에서 인용 정확도 99.5%, 그림 편집 가능성 96.4%를 달성했고, 조작된 주장 탐지율은 단일 패스 초안 14%에서 전체 시스템 적용 시 92%로 올랐다.
METAL MEDIA 해설 도표
Spark-to-Paper 파이프라인 구조
증거 상태측정 결과가 보고됨
- 입력 라우팅 (Stage 0)짧은 아이디어인지 완성된 제안서인지, 측정 데이터가 있는지(Proposal/Data-Aware Mode)를 먼저 판단
- 계획-인용-작성-정제-리뷰-그림-조립 (Stage 1~7)13개 스킬이 공유 프로젝트 폴더의 아티팩트를 읽고 써가며 청사진, 참고문헌, 원고, 그림을 순차적으로 생성·수정
- 무결성·자기비판 계층결정론적 게이트(인용·구조·컴파일 검사)와 Self-Review, Adversarial Review가 실험-비판-수정 주기를 최대 7회까지 반복
- 실험 실행 (Stage 8, 조건부)코드·데이터가 준비되면 실제 실험을 실행해 측정값을 기록하고, 그 결과에 따라 초록부터 결론까지 주장을 갱신
- 자기논박 루프 대응7회 반복 후에도 원래 가설이 지지되지 않으면 실패 보고서로 남기고 새 아이디어로 파이프라인을 재시작
무엇을 했나
- 연구 아이디어를 논문으로 만드는 전 과정(문헌 검색, 실험 설계·실행, 근거에 따른 주장 수정, 출판용 그림 생성, 긴 생성 과정의 일관성 유지)을 별도 에이전트 플랫폼 없이 기존 코딩 어시스턴트 안의 13개 스킬로 구현했다.
- 모델이 판단해야 할 일(논증 구성, 문헌 관련성, 근거의 충분성)과 기계적으로 실행·검증 가능한 일(구조 검사, 인용 검증, LaTeX 컴파일, 데이터 기반 그림 생성)을 명확히 분리했다.
- 실험 계획 단계에서 어떤 표와 지표가 필요한지 결과를 보기 전에 먼저 확정해두고(사전등록과 비슷한 방식), 실험 후에는 측정된 증거에 따라 초록·서론·결론까지 원고 전체의 주장을 일관되게 수정한다.
- 반복 실험이 계속 원래 가설을 기각하는 '자기논박 루프(Self-Refutation Loop)'라는 실패 양상을 정의하고, 실험-비판-수정 주기를 7회로 제한해 해결되지 않으면 실패 보고서로 남기고 새 아이디어로 재시작하도록 설계했다.
- 실험 결과 그림은 프로그램으로 직접 그려 벡터 PDF로 만들고, 방법론 설명 그림은 이미지 생성 모델로 만든 뒤 코드로 재구성해 편집 가능한 벡터 형식으로 바꾼다.
| System | End-to-end | Runs exper. | Draws figures | Editable vectors | No standing infra. |
|---|---|---|---|---|---|
| AI Scientist / v2 [13, 28] | ✓ | ✓ | ✓ | – | – |
| AutoResearchClaw [12] | ✓ | ✓ | ✓ | – | – |
| Kosmos / Robin [15, 7] | ⚫ | ✓ | ⚫ | – | – |
| Idea2Story [27] | – | – | ⚫ | – | ✓ |
| ARS [26] | ⚫ | – | – | – | ✓ |
| CycleResearcher [25] | ⚫ | ✓ | – | – | – |
| Spark-to-Paper (ours) | ✓ | ✓ | ✓ | ✓ | ✓ |

| Metric | Measurement |
|---|---|
| Quality | |
| Citation validity | Resolved references / total references |
| Fabrication detection | Detected unsupported claims / injected claims |
| Figure editability | Editable elements / total figure elements |
| Review precision | Verified issues / raised review issues |
| Cross-template robustness | Successful templates / supported templates |
| Efficiency | |
| Generation cost | Monetary cost, tokens, wall-clock time, and deployment footprint |
| System | Citation exist. (%) | Fig. editability (%) | Tokens (M) | USD | Wall-clock |
|---|---|---|---|---|---|
| Human-written preprints (sampled) | 97.8 [94.6, 99.4] | 58 [44, 71] | n/a | n/a | n/a |
| AI Scientist, released papers [13] | 93 (42/45) | 0 (0/210) | n/r | $10–15 (amort.) | ∼12 h / batch |
| AI Scientist-v2, workshop set [28] | 91 (58/64) | 3 (0–8) | n/r | ∼$20–25 / attempt | ≤15 h / run |
| Agent Laboratory, released paper [20] | 96 (27/28) | 0 (0/30) | n/r | $2.33 (gpt-4o) | ∼19 min |
| Single-pass LLM draft (same backbone) | 81 (range 76–86) | n/a | 0.11 (0.09–0.13) | $0.66 (0.55–0.76) | 16 min (13–19) |
| Spark-to-Paper (full stack) | 99.5 [98.4, 100] | 96.4 [92.7, 98.6] | 11.9 [10.2, 13.7] | $8.1 [6.9, 9.6] | 3.2 h [2.6, 3.9] |

| Configuration | Fabr. detection (%) | Review precision (%) | Δ tokens (M) | Δ USD |
|---|---|---|---|---|
| Single-pass draft (no gates) | 14 (5/36) [6, 29] | n/a | ref. | ref. |
| Gates only | 69 (25/36) [53, 82] | n/a | +8.1 ± 0.9 | +5.3 ± 0.5 |
| Gates + self-review | 81 (29/36) [65, 90] | n/a | +1.1 ± 0.2 | +0.6 ± 0.1 |
| Gates + self-review + adversarial review | 92 (33/36) [78, 97] | 74 (42/57) [61, 83] | +2.6 ± 0.4 | +1.6 ± 0.2 |
| Label | Action |
|---|---|
| supported | Retain with evidence-matched wording |
| partially-supported | Narrow the claim or request additional evidence |
| unsupported | Run a feasible missing experiment, weaken, or remove |
| contradicted | Remove or report as a limitation |
| needs-confirmation | Return the unresolved claim for author confirmation |

| Artifact | Stage | Purpose |
|---|---|---|
| blueprint.json | Planning | Paper structure, claims, notation, experiments |
| template.json | Planning | Venue specification and execution mode |
| refs.bib | Citation | Verified bibliography |
| claims_map.json | Citation | Claim–citation associations |
| sections/*.tex | Writing | Section-level manuscript sources |
| figures/ | Figure | Figures and generation records |
| results.facts.json | Data | Grounded quantitative evidence |
| main.tex/pdf | Assembly | Final manuscript project |
| logs/*.io.md | All stages | Stage-level input and output records |

실제로 확인된 결과
- 8개의 통제된 연구 주제에서 시스템 전체가 인용 정확도 99.5%, 그림 편집 가능성 96.4%를 기록했다.
- 조작된(입증되지 않은) 주장을 일부러 주입한 통제된 절제 실험에서, 단일 패스 초안의 탐지율 14%가 전체 무결성·리뷰 스택 적용 시 92%로 상승했다.
- 적대적 리뷰가 제기한 문제들의 정밀도(precision)는 74%였다.
- 전체 시스템은 원고 한 편당 평균 1190만 토큰을 사용하고, 비용은 8.1달러, 소요 시간은 평균 3.2시간이었다.

어디에 쓸 수 있나
- 연구 아이디어를 초안 형태의 완성된 논문 초고로 빠르게 확장해보는 용도
- 이미 코드와 실험 결과가 있는 상태에서 결과에 맞춰 논문 텍스트와 표·그림을 자동으로 갱신하는 용도
- 논문 초안에서 근거 없는 수치나 조작된 인용을 탐지하는 검증 보조 도구로 활용
- 실험 결과가 기대와 다를 때 주장의 범위를 자동으로 좁히거나 한계점으로 옮기는 자기수정 워크플로우 참고

한계와 남은 검증
- 평가는 8개의 통제된 연구 주제로 한정되어 있어, 더 넓은 분야나 실제 학술지 제출 상황에서의 일반화는 확인되지 않았다.
- Figure 1과 Table 1의 타 시스템과의 비교는 저자들이 각 시스템의 공개 문서를 보고 내린 서수적(ordinal) 평가이며, 측정된 벤치마크가 아니다.
- Figure 5의 쇼케이스 논문들의 페이지·참고문헌·그림 수는 시스템 개발자 스스로 보고한 것으로, 독립적으로 검증된 측정치가 아니다.
- 논증의 설득력이나 실험 설계의 과학적 적절성, 기여의 중요성 같은 의미적 판단은 여전히 모델 판단에 의존하며 결정론적으로 검증되지 않는다.
- 실험 설계 커밋과 일부 아티팩트 검사는 기계적으로 확인되지만, 주장-증거 간 의미적 지지 여부 판단은 현재 모델이 수행하며 이 부분의 정확도는 별도로 측정되지 않았다.

왜 중요한가
연구자들이 실험은 직접 코드로 돌리면서도 논문 작성은 별도 도구로 하던 이원화된 워크플로우를, 이미 쓰던 코딩 어시스턴트 안에서 하나로 합칠 수 있는 가능성을 보여준다. 또한 근거 없는 주장이나 조작된 결과를 걸러내는 검증 체계를 구체적으로 설계·측정했다는 점에서, 자동화된 연구 도구의 신뢰성 문제에 실질적인 참고가 된다.
이 논문의 용어
- 결정론적 검사(deterministic gate) · 규칙이 명확해 자동으로 통과/실패를 판정할 수 있는 기계적 검증 절차
- 자기논박 루프(Self-Refutation Loop) · 반복된 실험이 계속 원래 연구 목표를 뒷받침하지 못한다는 결론을 내리면서도 같은 방향을 계속 수정만 하는 실패 패턴
- 적대적 리뷰(Adversarial Review) · 여러 독립된 리뷰 패스가 원고의 이론적 타당성, 실험 설계 등을 서로 다른 관점에서 비판적으로 검토하는 단계
- Data-Aware Mode / Proposal Mode · 측정된 실험 데이터가 이미 있는지 여부에 따라 원고 작성 규칙을 달리하는 두 가지 실행 모드
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다
- AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다
- AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다
METAL MEDIA 최신 기사
그림 출처: Zhuoyang Qian et al., arXiv:2608.11924, arxiv-nonexclusive