화학 반응 하나에 정답은 여러 개, AI에게 '15개 답 다 내놔'라고 시켰더니 실력이 확 늘었다
arXiv:2608.189402026-08-18
Training Chemical Plausibility-Aware Large Language Models for Single-Step Retrosynthesis
화학 반응 하나에 정답은 여러 개, AI에게 '15개 답 다 내놔'라고 시켰더니 실력이 확 늘었다
신약 개발에서 '이 분자를 어떻게 만들까'를 거꾸로 추적하는 역합성 예측은 사실 정답이 하나가 아니라 여러 개인데, 기존 평가 방식은 답을 하나만 요구해서 이 다양성을 놓치고 있었다. 연구팀은 AI 언어모델에게 한 번에 15개의 답을 내놓게 하는 'Top-K' 학습·평가 방식을 도입하고, 약 4560만 개의 검증된 화학반응 데이터로 C3LM이라는 모델을 훈련시켰다. 그 결과 이 모델은 기존의 전통적 역합성 예측 프로그램들을 능가하는 성능을 새로운 벤치마크에서 달성했다.
METAL MEDIA 해설 도표
화학 반응 하나에 정답은 여러 개, AI에게 '15개 답 다 내놔'라고 시켰더니 실력이 확 늘었다
01신약 후보 분자를 실제로 만들 수 있는지 확인하려면 '역합성 분석'(목표 분자를 원료 물질까지 거꾸로 쪼개는 작업)이 필요한데, 하나의 목표 분자에 대해 화학적으로 가능한 경로가 여러 개 있다는 점이 기존 단답형 평가로는 제대로 반영되지 않았다
02연구팀은 AI에게 정답 하나만 요구하는 기존 방식(Top-1) 대신 '서로 다른 답 15개를 달라'고 명시적으로 요청하는 Top-K 방식을 훈련과 평가 모두에 적용했다
03약 368만 개의 화학물질과 4565만 개의 검증된 반응으로 이루어진 대규모 데이터셋 CREED-CCV-2+USPTO-XL을 새로 구축해 C3LM 모델을 훈련시키고, ChemCensor라는 화학적 타당성 채점 도구와 새로움(novelty) 보상을 결합한 강화학습으로 추가 미세조정했다
04그 결과 C3LM은 도전적인 신규 분자 벤치마크(URSA-expert-2026)에서 기존 대표 역합성 프로그램(MHNreact 등)과 대형 상용 AI 모델들을 능가했으며, AI가 만든 반응과 전통 프로그램이 만든 반응이 서로 겹치지 않는 부분이 많아 둘을 함께 쓰면 더 넓은 화학 공간을 커버할 수 있다는 점도 확인됐다
METAL MEDIA이 원문을 바탕으로 재구성한 해설 도표이며, 논문 저자의 원문 figure가 아닙니다.
무엇을 했나
신약 후보 분자를 실제로 만들 수 있는지 확인하려면 '역합성 분석'(목표 분자를 원료 물질까지 거꾸로 쪼개는 작업)이 필요한데, 하나의 목표 분자에 대해 화학적으로 가능한 경로가 여러 개 있다는 점이 기존 단답형 평가로는 제대로 반영되지 않았다
연구팀은 AI에게 정답 하나만 요구하는 기존 방식(Top-1) 대신 '서로 다른 답 15개를 달라'고 명시적으로 요청하는 Top-K 방식을 훈련과 평가 모두에 적용했다
약 368만 개의 화학물질과 4565만 개의 검증된 반응으로 이루어진 대규모 데이터셋 CREED-CCV-2+USPTO-XL을 새로 구축해 C3LM 모델을 훈련시키고, ChemCensor라는 화학적 타당성 채점 도구와 새로움(novelty) 보상을 결합한 강화학습으로 추가 미세조정했다
그 결과 C3LM은 도전적인 신규 분자 벤치마크(URSA-expert-2026)에서 기존 대표 역합성 프로그램(MHNreact 등)과 대형 상용 AI 모델들을 능가했으며, AI가 만든 반응과 전통 프로그램이 만든 반응이 서로 겹치지 않는 부분이 많아 둘을 함께 쓰면 더 넓은 화학 공간을 커버할 수 있다는 점도 확인됐다
Table 1: Plausibility-based evaluation in the single-step retrosynthesis Top-K mode. Max: per-target maximum ChemCensor score averaged over TMs. Av. PT-Top-K CC: per-TM average ChemCensor score over top-K unique predictions; ChemCensor v1.1.1, USPTO-full as the source of synthetic precedents. See the full table in Appendix F. Results for recently released models are available at https://dddbench.insilico.com/.
Model
URSA-expert-2026
USPTO-50K-test-mini
Max
Av. PT-Top-K CC
Max
Av. PT-Top-K CC
@3
@5
@10
@3
@5
@10
Proprietary Foundation Models
Grok-4.1
1.86
1.56
1.31
0.86
3.99
2.61
2.02
1.24
Grok-4.3
1.74
1.41
1.13
0.66
3.99
2.58
1.95
1.15
Gemini 3.1 Pro
1.91
1.69
1.46
1.08
4.32
2.92
2.34
1.59
GPT 5.4
1.19
0.78
0.55
0.29
2.34
1.43
1.02
0.55
GPT 5.5
1.94
1.68
1.46
1.05
4.50
3.07
2.45
1.63
Claude Opus 4.7
1.91
1.65
1.39
0.95
4.35
2.96
2.31
1.45
Claude Opus 4.8
1.89
1.62
1.34
0.85
4.35
2.95
2.30
1.44
Open-weight Foundation Models
Qwen 3.5
1.61
1.32
1.07
0.64
3.44
2.39
1.84
1.09
Kimi K2.5
1.68
1.38
1.13
0.69
3.65
2.43
1.86
1.10
GLM-5
1.22
0.97
0.75
0.42
2.16
1.39
1.03
0.58
Conventional SSRS Models
LocalRetro
2.11
1.85
1.59
1.22
4.84
3.31
2.67
1.81
GLN
1.96
1.72
1.49
1.03
4.80
3.18
2.52
1.58
MHNreact
2.05
1.84
1.62
1.28
4.86
3.30
2.68
1.90
RetroKNN
2.10
1.84
1.60
1.22
4.85
3.33
2.68
1.82
R-SMILES
2.08
1.83
1.56
1.11
4.85
3.36
2.67
1.75
C3LM, Supervised Fine-Tuning, Top-1 Mode
C3LM-LFM2-CREED-CCV+USPTO*
1.62
1.06
0.72
0.38
4.12
2.10
1.36
0.70
C3LM, Supervised and Reinforcement Learning Fine-Tuning, Top-K Mode
C3LM-LFM2-CREED-CCV+USPTO
1.92
1.68
1.42
0.98
4.16
2.74
2.17
1.42
C3LM-LFM2-CREED-CCV-2+USPTO-XL
2.04
1.81
1.59
1.27
4.16
2.88
2.37
1.70
C3LM-LFM2-RFT-CC
2.08
1.88
1.65
1.29
4.16
2.92
2.41
1.73
C3LM-LFM2-RFT-CC-NR
2.16
1.94
1.73
1.37
4.28
3.01
2.51
1.85
Chemical Plausibility and Diversity Frontier of Generated Reactions
All GP LLMs (17) together
2.19
2.07
1.93
1.65
4.85
3.98
3.53
2.87
All conventional SSRS models (8) together
2.18
1.99
1.78
1.45
4.90
3.58
3.00
2.26
Table 2: C3LM family inventory. TD-1 = CREED-CCV + USPTO; TD-2 = CREED-CCV-2 + USPTO-XL. ∗Trained in prior work (46); its predictions are re-scored under ChemCensor (v1.1.1) for comparison, without retraining.
Table 4: Plausibility-based evaluation in the single-step retrosynthesis Top-1 mode. Max: per-target maximum ChemCensor score averaged over TMs. Av. PT-Top-K CC: per-TM average ChemCensor score over top-K unique predictions; ChemCensor v1.1.1.
Model
URSA-expert-2026
USPTO-50K-test-mini
Max
Av. PT-Top-K CC
Max
Av. PT-Top-K CC
@3
@5
@10
@3
@5
@10
Proprietary Foundation Models
Grok-4.1
1.73
1.28
0.92
0.47
4.01
2.29
1.53
0.79
Grok-4.3
1.47
0.86
0.56
0.28
3.06
1.34
0.83
0.41
Gemini 3.1 Pro
1.63
0.92
0.57
0.28
4.00
1.70
1.03
0.51
GPT 5.1
0.73
0.34
0.21
0.11
1.37
0.63
0.38
0.19
GPT 5.2
0.86
0.45
0.28
0.14
2.02
0.95
0.58
0.29
GPT 5.4
0.11
0.05
0.03
0.02
2.12
0.97
0.60
0.30
GPT 5.5
1.52
0.96
0.63
0.32
3.90
1.89
1.18
0.59
Claude Sonnet 4.5
1.44
0.86
0.56
0.28
3.34
1.67
1.05
0.52
Claude Sonnet 4.6
1.26
0.71
0.44
0.22
3.32
1.64
1.01
0.51
Claude Opus 4.5
1.31
0.68
0.42
0.21
3.33
1.54
0.94
0.47
Claude Opus 4.6
1.36
0.84
0.53
0.26
3.63
1.81
1.12
0.56
Claude Opus 4.7
1.67
1.04
0.66
0.33
3.72
1.79
1.12
0.56
Claude Opus 4.8
1.66
1.06
0.67
0.34
3.64
1.69
1.04
0.52
Open-weight Foundation Models
DeepSeek 3.2
0.39
0.16
0.09
0.05
1.14
0.44
0.26
0.13
Qwen 3.5
1.54
1.04
0.73
0.38
3.69
2.02
1.32
0.67
Kimi K2.5
1.47
0.98
0.64
0.33
3.73
1.85
1.16
0.58
GLM-5
1.03
0.49
0.29
0.15
3.67
1.92
1.23
0.62
LFM2 2.6B
0.00
0.00
0.00
0.00
0.00
0.00
0.00
0.00
Table 5: Intersection of predicted reactions for URSA-expert-2026 benchmark set with the reference conventional model MHNreact. Δ is the per-target difference between the number of reactions unique to the model and those unique to MHNreact.
Model
Intersection
Unique for Model
Unique for MHNreact
Δ
C3LM-LFM2-CREED-CCV-2+USPTO-XL
5.0
6.8
6.4
+0.4
C3LM-LFM2-RFT-CC-NR
5.0
6.7
6.4
+0.3
C3LM-LFM2-RFT-CC
4.8
6.0
6.6
-0.6
C3LM-LFM2-CREED-CCV+USPTO
3.6
4.0
7.9
-3.9
Gemini 3.1 Pro
5.2
3.5
6.2
-2.7
GPT 5.5
5.2
3.2
6.2
-3.0
Grok-4.1
3.9
2.7
7.5
-4.8
Claude Opus 4.7
4.5
2.6
6.9
-4.3
Claude Opus 4.8
4.0
2.2
7.4
-5.2
Qwen 3.5
2.7
2.0
8.7
-6.7
Claude Opus 4.6
3.0
1.9
8.5
-6.6
Grok-4.3
3.1
1.9
8.4
-6.5
Kimi K2.5
3.1
1.9
8.4
-6.5
Claude Sonnet 4.5
2.3
1.9
9.1
-7.2
Claude Opus 4.5
2.7
1.8
8.7
-6.9
GLM-5
2.3
1.4
9.2
-7.8
C3LM-LFM2-CREED-CCV+USPTO*
1.4
1.3
10.0
-8.7
GPT 5.4
1.0
1.1
10.5
-9.4
Claude Sonnet 4.6
1.6
0.8
9.8
-9.0
GPT 5.2
0.3
0.6
11.1
-10.5
GPT 5.1
0.3
0.5
11.1
-10.6
DeepSeek 3.2
0.4
0.4
10.9
-10.5
Table 6: Plausibility-based evaluation in the single-step retrosynthesis Top-K mode. Max: per-target maximum ChemCensor score averaged over TMs. Av. PT-Top-K CC: per-TM average ChemCensor score over top-K unique predictions; ChemCensor v1.1.1, ChemCensor-U2P2 reference database (USPTO-full ∪ Pistachio Q3 2023).
Model
URSA-expert-2026
USPTO-50K-test-mini
Max
Av. PT-Top-K CC
Max
Av. PT-Top-K CC
@3
@5
@10
@3
@5
@10
Proprietary Foundation Models
Grok-4.1
2.17
1.81
1.54
1.06
4.13
2.84
2.27
1.46
Grok-4.3
2.02
1.62
1.32
0.82
4.14
2.81
2.19
1.35
Gemini 3.1 Pro
2.20
1.93
1.68
1.29
4.42
3.12
2.56
1.83
GPT 5.1
0.69
0.40
0.27
0.14
1.41
0.79
0.54
0.28
GPT 5.2
0.51
0.33
0.24
0.15
1.61
0.99
0.71
0.40
GPT 5.4
1.37
0.97
0.71
0.39
2.50
1.62
1.19
0.66
GPT 5.5
2.28
1.94
1.68
1.27
4.60
3.26
2.68
1.86
Claude Sonnet 4.5
1.86
1.51
1.21
0.75
3.36
2.31
1.80
1.11
Claude Sonnet 4.6
1.17
0.90
0.70
0.42
3.13
2.07
1.57
0.92
Claude Opus 4.5
1.92
1.55
1.24
0.79
3.54
2.46
1.94
1.22
Claude Opus 4.6
1.95
1.59
1.29
0.83
3.96
2.77
2.19
1.37
Claude Opus 4.7
2.24
1.89
1.61
1.16
4.44
3.16
2.55
1.68
Claude Opus 4.8
2.17
1.85
1.54
1.02
4.45
3.17
2.55
1.68
Open-weight Foundation Models
DeepSeek 3.2
0.55
0.40
0.29
0.17
1.18
0.73
0.52
0.30
Qwen 3.5
1.91
1.54
1.26
0.81
3.61
2.61
2.07
1.29
Kimi K2.5
1.98
1.61
1.35
0.88
3.84
2.67
2.11
1.33
GLM-5
1.76
1.40
1.11
0.66
3.12
2.11
1.61
0.96
Conventional SSRS Models
LocalRetro
2.38
2.11
1.84
1.41
4.88
3.49
2.87
2.02
GLN
2.26
1.94
1.68
1.21
4.86
3.35
2.71
1.76
MEGAN
2.34
1.95
1.61
1.09
4.85
3.34
2.67
1.72
Chemformer
2.01
1.16
0.78
0.40
4.73
1.73
1.05
0.52
Graph2Edits
2.38
2.05
1.73
1.22
4.86
3.18
2.46
1.55
MHNreact
2.33
2.08
1.82
1.44
4.90
3.48
2.89
2.12
RetroKNN
2.35
2.11
1.82
1.41
4.90
3.53
2.91
2.04
R-SMILES
2.35
2.09
1.79
1.30
4.90
3.54
2.89
1.95
Table 7: Plausibility-based evaluation in the single-step retrosynthesis Top-K mode. Max: per-target maximum ChemCensor score averaged over TMs. Av. PT-Top-K CC: per-TM average ChemCensor score over top-K unique predictions; ChemCensor v0.5.2.
Model
URSA-expert-2026
USPTO-50K-test-mini
Max
Av. PT-Top-K CC
Max
Av. PT-Top-K CC
@3
@5
@10
@3
@5
@10
Proprietary Foundation Models
Grok-4.1
1.90
1.59
1.33
0.88
4.04
2.71
2.13
1.33
Grok-4.3
1.80
1.45
1.16
0.69
4.02
2.65
2.03
1.22
Gemini 3.1 Pro
1.96
1.72
1.49
1.11
4.35
2.97
2.42
1.66
GPT 5.1
0.61
0.35
0.23
0.12
1.31
0.72
0.48
0.25
GPT 5.2
0.43
0.28
0.20
0.12
1.53
0.92
0.65
0.36
GPT 5.4
1.23
0.81
0.57
0.30
2.40
1.50
1.08
0.59
GPT 5.5
1.98
1.71
1.48
1.08
4.51
3.15
2.55
1.72
Claude Sonnet 4.5
1.59
1.29
1.02
0.60
3.21
2.10
1.58
0.93
Claude Sonnet 4.6
1.04
0.79
0.61
0.35
2.98
1.92
1.42
0.81
Claude Opus 4.5
1.70
1.34
1.07
0.65
3.37
2.28
1.75
1.06
Claude Opus 4.6
1.73
1.39
1.13
0.70
3.82
2.61
2.02
1.23
Claude Opus 4.7
1.95
1.68
1.42
0.97
4.37
3.04
2.40
1.53
Claude Opus 4.8
1.93
1.66
1.38
0.88
4.37
3.03
2.40
1.51
Open-weight Foundation Models
DeepSeek 3.2
0.51
0.35
0.24
0.13
0.99
0.60
0.42
0.23
Qwen 3.5
1.63
1.33
1.07
0.64
3.49
2.46
1.92
1.16
Kimi K2.5
1.73
1.42
1.16
0.71
3.72
2.51
1.94
1.17
GLM-5
1.50
1.20
0.93
0.52
2.93
1.92
1.44
0.83
Conventional SSRS Models
LocalRetro
2.14
1.87
1.61
1.23
4.82
3.35
2.73
1.88
GLN
1.97
1.73
1.50
1.04
4.81
3.23
2.58
1.66
MEGAN
2.03
1.76
1.50
1.01
4.82
3.26
2.59
1.67
Chemformer
1.77
1.02
0.68
0.35
4.70
1.73
1.05
0.53
Graph2Edits
2.11
1.81
1.54
1.09
4.80
3.12
2.40
1.51
MHNreact
2.08
1.86
1.63
1.28
4.84
3.34
2.75
1.98
RetroKNN
2.13
1.86
1.62
1.23
4.84
3.37
2.75
1.90
R-SMILES
2.10
1.87
1.64
1.24
4.87
3.51
2.86
1.95
왜 중요한가
역합성 예측은 신약 후보 물질을 실제 실험실에서 만들 수 있는지 미리 걸러내는 핵심 도구이므로, AI가 이 작업을 더 다양하고 신뢰성 있게 해낼수록 신약 개발 초기 단계의 시행착오를 줄일 수 있다. 또한 AI 모델과 기존 화학 소프트웨어가 서로 다른 반응 경로를 찾아낸다는 사실은, 두 방식을 조합해 쓰는 것이 앞으로 실무에서 더 나은 전략이 될 수 있음을 시사한다.
이 논문의 용어
역합성(Retrosynthesis) · 목표 화합물에서 출발해 원료 물질까지 거꾸로 분해 경로를 찾는 화학 분석법
Top-K 프롬프팅 · AI에게 정답 하나가 아니라 서로 다른 답 여러 개를 한 번에 요청하는 방식
ChemCensor · 생성된 화학반응이 실제로 타당한지 점수로 평가하는 도구
GRPO (Group Relative Policy Optimization) · 여러 후보 답변을 그룹으로 비교해 더 나은 답을 하도록 AI를 강화학습시키는 기법
SMILES · 분자 구조를 문자열로 표현하는 화학 표기법
본문에 싣지 못한 그림
Figure 1: Comparison of representative top-performing models from each model tier, normalized by metric-specific frontier scores.
Figure 2: Data-generation pipeline for the CREED-CCV-2+USPTO-XL training set.
Figure 3: Top-1 → Top-K transition on URSA-expert-2026 (Av. PT-Top-10 CC). Hollow = Top-1 task, filled = Top-K task; line length is the gain Δ=Top-K−Top-1 (right column, sorted).
Figure 4: Intersection between the reactions predicted for the URSA-expert-2026 benchmark set by each LLM and those predicted by MHNreact. Values on the right (Δ) show the average per-target difference between the number of reactions unique to the LLM and those unique to MHNreact; positive values indicate more LLM-unique reactions. C3LM-2: C3LM-LFM2-CREED-CCV+USPTO; C3LM-3: C3LM-LFM2-CREED-CCV-2+USPTO-XL; C3LM-5: C3LM-LFM2-RFT-CC-NR. See all results in Figure 5.
Figure 5: Intersection of reactions predicted by LLMs and the conventional SSRS model MHNreact. Values on the right show the difference between the number of reactions unique to the model and those unique to MHNreact (model − MHNreact). C3LM-1: C3LM-LFM2-CREED-CCV+USPTO*; C3LM-2: C3LM-LFM2-CREED-CCV+USPTO; C3LM-3: C3LM-LFM2-CREED-CCV-2+USPTO-XL; C3LM-4: C3LM-LFM2-RFT-CC; C3LM-5: C3LM-LFM2-RFT-CC-NR.
Figure 6: Intersection of reactions predicted for X404-1768-5005 by C3LM-LFM2-CREED-CCV-2+USPTO-XL and MHNreact.
Figure 7: Distribution of the number of reactant sets for products from USPTO-50K-test-mini. For each product, all reference reactant sets were retrieved by matching it against USPTO-full.