신소재 후보를 고를 때, 챗GPT 같은 AI가 전문 통계기법을 대신할 수 있을까 실험해봤다
신소재 후보를 고를 때, 챗GPT 같은 AI가 전문 통계기법을 대신할 수 있을까 실험해봤다
연구진은 값비싼 실험 없이도 좋은 신소재를 빨리 찾아야 하는 문제에서, 오픈소스 대형언어모델(LLM) 5종이 다음에 어떤 후보를 실험할지 스스로 고르게 해봤다. 무작위로 고르는 것보다는 훨씬 나았지만, 이 분야에서 오래 쓰여온 통계적 방법인 가우시안 프로세스보다는 대체로 못했다. 후보를 어떻게 나열해서 보여주는지, 소재 관련 설명을 곁들이는지에 따라 성능이 크게 흔들려서, 아직은 안정적으로 믿고 쓰기는 이르다는 결론이다.
METAL MEDIA 해설 도표
신소재 후보를 고를 때, 챗GPT 같은 AI가 전문 통계기법을 대신할 수 있을까 실험해봤다
- 01강철, 자석 합금, 압전 세라믹 등 4가지 소재 최적화 문제에서 정답(최적 후보)을 찾는 실험을 재현하는 방식으로, Gemma·DeepSeek·Qwen 계열 등 5개 오픈소스 LLM이 매번 후보 목록 중 하나를 고르게 하고 몇 번 만에 최적값을 찾는지 측정했다
- 02후보를 한 번에 다 보여주는 방식과, 후보를 여러 조로 나눠 토너먼트처럼 승자를 뽑아 올라가는 방식(배치 토너먼트) 두 가지 제시 방법을 비교했다
- 03LLM은 무작위 선택보다는 항상 더 적은 시도로 정답을 찾았지만, 전통적인 통계기법인 가우시안 프로세스보다는 4개 과제 중 3개에서 뒤처졌고, 나머지 1개 과제에서만 앞서거나 비슷했다
- 04같은 LLM이라도 후보 목록의 순서, 배치 크기, 소재 관련 설명(원소 이름 등) 유무에 따라 성적이 크게 달라졌고, 특히 목록의 특정 위치에 있는 후보를 유독 자주 고르는 '위치 편향' 현상도 모델마다 다르게 나타났다
- 05LLM의 선택 패턴을 뜯어봤더니 가우시안 프로세스처럼 규칙적으로 탐색과 활용 사이를 오가는 방식이 아니라 훨씬 불규칙했다
무엇을 했나
- 강철, 자석 합금, 압전 세라믹 등 4가지 소재 최적화 문제에서 정답(최적 후보)을 찾는 실험을 재현하는 방식으로, Gemma·DeepSeek·Qwen 계열 등 5개 오픈소스 LLM이 매번 후보 목록 중 하나를 고르게 하고 몇 번 만에 최적값을 찾는지 측정했다
- 후보를 한 번에 다 보여주는 방식과, 후보를 여러 조로 나눠 토너먼트처럼 승자를 뽑아 올라가는 방식(배치 토너먼트) 두 가지 제시 방법을 비교했다
- LLM은 무작위 선택보다는 항상 더 적은 시도로 정답을 찾았지만, 전통적인 통계기법인 가우시안 프로세스보다는 4개 과제 중 3개에서 뒤처졌고, 나머지 1개 과제에서만 앞서거나 비슷했다
- 같은 LLM이라도 후보 목록의 순서, 배치 크기, 소재 관련 설명(원소 이름 등) 유무에 따라 성적이 크게 달라졌고, 특히 목록의 특정 위치에 있는 후보를 유독 자주 고르는 '위치 편향' 현상도 모델마다 다르게 나타났다
- LLM의 선택 패턴을 뜯어봤더니 가우시안 프로세스처럼 규칙적으로 탐색과 활용 사이를 오가는 방식이 아니라 훨씬 불규칙했다
| Task | Candidates | Features | Target |
|---|---|---|---|
| Kerr Rotation | 921 | 3 | Kerr rotation (mrad) |
| Coercivity | 921 | 3 | coercivity (mT) |
| Matbench Steels | 312 | 14 | yield strength (MPa) |
| Electrostrain | 81 | 15 | electrostrain (%) |
| Model | Kerr Rotation | Coercivity | Matbench Steels | Electrostrain |
|---|---|---|---|---|
| Random | 462.48 ± 262.24 | 448.09 ± 269.63 | 159.31 ± 91.28 | 39.89 ± 23.00 |
| GP-EI | 8.40 ± 2.78 | 91.80 ± 62.77 | 42.72 ± 27.24 | 18.48 ± 14.53 |
| Whole-pool selection | ||||
| Gemma4 | 31.28 ± 17.24 | 209.88 ± 134.05 | 44.16 ± 23.36 | 14.36 ± 7.71 |
| Qw27B | 27.08 ± 13.59 | 195.20 ± 114.39 | 48.24 ± 23.43 | 19.44 ± 10.40 |
| Qw35B | 45.72 ± 20.28 | 289.88 ± 127.44 | 50.36 ± 24.89 | 27.64 ± 18.15 |
| Qw397B | 23.48 ± 10.40∗ | 258.24 ± 151.68∗ | 53.32 ± 32.90∗ | 16.84 ± 5.93 |
| DS | 110.64 ± 85.31 | 236.28 ± 210.72 | 87.60 ± 52.10 | 13.88 ± 9.98 |
| Batch-tournament (b=20) | ||||
| Gemma4 | 13.12 ± 5.12 | 389.64 ± 92.00 | 78.08 ± 49.83 | 14.80 ± 6.50 |
| Qw27B | 14.28 ± 7.33 | 468.64 ± 50.68 | 64.52 ± 32.94 | 18.04 ± 5.33 |
| Qw35B | 22.00 ± 8.73 | 379.80 ± 110.27 | 52.68 ± 20.12 | 20.36 ± 9.89 |
| Qw397B | 14.48 ± 7.54 | 178.80 ± 82.87† | 81.96 ± 41.10 | 15.08 ± 6.92 |
| DS | 16.88 ± 5.52 | 241.84 ± 52.10 | 32.88 ± 31.71 | 12.36 ± 4.71 |
| Electrostrain | Matbench Steels | Coercivity | Kerr Rotation | |||||
|---|---|---|---|---|---|---|---|---|
| Models | Whole | Batch | Whole | Batch | Whole | Batch | Whole | Batch |
| Gemma4 | 0.998 | 2.27 | 1.02 | 2.11 | 1.60 | 2.08 | 2.21 | 2.02 |
| DS | 1.36 | 2.29 | 1.47 | 2.13 | 2.48 | 2.35 | 2.60 | 2.15 |
| Qw27B | 0.929 | 2.10 | 0.852 | 2.04 | 2.18 | 2.06 | 2.17 | 2.04 |
| Qw35B | 1.26 | 2.20 | 0.747 | 2.12 | 1.67 | 2.24 | 2.77 | 2.08 |
| Qw397B | 1.04 | 2.20 | 1.36∗ | 2.08 | – | 1.84† | – | 2.06 |
| Model | Random | GP-EI | Whole-pool | Generation-and-matching |
|---|---|---|---|---|
| Qw27B | 159.31 ± 91.28 | 42.72 ± 27.24 | 48.24 ± 23.43 | 123.60 ± 63.60 |
| Gemma4 | 44.16 ± 23.36 | 48.80 ± 26.14 |

왜 중요한가
신소재 개발처럼 시험 한 번에 비용과 시간이 많이 드는 분야에서, 별도의 훈련 없이 범용 AI 모델만으로 다음 실험 대상을 고를 수 있는지는 실무적으로 큰 의미가 있다. 다만 이번 연구는 그 가능성과 한계를 동시에 보여주므로, 지금 단계에서 LLM을 실제 소재 탐색 파이프라인에 무작정 투입하기보다는 신중한 검증이 필요함을 시사한다.
이 논문의 용어
- 능동학습(Active Learning) · 적은 수의 관측 결과를 보고 다음에 어떤 데이터를 확인할지 스스로 정하는 학습 방식
- 가우시안 프로세스(Gaussian Process, GP) · 불확실성까지 함께 예측해주는 확률적 통계 모델로, 신소재 탐색에서 널리 쓰이는 대표적 기법
- 획득 함수(Acquisition Function) · 다음에 어떤 후보를 실험할지 점수를 매겨 결정하는 규칙, 대표적으로 기대개선량(EI)이 있다
- 오픈웨이트(Open-weight) LLM · 모델 내부 가중치가 공개되어 누구나 내려받아 실행할 수 있는 대형언어모델
- 위치 편향(Position Bias) · AI가 목록에서 특정 위치(예: 맨 앞)에 있는 항목을 실제 중요도와 상관없이 더 자주 고르는 경향
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다
- AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다
- AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다
METAL MEDIA 최신 기사
그림 출처: Dino-Rober Demir et al., arXiv:2608.19790, CC BY 4.0