올림피아드 기하 문제는 잘 푸는 AI들도 정작 그 문제의 도형은 제대로 못 그린다
올림피아드 기하 문제는 잘 푸는 AI들도 정작 그 문제의 도형은 제대로 못 그린다
연구진은 954개의 올림피아드 기하 문제 각각에 사람이 직접 만든 Asymptote 코드 기반 정답 도형을 짝지은 벤치마크를 만들어, AI 모델이 정답을 맞히는 것과 별개로 문제에 맞는 도형을 정확히 그릴 수 있는지 검증했다. Claude Sonnet 4.6, Gemini 3.1 Flash-lite, GPT-5.4-mini, Kimi K2.5, GLM 5.1을 테스트한 결과, 이 모델들이 AIME 2025 같은 문제 풀이 벤치마크에서는 거의 만점에 가까운 성적을 내는데도 생성한 도형 코드는 평균 36.14%만 정상적으로 컴파일되었고, 비전-언어 모델 심사위원이 매긴 기하학적 정확도 점수는 100점 만점에 46.58점에 그쳤다. 정답 풀이 전체를 함께 제공해도 코드 텍스트의 유사도만 올라갈 뿐 실제 그려지는 도형의 정확도는 개선되지 않았다.
METAL MEDIA 해설 도표
올림피아드 기하 문제는 잘 푸는 AI들도 정작 그 문제의 도형은 제대로 못 그린다
- 01기하 도형을 정밀하게 표현하도록 만들어진 코드 언어인 Asymptote로 작성된 사람 제작 정답 도형과 전체 풀이를 짝지은, 954개 문제(그중 297개는 더 어려운 부분집합)로 구성된 공개 데이터셋을 구축했다.
- 02다섯 개 모델을 두 조건에서 테스트했다: 문제만 주는 경우, 문제와 전체 정답 풀이를 함께 주는 경우, 두 경우 모두 모델이 도형을 그리는 Asymptote 코드를 출력하게 했다.
- 03텍스트·코드 겹침 점수(BLEU, CodeBLEU, ROUGE-L), 이미지 유사도 지표인 LPIPS, 비전-언어 모델을 심사위원으로 쓰는 방식, 그리고 코드가 실제로 컴파일되는지 확인하는 지표까지 여러 방식으로 평가했다.
- 04같은 모델들이 AIME 2025 문제 풀이에서는 87~100%의 성적을 내는데도, 생성한 도형 코드의 평균 컴파일 성공률은 36.14%에 불과했고 비전-언어 모델이 매긴 최고 점수도 100점 만점에 약 53점을 넘지 못했다.
- 05컴파일 성공률이 가장 높은 모델이 기하학적으로 가장 정확한 도형을 그리는 모델은 아니었으며, 정답 풀이를 제공하면 코드 텍스트 유사도는 올라가지만 실제 도형 정확도는 개선되지 않았다.
무엇을 했나
- 기하 도형을 정밀하게 표현하도록 만들어진 코드 언어인 Asymptote로 작성된 사람 제작 정답 도형과 전체 풀이를 짝지은, 954개 문제(그중 297개는 더 어려운 부분집합)로 구성된 공개 데이터셋을 구축했다.
- 다섯 개 모델을 두 조건에서 테스트했다: 문제만 주는 경우, 문제와 전체 정답 풀이를 함께 주는 경우, 두 경우 모두 모델이 도형을 그리는 Asymptote 코드를 출력하게 했다.
- 텍스트·코드 겹침 점수(BLEU, CodeBLEU, ROUGE-L), 이미지 유사도 지표인 LPIPS, 비전-언어 모델을 심사위원으로 쓰는 방식, 그리고 코드가 실제로 컴파일되는지 확인하는 지표까지 여러 방식으로 평가했다.
- 같은 모델들이 AIME 2025 문제 풀이에서는 87~100%의 성적을 내는데도, 생성한 도형 코드의 평균 컴파일 성공률은 36.14%에 불과했고 비전-언어 모델이 매긴 최고 점수도 100점 만점에 약 53점을 넘지 못했다.
- 컴파일 성공률이 가장 높은 모델이 기하학적으로 가장 정확한 도형을 그리는 모델은 아니었으며, 정답 풀이를 제공하면 코드 텍스트 유사도는 올라가지만 실제 도형 정확도는 개선되지 않았다.

| Method | GPT5.4-mini | Claude Sonnet 4.6 | Gemini 3.1 Flash-lite | Kimi K 2.5 | Glm 5.1 | |||||
|---|---|---|---|---|---|---|---|---|---|---|
| With | Without | With | Without | With | Without | With | Without | With | Without | |
| Text/Code-Based Metrics | ||||||||||
| ↑ Keyword Match F1 | 55.4 | 51.4 | 55.9 | 52.8 | 47.4 | 42.1 | 49.4 | 47.9 | 54.6 | 51.5 |
| ↑ BLEU | 18.5 | 16.8 | 15.7 | 15.3 | 16.6 | 13.9 | 19.1 | 16.4 | 17.8 | 16.3 |
| ↑ chrF++ | 35.7 | 32.9 | 34.7 | 32.4 | 30.5 | 27.2 | 33.8 | 30.1 | 35.1 | 31.9 |
| ↑ CodeBLEU | 17.1 | 15.1 | 15.1 | 14.3 | 14.8 | 12.4 | 17.7 | 15.4 | 16.4 | 15.0 |
| ↑ ROUGE-L | 22.4 | 21.6 | 20.2 | 20.2 | 24.8 | 23.4 | 24.9 | 24.0 | 22.6 | 21.9 |
| Image-Based Metrics | ||||||||||
| ↓ LPIPS | 54.0 | 53.7 | 50.6 | 51.3 | 52.6 | 52.7 | 47.9 | 49.5 | 50.8 | 53.3 |
| VLM-as-a-Judge | ||||||||||
| ↑ VLM Critic | 37.9 | 46.4 | 49.5 | 51.0 | 42.6 | 45.2 | 50.8 | 53.2 | 44.2 | 45.0 |
| Compilation Metrics | ||||||||||
| ↑ Compile Success Rate | 21.7 | 20.8 | 27.6 | 41.3 | 59.2 | 59.3 | 30.9 | 22.0 | 40.0 | 38.6 |

| Dataset | 1 | 2 | 3 | 4 | 5 | 6 | 7 | 8 | 9 | 10 | Total |
|---|---|---|---|---|---|---|---|---|---|---|---|
| AMC | 0 | 14 | 29 | 91 | 95 | 84 | 51 | 15 | 0 | 0 | 379 |
| AIME | 0 | 0 | 13 | 63 | 83 | 116 | 105 | 52 | 8 | 0 | 440 |
| USAJMO | 0 | 0 | 0 | 2 | 5 | 6 | 3 | 5 | 0 | 0 | 21 |
| USAMO | 0 | 0 | 1 | 3 | 3 | 5 | 14 | 15 | 6 | 1 | 48 |
| IMO | 0 | 0 | 0 | 0 | 1 | 1 | 3 | 1 | 2 | 0 | 8 |
| Others | 0 | 0 | 5 | 12 | 12 | 16 | 9 | 4 | 0 | 0 | 58 |
| Total | 0 | 14 | 48 | 171 | 199 | 225 | 188 | 92 | 16 | 1 | 954 |

왜 중요한가
많은 기하 문제는 도형을 제대로 그려야 풀이가 성립하기 때문에, 논리적으로는 맞게 추론하면서도 도형이 어긋나는 모델은 작도 검증이나 다른 도구에 도형을 넘기는 작업에서 신뢰하기 어렵다. 이는 수학 문제 풀이 점수가 높다고 해서 모델이 문제 뒤에 있는 기하학적 관계를 실제로 이해하거나 구성할 수 있는 것은 아니라는 점을 보여준다.

이 논문의 용어
- Asymptote · 기하학적 도형을 정밀하게 그리기 위해 설계된 프로그래밍 언어이자 벡터 그래픽 도구
- 비전-언어 모델(VLM) 심사위원 · 이미지와 텍스트를 함께 이해하는 모델을 심사위원처럼 사용해 결과물 품질을 점수로 매기는 평가 방식
- LPIPS · 두 이미지가 사람 눈에 얼마나 비슷하게 보이는지를 딥러닝 특징으로 측정하는 지표, 값이 낮을수록 유사함
- BLEU/CodeBLEU/ROUGE-L · 생성된 텍스트나 코드가 정답과 얼마나 겹치는지 단어·문자 단위로 비교하는 점수들
- 컴파일 성공률 · 생성된 코드가 오류 없이 실제 이미지로 렌더링되는 비율

본문에 싣지 못한 그림
- Figure 4: Overview of the Problems Filtered during the Dataset Curation Process. We web-scraped a total of 1441 raw datapoints, before filtering out the problems that were not geometric and not self-contained.
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다
- AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다
- AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다
METAL MEDIA 최신 기사
그림 출처: Hsien Xin Peng et al., arXiv:2608.18111, CC BY-SA 4.0