부분점수를 잘못 계산하면 AI 성적이 부풀려진다: 베트남 수능 채점법으로 검증한 벤치마크 THPT-Ladder
부분점수를 잘못 계산하면 AI 성적이 부풀려진다: 베트남 수능 채점법으로 검증한 벤치마크 THPT-Ladder
베트남 2025년 고교 졸업시험은 4개의 참거짓 문장 중 맞힌 개수에 따라 0, 0.10, 0.25, 0.50, 1.00점을 주는 방식(비례가 아닌 계단식)으로 채점이 바뀌었다. 기존 AI 벤치마크들은 이런 채점 방식을 무시하고 단순 정답률만 매기는데, 이는 실제 정부가 인정하지 않는 실력을 부풀려 보고하는 셈이다. 연구진은 21개 실제 시험 632문항으로 THPT-Ladder를 만들어 8개 모델을 정부 채점 기준 그대로 평가했고, 정답률만으로는 실제 점수를 예측할 수 없음을 보였다.
METAL MEDIA 해설 도표
부분점수를 잘못 계산하면 AI 성적이 부풀려진다: 베트남 수능 채점법으로 검증한 벤치마크 THPT-Ladder
- 012025년 개정된 베트남 수능 2부는 문항당 4개의 참거짓 문장을 판단하게 하고, 맞힌 개수(0~4개)에 따라 0, 0.10, 0.25, 0.50, 1.00점을 주는 비례하지 않는 계단식 채점을 쓴다. 3개를 맞히면 0.75점이 아니라 0.50점만 받는다.
- 02이 2부가 전체 10점 만점 중 4점을 차지하는데, 기존 벤치마크처럼 문장 단위 정답률로 점수를 계산하면 정부가 실제로 주는 점수보다 항상 높게 나온다.
- 0321개 공식 시험, 11개 과목, 632문항으로 구성된 THPT-Ladder를 만들고 정부 발표 정답지와 채점 규칙을 그대로 적용했으며, 100만 명 넘는 실제 응시생 성적 분포와 비교해 모델 성적을 백분위로 환산했다.
- 048개 모델(오픈웨이트 3개, 폐쇄형 5개)을 평가한 결과, 정부 채점 방식은 비례 채점보다 문항당 0.020~0.159점 적게 줬다. 예컨대 Qwen3.5-27B는 2025년 역사 시험에서 이 차이 때문에 백분위 90위에서 77위로 떨어졌다.
- 05정답률이 같아도 오답이 어떻게 분산되는지에 따라 점수가 크게 달라졌다. Claude Sonnet 5와 같은 정답률 수준에서도 문항당 점수는 0.869점에서 0.932점까지 벌어질 수 있었다.
무엇을 했나
- 2025년 개정된 베트남 수능 2부는 문항당 4개의 참거짓 문장을 판단하게 하고, 맞힌 개수(0~4개)에 따라 0, 0.10, 0.25, 0.50, 1.00점을 주는 비례하지 않는 계단식 채점을 쓴다. 3개를 맞히면 0.75점이 아니라 0.50점만 받는다.
- 이 2부가 전체 10점 만점 중 4점을 차지하는데, 기존 벤치마크처럼 문장 단위 정답률로 점수를 계산하면 정부가 실제로 주는 점수보다 항상 높게 나온다.
- 21개 공식 시험, 11개 과목, 632문항으로 구성된 THPT-Ladder를 만들고 정부 발표 정답지와 채점 규칙을 그대로 적용했으며, 100만 명 넘는 실제 응시생 성적 분포와 비교해 모델 성적을 백분위로 환산했다.
- 8개 모델(오픈웨이트 3개, 폐쇄형 5개)을 평가한 결과, 정부 채점 방식은 비례 채점보다 문항당 0.020~0.159점 적게 줬다. 예컨대 Qwen3.5-27B는 2025년 역사 시험에서 이 차이 때문에 백분위 90위에서 77위로 떨어졌다.
- 정답률이 같아도 오답이 어떻게 분산되는지에 따라 점수가 크게 달라졌다. Claude Sonnet 5와 같은 정답률 수준에서도 문항당 점수는 0.869점에서 0.932점까지 벌어질 수 있었다.
- 무작위로 찍은 고정 응답 패턴(DDSS)조차 정답지의 불균형을 이용해 문제를 읽지 않고도 시험의 11.07%~24.25%를 획득할 수 있었다.
| structure | items | ||||||
|---|---|---|---|---|---|---|---|
| Subject | I | II | III | rnd | 2025 | 2026 | Fig. |
| Biology | 18 | 4 | 6 | 2.350 | 28 | 28 | 28 |
| Chemistry | 18 | 4 | 6 | 2.350 | 28 | 28 | 9 |
| Economics & Law | 24 | 4 | 0 | 2.725 | 28 | 28 | 0 |
| English | 40 | 0 | 0 | 2.500 | 40 | 40 | 0 |
| Geography | 18 | 4 | 6 | 2.350 | 28 | 28 | 8 |
| History | 24 | 4 | 0 | 2.725 | 28 | 28 | 1 |
| Informatics | 24 | 4a | 0 | 2.725 | 30 | 30 | 0 |
| Mathematics | 12 | 4 | 6 | 1.975 | 22 | 22 | 14 |
| Physics | 18 | 4 | 6 | 2.350 | 28 | 28 | 4 |
| Technology (Agri.) | 24 | 4 | 0 | 2.725 | 56 | 28 | 4 |
| Technology (Ind.) | 24 | 4 | 0 | 2.725 | 28 | n.p. | 12 |
| total | 632 items | 80 |
| Model | % avail. | I | II stmt | II pts/q | shf/q | III |
|---|---|---|---|---|---|---|
| Qwen3.5-27B | 93.8 | 0.973 | 0.926 | 0.884 | 0.042 | 0.917 |
| Qwen3.5-9B | 90.7 | 0.965 | 0.896 | 0.830 | 0.066 | 0.850 |
| InternVL3.5-8B | 69.3 | 0.838 | 0.756 | 0.597 | 0.159 | 0.183 |
| Claude Opus 5 | 97.0 | 0.988 | 0.973 | 0.949 | 0.024 | 0.950 |
| GPT-5.5 | 97.0 | 0.988 | 0.967 | 0.948 | 0.020 | 0.950 |
| Claude Sonnet 5 | 93.6 | 0.977 | 0.935 | 0.881 | 0.054 | 0.917 |
| Claude Opus 4.8 | 92.9 | 0.975 | 0.920 | 0.867 | 0.052 | 0.917 |
| Claude Haiku 4.5 | 82.9 | 0.934 | 0.842 | 0.735 | 0.108 | 0.567 |
왜 중요한가
AI 성능 평가에서 채점 방식을 단순화하면 실제로는 통과하지 못했을 시험을 통과한 것처럼 보이게 만들 수 있다. 시험 문제만 재사용하고 그 시험의 진짜 채점 규칙을 버리는 관행이 얼마나 성적을 왜곡하는지 구체적 수치로 보여준다는 점에서, AI 평가 방법론 전반에 시사점을 준다.
이 논문의 용어
- convex marking scheme(비선형/계단식 채점) · 맞힌 개수에 비례하지 않고, 특정 구간에서 점수가 확 뛰거나 낮게 눌리는 채점 방식
- partial-credit gap(부분점수 격차, shortfall) · 비례 채점으로 계산했을 때의 점수와 실제 계단식 채점 점수의 차이
- 백분위(percentile) · 실제 응시생 집단 중 몇 퍼센트보다 높은 점수를 받았는지 나타내는 순위 지표
- 오픈웨이트 모델(open-weight model) · 모델 가중치 파일을 공개해 누구나 내려받아 실행할 수 있는 AI 모델
- Decision 764 · 베트남 교육훈련부가 2025년 발표한, 고교 졸업시험의 새 문제 형식과 채점 규칙을 정한 공식 결정문
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다
- AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다
- AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다