그리스어로 생각하는 AI 모델을 만들어보니, 정확도 점수는 거의 의미가 없었다
그리스어로 생각하는 AI 모델을 만들어보니, 정확도 점수는 거의 의미가 없었다
연구자는 Alibaba, OpenAI, NVIDIA가 만든 세 개의 대형 AI 모델을 그리스어로 추론하도록 미세조정했다. 그런데 정확도 점수만 보면 별 차이가 없었고, 심지어 무작위 시드값만 바꿔도 점수가 7.7점이나 흔들려서 그동안 측정한 어떤 데이터·훈련법 효과보다 컸다. 진짜 변화는 정확도로는 안 보이는 곳, 즉 모델이 어떤 언어로 생각하는지, 얼마나 효율적으로 생각하는지에 있었다.
METAL MEDIA 해설 도표
그리스어로 생각하는 AI 모델을 만들어보니, 정확도 점수는 거의 의미가 없었다
- 01원래 모델들은 그리스어 질문을 받아도 속으로는 전혀 그리스어로 생각하지 않았다(1000개 중 0개). 답은 맞히지만 사용자가 읽거나 검증할 수 없는 형태로 사고 과정이 진행된 셈이다.
- 02지도미세조정(SFT, 정답이 붙은 예시로 모델을 추가 학습시키는 방법)을 거치자 네 개 모델 모두 약 98%의 문제에서 질문 언어(그리스어)로 사고하게 되었고, 문법 품질도 좋아졌으며 다른 능력은 거의 잃지 않았다.
- 03SFT가 못 고치는 결함도 있었다: 답의 4분의 1은 요청된 형식을 건너뛰었고, 답이 사고 과정 칸으로 새어나갔으며, '영어로 생각해'라는 명시적 지시도 절반 이하로만 지켜졌다.
- 04검증 가능한 보상을 이용한 강화학습(RLVR)을 훈련 전에 미리 설계해 적용하자 형식 무시 문제(24%→2.5%)와 답 누출 문제(3.5%→0%)는 확실히 고쳐졌고, 영어 지시 순응도도 개선됐다. 다만 그리스어로 생각하는 습관은 정확도만 노리는 학습으로는 바뀌지 않았다.
- 05연구팀은 다섯 개의 모델 체크포인트를 공개했고, 이 측정·검증 방법은 그리스어뿐 아니라 다른 자원 부족 언어에도 적용 가능하다.
무엇을 했나
- 원래 모델들은 그리스어 질문을 받아도 속으로는 전혀 그리스어로 생각하지 않았다(1000개 중 0개). 답은 맞히지만 사용자가 읽거나 검증할 수 없는 형태로 사고 과정이 진행된 셈이다.
- 지도미세조정(SFT, 정답이 붙은 예시로 모델을 추가 학습시키는 방법)을 거치자 네 개 모델 모두 약 98%의 문제에서 질문 언어(그리스어)로 사고하게 되었고, 문법 품질도 좋아졌으며 다른 능력은 거의 잃지 않았다.
- SFT가 못 고치는 결함도 있었다: 답의 4분의 1은 요청된 형식을 건너뛰었고, 답이 사고 과정 칸으로 새어나갔으며, '영어로 생각해'라는 명시적 지시도 절반 이하로만 지켜졌다.
- 검증 가능한 보상을 이용한 강화학습(RLVR)을 훈련 전에 미리 설계해 적용하자 형식 무시 문제(24%→2.5%)와 답 누출 문제(3.5%→0%)는 확실히 고쳐졌고, 영어 지시 순응도도 개선됐다. 다만 그리스어로 생각하는 습관은 정확도만 노리는 학습으로는 바뀌지 않았다.
- 연구팀은 다섯 개의 모델 체크포인트를 공개했고, 이 측정·검증 방법은 그리스어뿐 아니라 다른 자원 부족 언어에도 적용 가능하다.

| lab | base model | total | active | routing | fine-tuned release |
|---|---|---|---|---|---|
| Alibaba | Qwen3.6-35B-A3B | 36.0B | 3.97B | 8 of 256 | Sophea-Qwen3.6-v1 |
| OpenAI | Gpt-OSS-20B | 20.9B | 3.60B | 4 of 32 | Sophea-OSS-v1 |
| NVIDIA | NemotronH-30B-A3B | 31.6B | 3.58B | 6 of 128 | Sophea-Nemo-3-Nano-v1 |
| NVIDIA | Nemotron-3.5-Lightning-30B-A3B | 31.6B | 3.58B | 6 of 128 | Sophea-Nemo-3.5-Lightning-v1 |

| domain (reasoning half) | rows | share |
|---|---|---|
| mathematics | 22,608 | 38.2% |
| science | 11,064 | 18.7% |
| world knowledge | 5,884 | 10.0% |
| deductive logic | 5,151 | 8.7% |
| medical | 4,898 | 8.3% |
| commonsense | 3,904 | 6.6% |
| reading comprehension | 3,828 | 6.5% |
| physics | 1,770 | 3.0% |

| name | trained on | rows |
|---|---|---|
| Base | nothing (the released model) | — |
| Reasoning | reasoning rows only | 59,107 |
| Subset | a subset of the same rows | 15,607 |
| Two-Phase | reasoning rows, then + the direct half | 59,107+ |
| One-Phase | one pass over both halves at once | 59,107+ |

| seed | mean | logic | fallback | trace Greek |
|---|---|---|---|---|
| 42 | 76.2 | 56.2 | 10% | 1.00 |
| 43 | 68.7 | 35.6 | 41% | 1.00 |
| 44 | 76.4 | 54.0 | 3% | 1.00 |

| phase-1 rows | selection | mean |
|---|---|---|
| 62,562 | all | 69.5 |
| 15,607 | top-by-structure | 69.5 |
| 15,607 | uniform random | 69.0 |

| anchored accuracy | fallback % | |||||
|---|---|---|---|---|---|---|
| arm | math | cs | logic | math | cs | logic |
| ↑ higher is better | ↓ lower is better | |||||
| Qwen base (Greek think) | 92.9 | 82.4 | 42.6 | 3.3 | 0.5 | 0.2 |
| Sophea-Qwen3.6-v1 | 83.3 | 75.8 | 37.3 | 18.2 | 22.9 | 46.3 |
| Gpt-OSS base (Greek think) | 90.7 | 63.2 | 32.2 | 2.4 | 5.2 | 0.7 |
| before repair (reference) | 74.6 | 53.7 | 25.2 | 34.9 | 83.5 | 77.4 |
| Sophea-OSS-v1 (repaired) | 78.6 | 53.3 | 26.5 | 17.2 | 25.7 | 50.9 |
| NemotronH base (Greek think) | 86.6 | 49.2 | 26.8 | 8.3 | 6.2 | 6.6 |
| Sophea-Nemo-3-Nano-v1 | 71.5 | 39.7 | 9.8 | 1.7 | 1.8 | 39.9 |
| Nemotron-3.5 base (Greek think) | 76.9 | 46.3 | 25.0 | 1.4 | 1.9 | 4.4 |
| Sophea-Nemo-3.5-Lightning-v1 | 75.6 | 40.9 | 23.8 | 16.1 | 14.7 | 5.3 |

| Greek fid. | EN ctrl | switches | leak | |
|---|---|---|---|---|
| arm | (%)↑ | (%)↑ | /100 sent.↓ | (%)↓ |
| Qwen base | 0.0 | 100 | 16.4 | 15.6 |
| Qwen lang-matched | 98.0 | 100 | 0.0 | 3.5 |
| Qwen one-dir.† | 98.7 | 99.3§ | 0.0 | 1.5 |
| Gpt-OSS base | 0.0 | 100 | 9.7 | 0.5 |
| Gpt-OSS lang-matched | 98.1 | 100‡ | 0.0 | 10.3 |
| Nemotron-3.5 lang-matched | 98.1 | 100 | 0.0 | 5.2 |
| NemotronH lang-matched | 97.4 | 100 | 0.0 | 0.0 |
| NemotronH one-dir.† | 98.4 | 100 | 0.0 | 11.3 |

| recipe | mean | empty | fallback |
|---|---|---|---|
| One-Phase | 66.1 | 23.6% | 12% |
| Two-Phase | 64.4–69.9 | 0.0–1.3% | 33–40% |
| reasoning-only | 73.6 | 0.0% | 2–12% |

| arm | human | machine | Δ |
|---|---|---|---|
| Base | 95.6 | 90.7 | −4.9 (−3.14σ) |
| Subset | 94.0 | 95.1 | +1.1 |
| Reasoning | 93.6 | 95.3 | +1.7 |
| Two-Phase | 87.6 | 90.4 | +2.8 |

| model, instruction | English traces | Greek traces |
|---|---|---|
| base, “reason in English” | 100.0% | 0.0% |
| base, “reason in Greek” | 72.0% | 0.0% |
| fine-tune, “reason in English” | 0.0% | 98.7% |
| fine-tune, “reason in Greek” | 0.0% | 98.7% |
| matched ft, “reason in English” | 44.8% | 24.8% |
| matched ft, “reason in Greek” | 0.0% | 98.5% |

| released checkpoint | “in English”↑ | “in Greek”↑ |
|---|---|---|
| (Greek Q) | (English Q) | |
| Sophea-Qwen3.6-v1 | 44.8% | 83.7% |
| Sophea-Qwen3.6-v1.1 (RLVR) | 53.9% | 85.7% |
| Sophea-OSS-v1 | 62.5% | 93.3% |
| Sophea-Nemo-3.5-Lightning-v1 | 0.0% | 92.7% |
| Sophea-Nemo-3-Nano-v1 | 0.0% | 87.5% |
| one-directional (reference) | 0.0% | 91.4% |
| arm (n=1,100) | accuracy | reasons in EN |
|---|---|---|
| Qwen base / ft | 94.0 / 96.2 | 100% / 100% |
| Gpt-OSS base / ft | 95.5 / 96.1 | 100% / 100% |
| NemotronH base / ft | 92.7 / 93.7 | 100% / 100% |
| Qwen language-matched | 94.4 | 100% |
| Gpt-OSS language-matched | 91.9 | 100% |
| Greek macro | base | language-matched | + format repair |
|---|---|---|---|
| Gpt-OSS | 61.2 | 53.9 | 58.0 |
| macro deltas vs base (points): | |||
| Sophea-Qwen3.6-v1 | −0.01 Greek / +0.08 English | ||
| Sophea-OSS-v1 | −3.2 Greek / +1.0 English† | ||
| Sophea-Nemo-3-Nano-v1 | +3.8 Greek / −2.0 English | ||
| Sophea-Nemo-3.5-Lightning-v1 | +1.7 Greek / −1.1 English |
| Qwen | Gpt-OSS | Nemotron | ||||||
|---|---|---|---|---|---|---|---|---|
| benchmark | base | ft | base | ft | Nano base | Nano ft | Ltng. base | Ltng. ft |
| Greek (nine benchmarks, the Greek macro of Table 13): | ||||||||
| ARC-Challenge-el | 91.8 | 92.0 | 77.1 | 68.6 | 54.2 | 59.0 | 68.7 | 72.8 |
| ARC-Easy-el | 96.9 | 97.1 | 85.4 | 79.9 | 62.3 | 70.1 | 75.8 | 81.4 |
| Belebele-el | 92.7 | 93.7 | 86.0 | 81.3 | 67.0 | 78.0 | 81.3 | 83.3 |
| GreekMMLU | 83.8 | 83.0 | 66.3 | 61.3 | 58.8 | 53.3 | 64.2 | 62.2 |
| HellaSwag-el | 57.6 | 59.4 | 42.9 | 52.1 | 39.2 | 47.6 | 44.5 | 51.2 |
| Medical-MCQA-el | 81.2 | 80.3 | 42.1 | 38.7 | 27.8 | 31.2 | 41.7 | 38.2 |
| TruthfulQA-el | 39.1 | 36.5 | 39.7 | 35.5 | 31.7 | 33.2 | 34.2 | 33.7 |
| Winogrande-el | 61.0 | 62.5 | 55.4 | 59.6 | 53.3 | 58.3 | 55.8 | 60.1 |
| MMLU-el | 76.9 | 76.2 | 55.5 | 45.4 | 43.2 | 40.8 | 51.3 | 49.6 |
| Greek macro | 75.7 | 75.6 | 61.2 | 58.0 | 48.6 | 52.4 | 57.5 | 59.2 |
| English retention (five benchmarks): | ||||||||
| ARC-Challenge | 96.1 | 95.7 | 90.0 | 86.8 | 88.3 | 82.2 | 92.0 | 89.1 |
| ARC-Easy | 99.1 | 99.1 | 96.0 | 95.7 | 96.2 | 93.4 | 97.8 | 96.4 |
| HellaSwag | 73.2 | 74.2 | 57.0 | 68.4 | 67.9 | 73.1 | 72.7 | 75.9 |
| Winogrande | 73.2 | 74.2 | 64.6 | 66.7 | 69.9 | 72.9 | 72.0 | 73.3 |
| MMLU | 83.9 | 82.6 | 70.8 | 65.8 | 69.9 | 60.5 | 75.8 | 69.7 |
| English macro | 85.1 | 85.2 | 75.7 | 76.7 | 78.4 | 76.4 | 82.0 | 80.9 |
| Supported by our evidence | basis |
|---|---|
| Drop the hybrid phase 2; train reasoning-only | +6.9 pp over 15 runs, p=0.0008 (§7); and the direct mode it sacrifices costs nothing measurable on direct-mode NLU (E3, §11) |
| Generate exploratory traces, not explanations | structure 0.27→0.68 on the same questions |
| Forbid formulaic openings in the generator | 24/24 identical openings without it |
| Report fallback% beside accuracy | separates reasoning from format compliance |
| Run the seed control before any ablation | 7.7 pp (§4) |
| Probe trace-language steerability per checkpoint | same recipe, four checkpoints, 62.5/44.8/0/0 (§10.1) |
| Keep a human-translated benchmark subset | caught a 3.1σ artifact (§8) |
| Test numeric normalisation in the target language’s own convention | 5 of 6 Greek-thousands answers scored wrong while right (§8.5) |
| Gate metrics on length correlation | removed 3 of our 7 |
| Fix format and leak defects with verifiable-reward RL, not more SFT data | fallback →2.5%, leak →0%, control flat, ∼78 GPU-h/arm (§15.1) |
| Run a random-reward control arm with any RLVR claim | it reproduced our baseline on every axis; without it, every gain here would be unattributable (§15.1) |
| NOT supported | why |
| A specific corpus version | five expansions, all inside the noise floor |
| A data-selection method | selection ≈ random, −0.5 pp (0.31σ) |
| A LoRA rank, stride, or epoch count | never varied; no evidence either way |
| A per-domain model choice | two of three per-domain score spreads exceed the seed range itself (§12) |
| Greek | fall- | override | reverse | |||
|---|---|---|---|---|---|---|
| arm | fid. %↑ | acc↑ | back %↓ | leak %↓ | el→EN %↑ | en→EL %↑ |
| SFT checkpoint (before) | 97.98 | 73.7 | 24.1 | 3.53 | 44.8 | 83.7 |
| random reward (control) | 98.06 | 74.0 | 22.1 | 3.61 | 44.1 | 83.8 |
| correct+format+term. | 98.22 | 77.2 | 2.5 | 0.00 | 48.8 | 84.7 |
| + language | 98.02 | 77.2 | 5.6 | 0.04 | 45.9 | 84.5 |
| + override | 98.27 | 77.0 | 2.8 | 0.02 | 53.9 | 85.7 |
왜 중요한가
저자원 언어로 AI를 서비스하려는 회사나 커뮤니티에게, '정확도 점수가 좋아졌다'는 흔한 주장이 실제로는 거의 근거가 없을 수 있다는 경고다. 대신 모델이 어떤 언어로 사고하는지, 토큰을 얼마나 쓰는지, 형식을 잘 지키는지 같은 구체적 행동 지표를 봐야 진짜 개선을 확인할 수 있다.
이 논문의 용어
- SFT (지도미세조정) · 정답이 달린 예시 데이터로 이미 학습된 모델을 추가로 훈련시켜 특정 행동을 하도록 만드는 방법
- RLVR (검증 가능한 보상 기반 강화학습) · 정답 여부를 자동으로 확인할 수 있는 보상 신호를 이용해 모델을 추가로 훈련시키는 강화학습 방식
- MoE (전문가 혼합 모델) · 전체 파라미터 중 일부 '전문가' 부분만 골라 쓰는 구조로, 큰 모델을 싸게 서비스할 수 있게 해준다
- 시드(seed) · 훈련 시작 시 난수를 결정하는 값으로, 같은 설정이라도 시드가 다르면 결과가 달라질 수 있다
- 언어 충실도(language fidelity) · 모델이 사고 과정을 실제로 요청된 언어로 작성하는 정도
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다
- AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다
- AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다
METAL MEDIA 최신 기사
그림 출처: Ayoub Kirouane et al., arXiv:2608.17744, arxiv-nonexclusive