인도 등 글로벌 사우스 언어를 평가할 벤치마크는 이미 있는데, 그 결과를 믿고 정리해줄 '심판'이 없다
arXiv:2608.181172026-08-20
Position: AI Leaderboards Are Underserving the Global South: A Case Study from India
인도 등 글로벌 사우스 언어를 평가할 벤치마크는 이미 있는데, 그 결과를 믿고 정리해줄 '심판'이 없다
이 논문은 AI 리더보드가 인도, 아프리카, 아랍권 같은 글로벌 사우스를 제대로 대변하지 못하는 이유가 데이터 부족이 아니라 운영 방식의 문제라고 주장한다. IndicSUPERB, MILU, LAHAJA(인도), IrokoBench(아프리카), AlGhafa(아랍어) 같은 고품질 지역 벤치마크는 이미 존재하지만, 글로벌 리더보드들이 이를 채택하도록 강제하는 관리 체계가 없다. 저자들은 인도의 AI 실무자 82명을 대상으로 설문한 결과, 응답자 전원이 공식적인 거버넌스 체계를 원했고 64%는 정부가 아닌 독립기구가 이를 운영하길 원했다고 보고한다.
METAL MEDIA 해설 도표
인도 등 글로벌 사우스 언어를 평가할 벤치마크는 이미 있는데, 그 결과를 믿고 정리해줄 '심판'이 없다
01글로벌 벤치마크(MMLU, HuggingFace Open ASR Leaderboard 등)는 힌디어, 아랍어, 스와힐리어 같은 수억 명이 쓰는 언어를 사실상 빼놓고 유럽어 중심으로 구성돼 있다
02인도의 IndicSUPERB·MILU·LAHAJA, 아프리카의 IrokoBench, 아랍어의 AlGhafa처럼 품질 좋은 지역 벤치마크가 이미 나와 있지만 글로벌 리더보드는 이를 쓰지 않는다
03벤치마크를 만드는 사람과 그 위에서 자기 모델을 평가받는 사람이 겹치는 이해충돌(COI) 구조가 있어도, 이를 공개하거나 관리할 공식 정책이 없다
042025년 12월부터 2026년 3월까지 인도 AI 실무자 82명을 설문한 결과, 전원이 공식 거버넌스를 지지했고 64%는 비정부 독립기구 운영을, 68%는 사전 배제보다 이해관계 공개 방식을 선호했다
05저자들은 시장의 힘(고객 항의, 계약 압박)이 영어권에서는 오류를 고치게 만들지만 글로벌 사우스에는 그런 지렛대가 없어 문제가 방치된다고 지적하며, 기술이 아닌 제도적 해법(운영위원회, 이해충돌 공개, 이의제기 절차)이 필요하다고 주장한다
METAL MEDIA이 원문을 바탕으로 재구성한 해설 도표이며, 논문 저자의 원문 figure가 아닙니다.
무엇을 했나
글로벌 벤치마크(MMLU, HuggingFace Open ASR Leaderboard 등)는 힌디어, 아랍어, 스와힐리어 같은 수억 명이 쓰는 언어를 사실상 빼놓고 유럽어 중심으로 구성돼 있다
인도의 IndicSUPERB·MILU·LAHAJA, 아프리카의 IrokoBench, 아랍어의 AlGhafa처럼 품질 좋은 지역 벤치마크가 이미 나와 있지만 글로벌 리더보드는 이를 쓰지 않는다
벤치마크를 만드는 사람과 그 위에서 자기 모델을 평가받는 사람이 겹치는 이해충돌(COI) 구조가 있어도, 이를 공개하거나 관리할 공식 정책이 없다
2025년 12월부터 2026년 3월까지 인도 AI 실무자 82명을 설문한 결과, 전원이 공식 거버넌스를 지지했고 64%는 비정부 독립기구 운영을, 68%는 사전 배제보다 이해관계 공개 방식을 선호했다
저자들은 시장의 힘(고객 항의, 계약 압박)이 영어권에서는 오류를 고치게 만들지만 글로벌 사우스에는 그런 지렛대가 없어 문제가 방치된다고 지적하며, 기술이 아닌 제도적 해법(운영위원회, 이해충돌 공개, 이의제기 절차)이 필요하다고 주장한다
Table 1: Stakeholder Impact of Unreliable Leaderboards
Stakeholder
Impact in Multilingual AI Context
Governments
Select Automatic Speech Recognition (ASR) for citizen services using English-optimized metrics; deployed systems fail on regional dialects and code-switching111Alternating between two or more languages within a single utterance or conversation.
Enterprises
Choose customer service AI based on WER rankings that do not reflect local code-switching patterns (Hindi-English, Arabic-French, Spanglish)
Startups
Cannot benchmark regional language specialization against global models; investor due diligence relies on irrelevant metrics
Investors
May reference MMLU scores in due diligence; these do not predict regional language capability
Researchers
Publish on benchmarks that reward English optimization; local language work appears “lower performing”
End Users
Receive AI assistants that fail on agglutinative morphology, accents, and cultural context
Table 2: Existing Indic AI Benchmarks (non-exhaustive)
Benchmark
Type
Coverage
IndicSUPERB (Javed et al., 2023a)
ASR
Multi-language evaluation across clean, noisy, telephonic conditions
MILU (Verma et al., 2025)
LLM
Understanding across 8 domains with Indian context
IndicGenBench (Singh et al., 2024)
LLM
Generation evaluation across multiple Indian languages
Annual financial interests; submitted models; funding relationships; public register
Recusal
Decisions affecting own interests; methodology changes; affiliated disputes
Prohibited
Board cannot submit models; staff cannot hold equity; no consulting with evaluated entities
왜 중요한가
정부 조달, 기업의 AI 도입, 투자 판단이 모두 리더보드 순위를 참고하는데, 그 순위가 특정 언어권 사용자를 체계적으로 배제한 상태로 만들어진다면 실제 서비스 실패가 방치될 수 있다. 이 논문은 벤치마크 데이터를 더 만드는 것보다, 이미 있는 데이터를 신뢰성 있게 모으고 심사할 독립 기구를 만드는 것이 더 시급한 문제라고 짚는다.
이 논문의 용어
리더보드(leaderboard) · 여러 AI 모델의 벤치마크 점수를 모아 순위를 매겨 보여주는 플랫폼
이해충돌(Conflict of Interest, COI) · 순위에서 이득을 보는 쪽이 평가 방식 결정에도 관여하는 구조적 상황
글로벌 사우스(Global South) · 아시아, 아프리카, 중남미 등 상대적으로 개발도상국이 많은 지역을 통칭하는 표현
단어 오류율(Word Error Rate, WER) · 음성인식 결과와 정답 텍스트를 비교해 오류 비율을 계산하는 지표로, 원래 영어에 맞춰 설계됨
굿하트의 법칙(Goodhart's Law) · 어떤 지표가 목표가 되는 순간 그 지표는 더 이상 좋은 척도가 아니게 된다는 원칙