컴백부터 K-뷰티까지 — K-컬쳐의 모든 것을 메일로 받아보세요메일로 받아보기

METAL MEDIA

인도 등 글로벌 사우스 언어를 평가할 벤치마크는 이미 있는데, 그 결과를 믿고 정리해줄 '심판'이 없다

arXiv:2608.181172026-08-20

Position: AI Leaderboards Are Underserving the Global South: A Case Study from India

인도 등 글로벌 사우스 언어를 평가할 벤치마크는 이미 있는데, 그 결과를 믿고 정리해줄 '심판'이 없다

이 논문은 AI 리더보드가 인도, 아프리카, 아랍권 같은 글로벌 사우스를 제대로 대변하지 못하는 이유가 데이터 부족이 아니라 운영 방식의 문제라고 주장한다. IndicSUPERB, MILU, LAHAJA(인도), IrokoBench(아프리카), AlGhafa(아랍어) 같은 고품질 지역 벤치마크는 이미 존재하지만, 글로벌 리더보드들이 이를 채택하도록 강제하는 관리 체계가 없다. 저자들은 인도의 AI 실무자 82명을 대상으로 설문한 결과, 응답자 전원이 공식적인 거버넌스 체계를 원했고 64%는 정부가 아닌 독립기구가 이를 운영하길 원했다고 보고한다.

METAL MEDIA 해설 도표

인도 등 글로벌 사우스 언어를 평가할 벤치마크는 이미 있는데, 그 결과를 믿고 정리해줄 '심판'이 없다

  1. 01글로벌 벤치마크(MMLU, HuggingFace Open ASR Leaderboard 등)는 힌디어, 아랍어, 스와힐리어 같은 수억 명이 쓰는 언어를 사실상 빼놓고 유럽어 중심으로 구성돼 있다
  2. 02인도의 IndicSUPERB·MILU·LAHAJA, 아프리카의 IrokoBench, 아랍어의 AlGhafa처럼 품질 좋은 지역 벤치마크가 이미 나와 있지만 글로벌 리더보드는 이를 쓰지 않는다
  3. 03벤치마크를 만드는 사람과 그 위에서 자기 모델을 평가받는 사람이 겹치는 이해충돌(COI) 구조가 있어도, 이를 공개하거나 관리할 공식 정책이 없다
  4. 042025년 12월부터 2026년 3월까지 인도 AI 실무자 82명을 설문한 결과, 전원이 공식 거버넌스를 지지했고 64%는 비정부 독립기구 운영을, 68%는 사전 배제보다 이해관계 공개 방식을 선호했다
  5. 05저자들은 시장의 힘(고객 항의, 계약 압박)이 영어권에서는 오류를 고치게 만들지만 글로벌 사우스에는 그런 지렛대가 없어 문제가 방치된다고 지적하며, 기술이 아닌 제도적 해법(운영위원회, 이해충돌 공개, 이의제기 절차)이 필요하다고 주장한다
METAL MEDIA이 원문을 바탕으로 재구성한 해설 도표이며, 논문 저자의 원문 figure가 아닙니다.

무엇을 했나

  1. 글로벌 벤치마크(MMLU, HuggingFace Open ASR Leaderboard 등)는 힌디어, 아랍어, 스와힐리어 같은 수억 명이 쓰는 언어를 사실상 빼놓고 유럽어 중심으로 구성돼 있다
  2. 인도의 IndicSUPERB·MILU·LAHAJA, 아프리카의 IrokoBench, 아랍어의 AlGhafa처럼 품질 좋은 지역 벤치마크가 이미 나와 있지만 글로벌 리더보드는 이를 쓰지 않는다
  3. 벤치마크를 만드는 사람과 그 위에서 자기 모델을 평가받는 사람이 겹치는 이해충돌(COI) 구조가 있어도, 이를 공개하거나 관리할 공식 정책이 없다
  4. 2025년 12월부터 2026년 3월까지 인도 AI 실무자 82명을 설문한 결과, 전원이 공식 거버넌스를 지지했고 64%는 비정부 독립기구 운영을, 68%는 사전 배제보다 이해관계 공개 방식을 선호했다
  5. 저자들은 시장의 힘(고객 항의, 계약 압박)이 영어권에서는 오류를 고치게 만들지만 글로벌 사우스에는 그런 지렛대가 없어 문제가 방치된다고 지적하며, 기술이 아닌 제도적 해법(운영위원회, 이해충돌 공개, 이의제기 절차)이 필요하다고 주장한다
Table 1: Stakeholder Impact of Unreliable Leaderboards
StakeholderImpact in Multilingual AI Context
GovernmentsSelect Automatic Speech Recognition (ASR) for citizen services using English-optimized metrics; deployed systems fail on regional dialects and code-switching111Alternating between two or more languages within a single utterance or conversation.
EnterprisesChoose customer service AI based on WER rankings that do not reflect local code-switching patterns (Hindi-English, Arabic-French, Spanglish)
StartupsCannot benchmark regional language specialization against global models; investor due diligence relies on irrelevant metrics
InvestorsMay reference MMLU scores in due diligence; these do not predict regional language capability
ResearchersPublish on benchmarks that reward English optimization; local language work appears “lower performing”
End UsersReceive AI assistants that fail on agglutinative morphology, accents, and cultural context
Table 2: Existing Indic AI Benchmarks (non-exhaustive)
BenchmarkTypeCoverage
IndicSUPERB (Javed et al., 2023a)ASRMulti-language evaluation across clean, noisy, telephonic conditions
MILU (Verma et al., 2025)LLMUnderstanding across 8 domains with Indian context
IndicGenBench (Singh et al., 2024)LLMGeneration evaluation across multiple Indian languages
LAHAJA (Javed et al., 2024)DialectHindi regional accent evaluation
Vistaar (Bhogale et al., 2023)DomainNews, education, literary, conversational contexts
Svarah (Javed et al., 2023b)AccentIndian English L2 patterns and code-mixing
IISc-MILE (IISc Machine Intelligence and Language Engineering Lab(2024), MILE)MorphologyAgglutinative evaluation for Tamil and Kannada
Table 3: Stakeholder Consultation Key Findings (n=82, Dec 2025 – Mar 2026)
FindingScoreWhat it tells us
Overall viability4.06/5Community judges the proposal feasible
Endorse formal governance100%No respondent chose “no governance”
Non-government stewardship64%Nasscom + Independent NP, vs 21% govt., 9.8% academia
Conflict management68%Disclosure/recusal over exclusion
Anti-gaming strategy56%Dynamic evaluation, even at cost of reproducibility (5 abstentions; 60% of those who answered)
Evaluation method76%Hybrid (LLM + human)
Submission cadence74%Quarterly windows
Table 4: Board Composition and Terms
StakeholderShareConstraints
Academia30%Max 3 seats
Industry30%No company >1 seat
Government20%Observer or voting
Civil Society10%1 seat
International10%External perspective
Terms: 3 years (max 2 consecutive); Chair rotates; 2-year cooling-off period.
Table 5: Conflict of Interest Policy
CategoryRequirements
DisclosureAnnual financial interests; submitted models; funding relationships; public register
RecusalDecisions affecting own interests; methodology changes; affiliated disputes
ProhibitedBoard cannot submit models; staff cannot hold equity; no consulting with evaluated entities

왜 중요한가

정부 조달, 기업의 AI 도입, 투자 판단이 모두 리더보드 순위를 참고하는데, 그 순위가 특정 언어권 사용자를 체계적으로 배제한 상태로 만들어진다면 실제 서비스 실패가 방치될 수 있다. 이 논문은 벤치마크 데이터를 더 만드는 것보다, 이미 있는 데이터를 신뢰성 있게 모으고 심사할 독립 기구를 만드는 것이 더 시급한 문제라고 짚는다.

이 논문의 용어

  • 리더보드(leaderboard) · 여러 AI 모델의 벤치마크 점수를 모아 순위를 매겨 보여주는 플랫폼
  • 이해충돌(Conflict of Interest, COI) · 순위에서 이득을 보는 쪽이 평가 방식 결정에도 관여하는 구조적 상황
  • 글로벌 사우스(Global South) · 아시아, 아프리카, 중남미 등 상대적으로 개발도상국이 많은 지역을 통칭하는 표현
  • 단어 오류율(Word Error Rate, WER) · 음성인식 결과와 정답 텍스트를 비교해 오류 비율을 계산하는 지표로, 원래 영어에 맞춰 설계됨
  • 굿하트의 법칙(Goodhart's Law) · 어떤 지표가 목표가 되는 순간 그 지표는 더 이상 좋은 척도가 아니게 된다는 원칙

저자 · Sourav Banerjee, Saikat Saha

arXiv에서 원문 보기

최신 논문

논문 전체 보기 →

METAL MEDIA 최신 기사