인도 동북부 9개 소수언어를 위해 처음부터 만든 언어모델, 대형 다국어 모델보다 훨씬 잘 이해한다
arXiv:2608.180942026-08-20
NE-BERT: A Multilingual Language Model for Nine Northeast Indian Languages
인도 동북부 9개 소수언어를 위해 처음부터 만든 언어모델, 대형 다국어 모델보다 훨씬 잘 이해한다
MWire Labs 소속 연구자가 인도 동북부의 9개 토착 언어와 힌디어·영어를 합쳐 약 830만 문장으로 NE-BERT라는 언어모델을 학습시켰다. 문장이 1,002개뿐인 Pnar어처럼 극히 자료가 적은 언어까지 다루기 위해 데이터 비중을 조절하는 샘플링과 전용 토크나이저를 만들었다. 그 결과 기존의 IndicBERT-V2, MuRIL 같은 인도어 특화 모델보다 문장 예측 성능이 각각 15.97배, 7.64배 좋았다.
METAL MEDIA 해설 도표
인도 동북부 9개 소수언어를 위해 처음부터 만든 언어모델, 대형 다국어 모델보다 훨씬 잘 이해한다
01인도 동북부는 200개가 넘는 언어가 있는 지역이지만 기존 다국어 언어모델들은 이 지역 언어를 거의 다루지 않았다
02Assamese, Garo, Khasi, Meitei, Mizo, Naga, Nyishi, Pnar, Kokborok 9개 언어와 힌디어·영어를 합쳐 약 830만 문장을 모아 학습시켰고, 문장이 1,002개뿐인 Pnar어와 2,463개뿐인 Kokborok어는 토크나이저 학습 시 100배 가중치를 줘 어휘가 조각나 버리는 문제를 막았다
03단어를 잘게 쪼개는 방식으로 BPE 대신 SentencePiece Unigram이라는 방식을 골라 5만368개 토큰짜리 전용 토크나이저를 만들었고, 이는 mBERT보다 1.50배 효율적으로 단어를 나눴다
04품질을 재는 지표인 퍼플렉시티(낮을수록 예측을 잘함)에서 NE-BERT가 동북부 9개 언어 평균 2.21을 기록해 IndicBERT-V2의 35.29, MuRIL의 16.88보다 크게 앞섰고, 특히 Pnar어(66.92→기존 대비 개선), Nyishi어(187.20→기존 대비 개선) 같은 극저자원 언어에서 격차가 컸다
05품사 태깅이라는 실제 응용 과제에서도 Khasi, Mizo, Nagamese 세 언어 평균 정확도 82.4%로 mBERT보다 9.1%포인트, IndicBERT-V2보다 23.2%포인트 높았고, 단일 A40 GPU로 17시간, 7.31달러라는 적은 비용으로 학습을 마쳤다
METAL MEDIA이 원문을 바탕으로 재구성한 해설 도표이며, 논문 저자의 원문 figure가 아닙니다.
무엇을 했나
인도 동북부는 200개가 넘는 언어가 있는 지역이지만 기존 다국어 언어모델들은 이 지역 언어를 거의 다루지 않았다
Assamese, Garo, Khasi, Meitei, Mizo, Naga, Nyishi, Pnar, Kokborok 9개 언어와 힌디어·영어를 합쳐 약 830만 문장을 모아 학습시켰고, 문장이 1,002개뿐인 Pnar어와 2,463개뿐인 Kokborok어는 토크나이저 학습 시 100배 가중치를 줘 어휘가 조각나 버리는 문제를 막았다
단어를 잘게 쪼개는 방식으로 BPE 대신 SentencePiece Unigram이라는 방식을 골라 5만368개 토큰짜리 전용 토크나이저를 만들었고, 이는 mBERT보다 1.50배 효율적으로 단어를 나눴다
품질을 재는 지표인 퍼플렉시티(낮을수록 예측을 잘함)에서 NE-BERT가 동북부 9개 언어 평균 2.21을 기록해 IndicBERT-V2의 35.29, MuRIL의 16.88보다 크게 앞섰고, 특히 Pnar어(66.92→기존 대비 개선), Nyishi어(187.20→기존 대비 개선) 같은 극저자원 언어에서 격차가 컸다
품사 태깅이라는 실제 응용 과제에서도 Khasi, Mizo, Nagamese 세 언어 평균 정확도 82.4%로 mBERT보다 9.1%포인트, IndicBERT-V2보다 23.2%포인트 높았고, 단일 A40 GPU로 17시간, 7.31달러라는 적은 비용으로 학습을 마쳤다
Figure 2: Representative sentences from each Northeast Indian language in our corpus. For Bengali-Assamese script languages (Assamese, Meitei), both the original script and Latin transliterations (in italics) are shown.
Table 1: Corpus statistics showing sentence counts, token counts for NE languages, virtual counts after weighted sampling for tokenizer training, language families, and data sources.
Language
ISO
Sentences
Tokens
Virtual Count
Weight
Family
Source
Anchor Languages
Hindi
hin
3,404,007
—
170,200
0.05×
Indo-Aryan
HF Datasets
English
eng
500,000
—
100,000
0.2×
Germanic
HF Datasets
Northeast Indian Languages
Meitei
mni
1,354,323
42,504,181
1,354,323
1.0×
Sino-Tibetan
Curated
Assamese
asm
1,000,000
38,652,391
1,000,000
1.0×
Indo-Aryan
Curated
Khasi
kha
1,000,000
17,472,606
1,000,000
1.0×
Austroasiatic
Curated
Mizo
lus
1,000,000
26,774,164
1,000,000
1.0×
Sino-Tibetan
Curated
Nyishi
njz
55,870
560,374
1,117,400
20.0×
Sino-Tibetan
WMT 2025
Naga
nag
13,918
508,980
278,360
20.0×
Sino-Tibetan
Curated
Garo
grt
10,817
243,251
216,340
20.0×
Sino-Tibetan
Curated
Kokborok
trp
2,463
89,851
246,300
100.0×
Sino-Tibetan
WMT 2025
Pnar
pbv
1,002
52,144
100,200
100.0×
Austroasiatic
Curated
NE Total
4,438,393
126,857,942
Overall Total
8,342,400
—
6,583,123
Table 2: Model architecture comparison showing parameter counts, layer depth, hidden dimension, and attention heads.
Model
Params
Layers
Hidden
Heads
NE-BERT
149M
22
768
12
mBERT
110M
12
768
12
IndicBERT-V2
237M
12
1024
16
MuRIL
236M
24
1024
16
Table 3: Perplexity on 500-sentence test sets. NE-BERT achieves lowest average across all 9 NE languages.
Language
NE-BERT
IB-V2
MuRIL
mBERT
Assamese
1.76
9.01
5.62
1.65
Meitei
1.89
3.77
3.22
1.44
Khasi
1.27
2.40
1.93
1.36
Mizo
1.90
8.95
7.00
2.44
Garo
2.64
26.37
15.88
3.64
Kokborok
1.72
9.15
5.41
2.23
Pnar
2.92
66.92
39.65
5.30
Naga
1.49
3.83
3.39
1.81
Nyishi
4.33
187.20
75.80
6.05
English
1.55
14.81
5.57
2.64
Hindi
1.43
10.08
5.75
1.79
NE Avg.
2.21
35.29
16.88
2.77
Overall
2.17
31.14
15.38
2.76
Table 4: Tokenization fertility (tokens per word) across all 9 NE languages. Lower values indicate more efficient tokenization. NE-BERT achieves lowest average fertility across NE languages.
Language
NE-B
IB-V2
MuRIL
mB
Assamese
1.63
1.61
1.72
3.80
Meitei
1.52
2.77
3.01
4.17
Khasi
1.31
1.77
1.78
1.78
Mizo
1.36
1.73
1.79
1.78
Garo
2.37
2.84
2.80
2.89
Kokborok
2.07
2.07
2.22
2.19
Pnar
1.61
1.69
1.69
1.67
Naga
1.56
1.93
1.77
1.97
Nyishi
1.67
2.34
2.44
2.36
NE Avg.
1.68
2.08
2.14
2.51
Table 5: Bits per character (BPC) across all 9 NE languages. Lower is better. NE-BERT achieves lowest average BPC.
Language
NE-B
IB-V2
MuR
mB
Assamese
0.230
0.880
0.731
0.442
Meitei
0.220
0.815
0.778
0.331
Khasi
0.092
0.445
0.336
0.158
Mizo
0.272
1.163
1.063
0.486
Garo
0.503
1.997
1.663
0.800
Kokborok
0.277
1.136
0.926
0.433
Pnar
0.680
2.795
2.446
1.092
Naga
0.171
0.709
0.594
0.321
Nyishi
0.789
3.763
3.231
1.306
English
0.190
0.862
0.558
0.328
Hindi
0.192
0.863
0.659
0.345
NE Avg.
0.359
1.545
1.307
0.597
Overall
0.347
1.497
1.271
0.590
Table 6: POS tagging accuracy (%) on test sets. NE-BERT outperforms all baselines across all languages.
Language
NE-BERT
mBERT
IB-V2
MuRIL
Khasi
87.7
82.3
80.1
61.2
Mizo
73.2
66.3
55.7
43.1
Nagamese
86.4
71.3
41.7
44.8
Average
82.4
73.3
59.2
49.7
왜 중요한가
이 연구는 자료가 거의 없는 소수언어도 대형 모델의 몸집을 키우는 대신 데이터 배분과 토큰화 방식을 정교하게 설계하면 훨씬 적은 비용으로도 잘 작동하는 언어모델을 만들 수 있음을 보여준다. 모델, 학습 코드, 데이터셋을 CC-BY-4.0으로 공개해 인도 동북부처럼 디지털 자원이 부족한 지역 언어 공동체가 직접 활용하고 연구를 이어갈 수 있는 발판이 된다.
이 논문의 용어
퍼플렉시티(Perplexity) · 언어모델이 다음 단어를 얼마나 잘 예측하는지 재는 지표로, 낮을수록 성능이 좋다
토큰화 fertility · 단어 하나를 몇 개의 조각(토큰)으로 나누는지 나타내는 값으로, 낮을수록 효율적이다
SentencePiece Unigram · 단어를 하위 단위로 쪼개는 방식 중 하나로, 확률 기반이라 문법 구조가 복잡한 언어에서 단어를 덜 망가뜨린다
가중 샘플링(weighted sampling) · 자료가 적은 언어에 인위적으로 더 큰 비중을 줘서 학습 데이터 불균형을 완화하는 방법