컴백부터 K-뷰티까지 — K-컬쳐의 모든 것을 메일로 받아보세요메일로 받아보기

METAL MEDIA

인도 동북부 9개 소수언어를 위해 처음부터 만든 언어모델, 대형 다국어 모델보다 훨씬 잘 이해한다

arXiv:2608.180942026-08-20

NE-BERT: A Multilingual Language Model for Nine Northeast Indian Languages

인도 동북부 9개 소수언어를 위해 처음부터 만든 언어모델, 대형 다국어 모델보다 훨씬 잘 이해한다

MWire Labs 소속 연구자가 인도 동북부의 9개 토착 언어와 힌디어·영어를 합쳐 약 830만 문장으로 NE-BERT라는 언어모델을 학습시켰다. 문장이 1,002개뿐인 Pnar어처럼 극히 자료가 적은 언어까지 다루기 위해 데이터 비중을 조절하는 샘플링과 전용 토크나이저를 만들었다. 그 결과 기존의 IndicBERT-V2, MuRIL 같은 인도어 특화 모델보다 문장 예측 성능이 각각 15.97배, 7.64배 좋았다.

METAL MEDIA 해설 도표

인도 동북부 9개 소수언어를 위해 처음부터 만든 언어모델, 대형 다국어 모델보다 훨씬 잘 이해한다

  1. 01인도 동북부는 200개가 넘는 언어가 있는 지역이지만 기존 다국어 언어모델들은 이 지역 언어를 거의 다루지 않았다
  2. 02Assamese, Garo, Khasi, Meitei, Mizo, Naga, Nyishi, Pnar, Kokborok 9개 언어와 힌디어·영어를 합쳐 약 830만 문장을 모아 학습시켰고, 문장이 1,002개뿐인 Pnar어와 2,463개뿐인 Kokborok어는 토크나이저 학습 시 100배 가중치를 줘 어휘가 조각나 버리는 문제를 막았다
  3. 03단어를 잘게 쪼개는 방식으로 BPE 대신 SentencePiece Unigram이라는 방식을 골라 5만368개 토큰짜리 전용 토크나이저를 만들었고, 이는 mBERT보다 1.50배 효율적으로 단어를 나눴다
  4. 04품질을 재는 지표인 퍼플렉시티(낮을수록 예측을 잘함)에서 NE-BERT가 동북부 9개 언어 평균 2.21을 기록해 IndicBERT-V2의 35.29, MuRIL의 16.88보다 크게 앞섰고, 특히 Pnar어(66.92→기존 대비 개선), Nyishi어(187.20→기존 대비 개선) 같은 극저자원 언어에서 격차가 컸다
  5. 05품사 태깅이라는 실제 응용 과제에서도 Khasi, Mizo, Nagamese 세 언어 평균 정확도 82.4%로 mBERT보다 9.1%포인트, IndicBERT-V2보다 23.2%포인트 높았고, 단일 A40 GPU로 17시간, 7.31달러라는 적은 비용으로 학습을 마쳤다
METAL MEDIA이 원문을 바탕으로 재구성한 해설 도표이며, 논문 저자의 원문 figure가 아닙니다.

무엇을 했나

  1. 인도 동북부는 200개가 넘는 언어가 있는 지역이지만 기존 다국어 언어모델들은 이 지역 언어를 거의 다루지 않았다
  2. Assamese, Garo, Khasi, Meitei, Mizo, Naga, Nyishi, Pnar, Kokborok 9개 언어와 힌디어·영어를 합쳐 약 830만 문장을 모아 학습시켰고, 문장이 1,002개뿐인 Pnar어와 2,463개뿐인 Kokborok어는 토크나이저 학습 시 100배 가중치를 줘 어휘가 조각나 버리는 문제를 막았다
  3. 단어를 잘게 쪼개는 방식으로 BPE 대신 SentencePiece Unigram이라는 방식을 골라 5만368개 토큰짜리 전용 토크나이저를 만들었고, 이는 mBERT보다 1.50배 효율적으로 단어를 나눴다
  4. 품질을 재는 지표인 퍼플렉시티(낮을수록 예측을 잘함)에서 NE-BERT가 동북부 9개 언어 평균 2.21을 기록해 IndicBERT-V2의 35.29, MuRIL의 16.88보다 크게 앞섰고, 특히 Pnar어(66.92→기존 대비 개선), Nyishi어(187.20→기존 대비 개선) 같은 극저자원 언어에서 격차가 컸다
  5. 품사 태깅이라는 실제 응용 과제에서도 Khasi, Mizo, Nagamese 세 언어 평균 정확도 82.4%로 mBERT보다 9.1%포인트, IndicBERT-V2보다 23.2%포인트 높았고, 단일 A40 GPU로 17시간, 7.31달러라는 적은 비용으로 학습을 마쳤다
Figure 2: Representative sentences from each Northeast Indian language in our corpus. For Bengali-Assamese script languages (Assamese, Meitei), both the original script and Latin transliterations (in italics) are shown.
Figure 2: Representative sentences from each Northeast Indian language in our corpus. For Bengali-Assamese script languages (Assamese, Meitei), both the original script and Latin transliterations (in italics) are shown.
Table 1: Corpus statistics showing sentence counts, token counts for NE languages, virtual counts after weighted sampling for tokenizer training, language families, and data sources.
LanguageISOSentencesTokensVirtual CountWeightFamilySource
Anchor Languages
Hindihin3,404,007170,2000.05×Indo-AryanHF Datasets
Englisheng500,000100,0000.2×GermanicHF Datasets
Northeast Indian Languages
Meiteimni1,354,32342,504,1811,354,3231.0×Sino-TibetanCurated
Assameseasm1,000,00038,652,3911,000,0001.0×Indo-AryanCurated
Khasikha1,000,00017,472,6061,000,0001.0×AustroasiaticCurated
Mizolus1,000,00026,774,1641,000,0001.0×Sino-TibetanCurated
Nyishinjz55,870560,3741,117,40020.0×Sino-TibetanWMT 2025
Naganag13,918508,980278,36020.0×Sino-TibetanCurated
Garogrt10,817243,251216,34020.0×Sino-TibetanCurated
Kokboroktrp2,46389,851246,300100.0×Sino-TibetanWMT 2025
Pnarpbv1,00252,144100,200100.0×AustroasiaticCurated
NE Total4,438,393126,857,942
Overall Total8,342,4006,583,123
Table 2: Model architecture comparison showing parameter counts, layer depth, hidden dimension, and attention heads.
ModelParamsLayersHiddenHeads
NE-BERT149M2276812
mBERT110M1276812
IndicBERT-V2237M12102416
MuRIL236M24102416
Table 3: Perplexity on 500-sentence test sets. NE-BERT achieves lowest average across all 9 NE languages.
LanguageNE-BERTIB-V2MuRILmBERT
Assamese1.769.015.621.65
Meitei1.893.773.221.44
Khasi1.272.401.931.36
Mizo1.908.957.002.44
Garo2.6426.3715.883.64
Kokborok1.729.155.412.23
Pnar2.9266.9239.655.30
Naga1.493.833.391.81
Nyishi4.33187.2075.806.05
English1.5514.815.572.64
Hindi1.4310.085.751.79
NE Avg.2.2135.2916.882.77
Overall2.1731.1415.382.76
Table 4: Tokenization fertility (tokens per word) across all 9 NE languages. Lower values indicate more efficient tokenization. NE-BERT achieves lowest average fertility across NE languages.
LanguageNE-BIB-V2MuRILmB
Assamese1.631.611.723.80
Meitei1.522.773.014.17
Khasi1.311.771.781.78
Mizo1.361.731.791.78
Garo2.372.842.802.89
Kokborok2.072.072.222.19
Pnar1.611.691.691.67
Naga1.561.931.771.97
Nyishi1.672.342.442.36
NE Avg.1.682.082.142.51
Table 5: Bits per character (BPC) across all 9 NE languages. Lower is better. NE-BERT achieves lowest average BPC.
LanguageNE-BIB-V2MuRmB
Assamese0.2300.8800.7310.442
Meitei0.2200.8150.7780.331
Khasi0.0920.4450.3360.158
Mizo0.2721.1631.0630.486
Garo0.5031.9971.6630.800
Kokborok0.2771.1360.9260.433
Pnar0.6802.7952.4461.092
Naga0.1710.7090.5940.321
Nyishi0.7893.7633.2311.306
English0.1900.8620.5580.328
Hindi0.1920.8630.6590.345
NE Avg.0.3591.5451.3070.597
Overall0.3471.4971.2710.590
Table 6: POS tagging accuracy (%) on test sets. NE-BERT outperforms all baselines across all languages.
LanguageNE-BERTmBERTIB-V2MuRIL
Khasi87.782.380.161.2
Mizo73.266.355.743.1
Nagamese86.471.341.744.8
Average82.473.359.249.7

왜 중요한가

이 연구는 자료가 거의 없는 소수언어도 대형 모델의 몸집을 키우는 대신 데이터 배분과 토큰화 방식을 정교하게 설계하면 훨씬 적은 비용으로도 잘 작동하는 언어모델을 만들 수 있음을 보여준다. 모델, 학습 코드, 데이터셋을 CC-BY-4.0으로 공개해 인도 동북부처럼 디지털 자원이 부족한 지역 언어 공동체가 직접 활용하고 연구를 이어갈 수 있는 발판이 된다.

이 논문의 용어

  • 퍼플렉시티(Perplexity) · 언어모델이 다음 단어를 얼마나 잘 예측하는지 재는 지표로, 낮을수록 성능이 좋다
  • 토큰화 fertility · 단어 하나를 몇 개의 조각(토큰)으로 나누는지 나타내는 값으로, 낮을수록 효율적이다
  • SentencePiece Unigram · 단어를 하위 단위로 쪼개는 방식 중 하나로, 확률 기반이라 문법 구조가 복잡한 언어에서 단어를 덜 망가뜨린다
  • 가중 샘플링(weighted sampling) · 자료가 적은 언어에 인위적으로 더 큰 비중을 줘서 학습 데이터 불균형을 완화하는 방법
  • 마스크드 언어모델링(MLM) · 문장 일부를 가리고 그 단어를 맞히도록 학습시키는 방식

저자 · Badal Nyalang

arXiv에서 원문 보기

최신 논문

논문 전체 보기 →

METAL MEDIA 최신 기사

그림 출처: Badal Nyalang et al., arXiv:2608.18094, CC BY 4.0