LG AI연구원, K-EXAONE을 3배 키운 7500억 파라미터 개방형 모델 K-EXAONE 2.0 공개
arXiv:2608.045052026-08-06
K-EXAONE 2.0 Technical Report
LG AI연구원, K-EXAONE을 3배 키운 7500억 파라미터 개방형 모델 K-EXAONE 2.0 공개
LG AI연구원이 한국 정부 지원 프로그램으로 만든 K-EXAONE을 처음부터 다시 학습하지 않고 구조를 키워 재활용하는 방식으로, 전체 파라미터 7500억 개에 토큰당 약 370억 개를 활성화하는 MoE(전문가 혼합) 모델 K-EXAONE 2.0을 만들었다. 최대 25만6천 토큰의 긴 문맥과 10개 언어를 지원하며, 에이전트형 코딩과 긴 문맥 이해에서 가장 크게 향상되고 긴 문맥 검색과 안전성에서 공개 모델 대비 강점을 보였다. Apache 2.0 라이선스로 공개해 누구나 평가·배포·수정할 수 있다.
METAL MEDIA 해설 도표
K-EXAONE에서 K-EXAONE 2.0으로: 업사이클링 구조
증거 상태측정 결과와 예정된 검증이 함께 있음
기존 모델 K-EXAONE2360억 파라미터, 48개 층, 128개 전문가, 6개 언어, 25만6천 토큰 문맥 지원
구조 확장(업사이클링)층을 78개로, 전문가를 256개로 늘리고 기존 가중치를 복제 후 대칭 깨기용 회전 노이즈 추가, Clamped SwiGLU로 안정화
중간학습 + 후속학습문맥을 8K→64K→256K로 확장, 추론·에이전트형 코딩·안전성에 초점을 맞춰 온라인 강화학습과 지도 미세조정 수행
추론 가속 모듈MTP와 DSpark 두 가지 추측 디코딩 경로로 생성 속도를 최대 2.57배까지 높임
K-EXAONE 2.0 결과7500억 파라미터, 토큰당 370억 활성화, 10개 언어, 에이전트형 코딩·장문 이해·안전성에서 가장 큰 향상
METAL MEDIA이 원문을 바탕으로 재구성한 해설 도표이며, 논문 저자의 원문 figure가 아닙니다.
무엇을 했나
기존 모델(K-EXAONE, 2360억 파라미터)을 처음부터 다시 학습하지 않고, 층 수와 전문가 수를 늘려 '업사이클링'한 뒤 이어서 대규모 사전학습을 계속했다.
층은 48개에서 78개로, 전문가 수는 층당 128개에서 256개로 늘렸으며, 학습 안정성을 위해 마지막 16개 층에는 SwiGLU 활성값을 상한값 7.0으로 제한하는 'Clamped SwiGLU'를 적용했다.
난이도에 초점을 맞춘 중간학습(mid-training)과 후속학습(post-training)을 통해 추론, 에이전트형 코딩, 다국어 능력, 안전성을 강화했으며, 문맥 창을 8K→64K→256K 토큰으로 단계적으로 넓혔다.
추론 속도를 높이기 위해 MTP(다중토큰예측)와 DSpark라는 두 가지 추측 디코딩(초안을 미리 생성해 검증하는 방식) 경로를 도입했다.
한국어 문화·역사에 특화된 안전 기준(K-AUT)을 226개에서 296개 위험 영역으로 확장하고, UNESCO 산하 교사 46인으로 구성된 안전 자문위원회를 운영해 새로운 위험을 발굴했다.
Figure 1: The main evaluation results of K-EXAONE 2.0.
Table 1: Model configurations of K-EXAONE 2.0 and K-EXAONE.
Block
Configuration
K-EXAONE 2.0
K-EXAONE
Main Block
Layers (Total/SWA/GA)
78 / 58 / 20
48 / 36 / 12
Sliding Window Size
128
128
Attention Heads (Q/KV)
64 / 8
64 / 8
Head Dimensions
128
128
Experts (Total/Shared/Activated)
256 / 1 / 8
128 / 1 / 8
Experts Dimensions
2,048
2,048
Parameters (Total/Activated)
750B / 37B
236B / 23B
MTP Block
Layers (Total/SWA/GA)
1 / 1 / 0
1 / 0 / 1
Attention Heads (Q/KV)
64 / 8
64 / 8
Head Dimensions
128
128
Parameters
0.52B
0.52B
DSpark Block
Layers (Total/SWA/GA)
5 / 0 / 5
–
Attention Heads (Q/KV)
64 / 8
–
Block Size (γ)
7
–
Parameters
2.53B
–
Figure 2: An illustration of K-EXAONE 2.0 model architecture. (Left): Main Model. (Right): MTP and DSpark modules. Incorporating either the MTP or DSpark module into the main model accelerates sequence generation. The main model consists of two initial dense layers followed by Mixture-of-Experts (MoE) layers. The sliding window attention (SWA) in the second layer employs a window size of 4096, whereas a window size of 128 is used for all other SWA layers. In the Sparse MoE layers, 8 routed experts are selected from a pool of 256 experts and deployed alongside one shared expert. To ensure stability during both training and inference, the last 16 layers of the main model apply Clamped SwiGLU with a limit value of 7.0 to the experts.
Table 2: Acceptance length and end-to-end speedup over non-speculative decoding, on the same K-EXAONE 2.0 (FP8) target with the same draft budget (γ=7). Each cell is non-thinking / thinking at temperature 1.0 on TP8, 8× H200.
Domain
Benchmark
Acceptance length
E2E speedup
MTP
DSpark
MTP
DSpark
Math
GSM8K
3.58 / 3.13
5.25 / 5.20
1.72 / 1.55
2.49 / 2.56
MATH-500
3.60 / 3.16
4.95 / 4.58
1.76 / 1.55
2.44 / 2.28
AIME 2026
3.00 / 2.73
4.00 / 3.60
1.50 / 1.36
2.01 / 1.81
Code
HumanEval
3.67 / 2.61
5.41 / 3.81
1.77 / 1.30
2.57 / 1.92
MBPP
3.14 / 2.55
4.19 / 3.60
1.53 / 1.27
2.05 / 1.81
Figure 3: Pre-training loss on the Korean subset of the K-EXAONE 2.0 pre-training mixture versus training compute (6⋅Nactive⋅D, FLOPs, log scale) for the K-EXAONE and EXAONE 4.0 lineages. Dashed lines mark GLM-5.1 and GLM-5.2.
Table 3: Absolute score changes relative to the initial late-stage checkpoint of K-EXAONE. All models are trained independently from the same checkpoint. The baseline model is trained on 30B tokens from the original pre-training mixture, while the Active Reading and textbook-style models are each trained on a 40B-token mixture consisting of the same 30B-token baseline data and an additional 10B synthetic tokens generated from Wikipedia documents.
Method
ARC-C [7]
MMLU [18]
GSM8K [8]
HellaSwag [66]
Avg.
Baseline Dataset
+0.00
-0.25
+1.51
+0.59
+0.46
Active Reading
+1.54
-0.11
+1.21
+0.34
+0.75
Textbook-style
-0.42
+0.55
+1.52
-0.02
+0.41
Figure 4: Needle-in-a-Haystack (NIAH) retrieval accuracy of K-EXAONE 2.0 across context lengths of up to 256K tokens and varying needle positions. K-EXAONE 2.0 maintains perfect retrieval throughout the evaluated range.
Table 4: Performance comparison on Korean benchmark categories across different data sources.
Data Source
Culture & History
Knowledge & Reasoning
Avg.
Institution-sourced Data
68.23
46.47
57.35
Open-sourced Data
67.19
47.21
57.20
Figure 5: Illustration of preserved thinking.
Table 5: Absolute Humanity’s Last Exam score improvements obtained from different training paths starting from the Mid Stage 1 checkpoint of the small-scale model.
Training Stage
Δ HLE
Mid-Stage 1 → Base SFT
+3.15
Mid-Stage 1 → Mid-Stage 2
+4.71
Mid-Stage 1 → Mid-Stage 2 → Base SFT
+5.66
Figure 6: Demographics of the Safety Teacher Advisory Council.
Table 6: The main evaluation results of K-EXAONE 2.0 Reasoning mode. Asterisk (∗) indicates that the scores are from each baseline model’s official technical report, blog or leaderboard.
K-EXAONE 2.0 (Reasoning)
K-EXAONE (Reasoning)
Qwen3.5 (Reasoning)
GLM-5.1 (Reasoning)
DeepSeek V4 Pro (Reasoning: max)
Architecture
MoE
MoE
MoE
MoE
MoE
# Total Params
750B
236B
397B
754B
1.6T
# Activated Params
37B
23B
17B
40B
49B
World Knowledge
MMLU-Pro
83.5
83.8
89.8∗
86.0
87.5∗
GPQA-Diamond
82.2
79.1
88.4∗
86.2∗
90.1∗
Humanity’s Last Exam
18.3
13.6
† 28.7∗
31.0∗
37.7∗
Math
AIME 2026
92.3
92.2
91.3∗
95.3∗
95.2
HMMT Feb 2026
78.4
80.7
84.6
82.6∗
95.2∗
IMO-AnswerBench
78.6
76.3
80.9∗
83.8∗
89.8∗
Coding / Agentic Coding
SciCode
40.1
35.6
42.0∗
43.8∗
50.0∗
SWE-Bench Verified
68.2
49.4
76.4∗
73.6
80.6∗
Terminal-Bench 2.1
43.8
30.3
51.3∗
61.8∗
64.0∗
Agentic Tool Use
τ3-Banking
14.2
14.2
13.4∗
11.5∗
25.8∗
Claw-Eval (general)
80.0
74.3
81.2
86.1
83.5
Instruction Following
IFEval
92.4
89.7
92.6∗
93.9
94.0
IFBench
72.6
67.3
76.5∗
76.3∗
76.5∗
Long Context Understanding
OpenAI-MRCR
94.4
52.3
93.0
71.5
92.9
AA-LCR
56.2
53.5
65.7∗
62.3∗
66.3∗
Ko-LongBench
89.6
86.8
91.3
83.6
91.4
Korean
KMMLU-Pro
69.1
67.3
77.4
75.8
80.5
CLIcK
84.2
83.9
88.9
88.7
91.6
HRM8K-KSM
91.1
91.9
91.2
89.4
94.3
Multilinguality
Table 7: Multilingual performance comparison on POLYMATH.
KO
DE
ES
JA
VI
PT
FR
IT
K-EXAONE
55.5
59.3
57.8
58.2
56.9
57.3
58.7
55.2
K-EXAONE 2.0
68.8
70.3
70.4
73.6
69.5
71.2
74.0
72.6
Table 8: Multilingual performance comparison on GlobalMMLU-Lite.
KO
DE
ES
JA
VI
PT
FR
IT
PL
K-EXAONE
86.3
86.5
88.5
88.0
84.8
86.5
88.8
86.3
86.3
K-EXAONE 2.0
86.5
88.3
87.8
87.3
83.0
88.0
87.8
86.3
84.5
Table 10: Revision of K-AUT through newly discovered risks.
Domain
V1
V2
New
Universal Human Values
55
69
14
Social Safety
75
89
14
Korean Sensitivity
60
87
27
Future Risk
36
51
15
Total
226
296
70
Table 11: Safety performance comparison on KGC-Safety.
Model
Universal Human Values
Social Safety
Korean Sensitivity
Future Risk
Total
Qwen3.5-397B-A17B
95.8
96.8
85.5
86.7
92.0
GLM-5.1-754B-A40B
76.4
76.7
60.3
58.3
69.3
DeepSeek V4 Pro (Reasoning: max)
87.5
87.3
80.8
69.7
82.8
EXAONE 4.0 32B
63.6
57.2
60.7
46.7
58.0
K-EXAONE
97.5
96.9
94.3
95.0
96.1
K-EXAONE 2.0
100
99.9
99.3
100
99.8
실제로 확인된 결과
DSpark 초안 모듈은 동일한 초안 예산(γ=7) 조건에서 MTP보다 수용 길이가 32~66% 더 길었고, 종단간 속도 향상은 MTP의 1.27~1.77배에서 DSpark의 1.81~2.57배로 늘었다(H200 GPU 8개, TP8 환경).
Active Reading 방식으로 만든 합성 데이터가 초기 체크포인트 대비 평균 성능 향상이 가장 컸으며 특히 ARC-C에서 두드러졌고, 교과서 스타일 합성 데이터는 MMLU와 GSM8K에서 더 나았다.
기관 제공 한국 문화·역사 데이터는 한국 문화·역사 벤치마크에서, 교육적 가치가 높은 오픈소스 한국어 데이터는 지식 집약형 벤치마크 평균 점수에서 각각 더 나은 성능을 보였다.
중간학습 2단계(Mid-Stage 2)는 1단계 대비 HLE(전문가 수준 지식 평가) 점수를 4.71점 올렸고, 이는 1단계 후 바로 SFT를 적용했을 때의 3.15점 향상을 넘어섰으며, 2단계 후 같은 SFT를 적용하면 총 5.66점 향상되었다(소규모 모델 기준).
최대 25만6천 토큰 문맥에서 NIAH 검색 정확도가 모든 평가 구간에서 완벽했으며, 반복된 K-AUT 안전 기준 개정을 거친 K-EXAONE 2.0은 KGC-Safety 평가의 모든 항목에서 이전 K-EXAONE 모델들보다 일관되게 높은 안전 비율을 기록했다.
어디에 쓸 수 있나
긴 문서·코드 저장소 전체를 한 번에 넣고 분석해야 하는 25만 토큰급 장문 처리 업무
여러 단계의 도구 호출과 코드 수정이 필요한 에이전트형 소프트웨어 개발 보조
한국어·한국 문화 맥락에 민감한 콘텐츠 검토나 안전성 점검이 필요한 서비스
영어 외 9개 언어(스페인어, 독일어, 일본어 등)를 함께 다뤄야 하는 다국어 서비스 프로토타입
자체 인프라에서 대형 모델을 개조·배포하려는 연구팀의 오픈소스 기반 모델 후보
한계와 남은 검증
보고된 비교는 대부분 이전 버전 K-EXAONE이나 특정 공개 모델 대비 상대적 향상치이며, 모든 벤치마크에서 최고 성능임을 뜻하지 않는다
한국어 데이터 관련 비교(그림 3)는 상당 부분이 공개되지 않은 내부 데이터를 사용해, GLM-5 계열과의 비교는 참고용일 뿐 직접 비교로 보기 어렵다
중간학습 단계별 효과 분석은 실제 배포 규모가 아닌 '소규모 모델'로 수행되었다
안전 기준 확장(K-AUT-V2)의 세부 개정 내용과 완전한 정량 평가 결과는 부록 표에 한정되어 제시된다
저자들은 지식·추론 데이터 생성 및 정제 전략을 더 확장하는 것을 향후 과제로 명시했다
왜 중요한가
정부 지원으로 국내에서 개발된 초대형 개방형 모델이 세계적 수준의 성능에 근접하면서도 한국어·한국 문화 맥락의 안전성을 갖췄다는 점에서, 국내 AI 생태계가 자체적으로 활용·개조할 수 있는 기반이 넓어진다. 또한 기존 모델을 처음부터 재학습하지 않고 구조를 확장하는 '업사이클링' 접근은 대형 모델을 적은 비용으로 키우는 실무적 방법을 제시한다.
이 논문의 용어
MoE (Mixture-of-Experts) · 입력마다 전체 신경망 대신 일부 '전문가' 모듈만 선택해 계산하는 구조로, 전체 파라미터는 크지만 실제 연산량은 줄일 수 있다
업사이클링(upcycling) · 기존에 학습된 모델의 가중치를 재사용해 구조를 확장한 뒤 이어서 학습시키는 방법으로, 처음부터 새로 학습하는 것보다 자원을 절약한다
추측 디코딩(speculative decoding) · 작은 초안 모듈이 여러 토큰을 미리 예측하고 본 모델이 검증해 채택함으로써 생성 속도를 높이는 기법
Clamped SwiGLU · 신경망 내부 활성값이 지나치게 커지는 것을 막기 위해 특정 값(7.0) 이상으로 올라가지 못하게 제한하는 기법
Needle-in-a-Haystack(NIAH) · 매우 긴 문서 속에 숨겨둔 특정 정보를 모델이 얼마나 정확히 찾아내는지 측정하는 테스트
저자 · Eunbi Choi, Kibong Choi, Sehyun Chun, Seokhee Hong, Junwon Hwang, Hyojin Jeon, Ahra Jo, Hyunjik Jo, Yeonsik Jo, Minhyeok