한국 스타트업 Motif가 3140억 파라미터 오픈소스 MoE 언어모델 'Motif 3'를 공개했다
한국 스타트업 Motif가 3140억 파라미터 오픈소스 MoE 언어모델 'Motif 3'를 공개했다
Motif 3는 전체 3140억 개 중 토큰당 132억 개만 활성화하는 Mixture-of-Experts(MoE) 구조의 언어모델이다. 새로운 어텐션 방식인 GDLA와 여러 학습 안정화 기법을 적용해 12.5조 토큰으로 사전학습한 뒤, 6개의 전문 교사 모델과 증류 과정을 거쳐 하나의 통합 모델로 만들었다. 공개된 결과에 따르면 GDLA는 기존 방식보다 더 적은 학습량으로 더 낮은 손실값에 도달했고, 최종 모델은 여러 벤치마크에서 주요 오픈웨이트 모델들과 경쟁할 만한 성능을 보였다.
METAL MEDIA 해설 도표
Motif 3 파이프라인: 구조 설계 → 대규모 사전학습 → 다중 교사 증류
증거 상태측정 결과와 예정된 검증이 함께 있음
- 희소 MoE 구조3140억 전체 파라미터 중 384개 전문가 중 8개만 선택해 토큰당 132억 개만 활성화
- GDLA 어텐션차이 기반 주의집중(GDA)과 압축 키-값 표현(MLA)을 결합해 손실을 낮추고 캐시 부담을 줄임
- 저정밀도·장문 학습 시스템MXFP8 연산과 윈도우 인식 컨텍스트 병렬화로 12.5조 토큰, 최대 25만6천 토큰 컨텍스트까지 학습
- 7개 전문 교사 학습강화학습 기반 6개 교사(에이전트, 전문업무, 장문추론·기권, 수학, 코드·과학, 채팅)와 지도학습 기반 소프트웨어공학 교사
- Multi-teacher On-Policy Distillation7개 교사의 능력을 하나의 학생 모델로 합쳐 최종 통합 모델 완성
무엇을 했나
- 3140억 개 전체 파라미터 중 토큰마다 384개 전문가(experts) 중 8개만 골라 쓰고 132억 개만 활성화하는 세밀한 희소 MoE 구조를 채택했다.
- 차이 기반 주의집중 방식(GDA)과 저차원 압축 표현으로 캐시 부담을 줄이는 방식(MLA)을 결합한 GDLA(Grouped Differential Latent Attention)라는 새 어텐션 구조를 설계했다.
- 전문가별로 다른 활성화 함수 계수를 학습하는 Expert-Specific PolyNorm, 잔차 연결을 다중 스트림으로 확장한 변형 mHC, 다음 토큰을 여러 개 미리 예측하는 멀티토큰 예측(MTP) 기법을 함께 적용했다.
- 웹문서, 코드, 수학, 다국어, 전문 분야 자료 등 약 12.5조 토큰으로 사전학습했고, MXFP8 저정밀도 연산과 윈도우 인식 컨텍스트 병렬화로 최대 25만6천 토큰까지 처리할 수 있게 학습했다.
- 사후학습에서는 일반 지도학습, 6개 강화학습 전문가 교사, 1개 소프트웨어공학 교사, 그리고 여러 교사의 지식을 하나로 합치는 Multi-teacher On-Policy Distillation(MOPD)을 거쳤다.

| Property | Configuration |
|---|---|
| Total parameters | Approximately 314B |
| Activated parameters | Approximately 13.2B per token |
| Transformer layers | 53 (2 dense and 51 MoE) |
| Hidden dimension | 4,096 |
| Attention mechanism | Grouped Differential Latent Attention with output gating |
| Attention pattern | Hybrid GDLA (1 full / 3 sliding-window) |
| Query / KV heads | 80 / 16 |
| Signal / noise query heads | 64 / 16 |
| Query-key / Value head dim | 192 / 128 |
| FFN dimension (dense / expert) | 12,288 / 1,280 |
| Routed experts | 384, with top-8 routing |
| Shared experts | 1 |
| Expert activation | Expert-Specific PolyNorm |
| Residual architecture | Modified manifold-constrained hyper-connections |
| MTP head | 1 layer for self-speculative decoding |
| Maximum context length | 262,144 tokens (256K) |

| Metric | Failure mode indicated |
|---|---|
| Dispatch min/median | Starvation or a dead expert caused by routing imbalance |
| Maximum expert-token count | Concentrated traffic and possible expert overload |
| Output-weight min/median | Hidden collapse in which an expert receives tokens but its output projection contributes increasingly little |
| Routed/shared RMS, mean, and maximum | Dominance of shared experts, routed-expert collapse, or a change in the routed-output distribution |
| Maximum expert-output cosine similarity | Functional collapse in which nominally distinct experts learn similar representations |
| Routed and shared abs-max/RMS | Activation outliers and early warning signs of numerical instability |

| MMLU 5-shot | MMLU-Pro 5-shot CoT | ARC-C 25-shot | WinoGrande 5-shot | HellaSwag 10-shot | PIQA 0-shot | GSM8K 8-shot CoT | MATH 4-shot CoT | HumanEval 0-shot | MBPP 3-shot |
|---|---|---|---|---|---|---|---|---|---|
| 86.20 | 68.56 | 94.71 | 80.90 | 88.30 | 85.14 | 93.93 | 70.58 | 73.70 | 84.60 |

| Teacher | Coverage |
|---|---|
| Agentic tool use | Interactive shell and tool environments; multi-step task execution |
| Professional work | Open-ended occupational deliverables graded by comparison |
| Software engineering | Repository-level modifications verified through test execution |
| Long-context reasoning & abstention | Retrieval and synthesis over very long inputs; calibrated abstention |
| Mathematics | Competition and proof-style problems; symbolic and judged answer checking |
| Code and science | Program synthesis, scientific computing, and physical reasoning |
| Chat | Dialogue quality, instruction following, and safety |

| Benchmark | Motif 3 314B-A13B | MiniMax-3 428B-A23B | GLM-5.1 744B-A40B | Kimi-K2.6 1T-A32B | Qwen-3.7 Max | DS-v4-Pro 1.6T-A49B |
|---|---|---|---|---|---|---|
| [0pt][0pt] Agentic | ||||||
| GDPval-AA v2 | 38.7 | 44.4 | 37.8 | 34.4 | 39.0 | 40.2 |
| τ2-Bench Telecom | 94.7 | 88.9 | 97.7 | 95.9 | 94.7 | 96.2 |
| τ3-Banking | 35.3 | 15.3 | 13.6 | 23.3 | 12.0 | 30.1 |
| ITBench-AA | 51.5∗ | - | 40.3 | 31.2 | 42.5 | 38.3 |
| [0pt][0pt] Coding | ||||||
| SWE-bench Verified | 76.2 | 75.0 | 76.4 | 76.2 | 80.4 | 77.4 |
| Terminal-Bench 2.1 | 74.9 | 65.2 | 61.8 | 65.9 | 75.0 | 64.0 |
| SciCode | 40.6 | 45.4 | 43.8 | 53.5 | 53.5 | 50.0 |
| [0pt][0pt] Reasoning and Knowledge | ||||||
| IMO-AnswerBench | 83.2 | - | 83.8 | 81.8 | 90.0 | 89.8 |
| Apex Shortlist | 75.5 | - | 71.1 | 77.4 | 44.5 | 85.8 |
| GPQA Diamond | 83.4 | 92.9 | 86.8 | 91.1 | 92.4 | 88.8 |
| HLE | 37.0 | 39.0 | 30.1 | 37.5 | 41.4 | 37.5 |
| CritPt | 6.6 | 3.7 | 4.6 | 8.0 | 11.4 | 12.9 |
| AA-Omniscience Accuracy | 30.1 | 16.7 | 23.7 | 32.6 | 31.0 | 42.9 |
| AA-Omniscience Non-Hallucination | 71.6 | 81.6 | 70.1 | 59.5 | 74.0 | 5.9 |
| [0pt][0pt] Long Context and Instruction Following | ||||||
| AA-LCR | 72.3 | 80.3 | 68.0 | 76.7 | 75.0 | 70.0 |
| IFBench | 78.2 | 82.9 | 76.3 | 76.0 | 79.1 | 76.5 |
실제로 확인된 결과
- 약 100억 파라미터 규모의 통제 실험에서 GDLA는 기존 GDA·MLA보다 낮은 학습 손실을 보였고, 손실 3.2에 도달하는 데 MLA보다 9.2% 적은 학습 토큰이 필요했다.
- 같은 규모의 통제 실험에서 Expert-Specific PolyNorm은 SwiGLU보다 전문가 게이트 가중치의 유효 랭크(특이값이 고르게 분포된 정도)가 더 높게 유지됐다.
- 감쇠하는 라우터 노이즈 기법을 적용하면 한 전문가에 몰리는 최대 토큰 수가 더 빠르게 줄고 학습 초반에 부하 분포가 중간값 수준으로 유도됐다.
- 전체 벤치마크 평가에서 Motif 3는 주요 오픈웨이트 모델들과 경쟁할 만한 성능을 보였으며, 장기 에이전트 과제, 수학 추론, 과학 지식, 환각(hallucination) 민감 평가에서 강한 결과를 냈다고 보고됐다.
어디에 쓸 수 있나
- 대규모 MoE 모델의 어텐션 구조나 학습 안정화 기법을 설계할 때 참고할 수 있는 엔지니어링 사례로 활용할 수 있다.
- 긴 문서 이해, 에이전트형 도구 사용, 코딩, 전문 업무(문서·슬라이드 작성) 등 다양한 과제에 하나의 통합 모델을 적용하려는 시도에 참고가 될 수 있다.
- 저정밀도(MXFP8) 연산과 컨텍스트 병렬화를 통한 초장문 컨텍스트(최대 25만6천 토큰) 학습 파이프라인 설계에 참고할 수 있다.
한계와 남은 검증
- 보고된 성능 비교는 리더보드에 공개된 다른 모델들의 점수와 비교한 것으로, 동일한 조건에서 직접 재현한 비교는 아니다.
- GDLA와 PolyNorm 등 핵심 구성요소의 효과는 약 100억 파라미터 규모의 통제 실험에서만 확인됐으며, 3140억 파라미터 전체 모델에서 각 구성요소를 개별적으로 제거해 검증한 결과는 본문에 제시되지 않았다.
- 일부 평가는 공개된 부분집합(public subset)에서만 수행됐다고 별도로 표시되어 있어 전체 벤치마크 결과와 직접 비교하기 어려운 항목이 있다.
- 한국어 중심으로 설계된 채팅 교사 학습 등 특정 구성요소는 다국어 환경 전반에 대한 일반화 검증이 추가로 필요하다.
왜 중요한가
3000억 파라미터급 대형 MoE 모델을 소수 인력의 한국 스타트업이 설계·학습·공개했다는 점에서, 오픈소스 모델의 기술 수준이 어디까지 왔는지 가늠할 수 있는 사례다. 어텐션 구조와 학습 안정화, 저정밀도 학습 기법을 실제로 대규모에서 검증한 상세 기록이라 다른 팀들이 참고할 수 있는 엔지니어링 자료로서 가치가 크다.
이 논문의 용어
- MoE(Mixture-of-Experts) · 여러 개의 소규모 전문가 신경망 중 일부만 골라 계산하는 구조로, 전체 파라미터는 크지만 실제 연산량은 줄일 수 있다
- GDLA · 차이 기반 주의집중과 저차원 압축 키-값 표현을 결합한 이 논문의 새 어텐션 방식
- MXFP8 · 메모리와 연산량을 줄이기 위한 8비트 저정밀도 숫자 표현 방식
- MOPD(Multi-teacher On-Policy Distillation) · 여러 전문 교사 모델의 지식을 하나의 학생 모델로 옮겨 담는 증류 기법
- GRPO · 강화학습으로 모델을 특정 과제에 맞게 훈련시키는 방법 중 하나
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다
- AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다
- AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다
METAL MEDIA 최신 기사
그림 출처: Junghwan Lim et al., arXiv:2608.09119, arxiv-nonexclusive