과학 연구를 위한 397B급 멀티모달 AI가 이미지·시계열·긴 작업을 하나의 모델로 처리한다
과학 연구를 위한 397B급 멀티모달 AI가 이미지·시계열·긴 작업을 하나의 모델로 처리한다
Intern-S2-Preview는 과학 문헌의 텍스트·이미지·시계열을 함께 이해하고, 도구를 써서 여러 단계에 걸친 작업을 수행하도록 설계된 397B 파라미터 규모의 과학 에이전트 기반 모델이다. 사전학습부터 지도학습, 강화학습, 에이전트 강화학습, 정책 증류까지 이어지는 통합 후처리 파이프라인을 거쳤다. 생물학, 화학, 시계열 예측 등 여러 과학 벤치마크에서 경쟁력 있거나 앞서는 결과를 보였고, 별도의 메모리 확장 모듈로 397B 백본을 건드리지 않고도 특정 분야 성능을 끌어올렸다.
METAL MEDIA 해설 도표
Intern-S2-Preview 397B의 구조와 학습 흐름
증거 상태측정 결과가 보고됨
- 멀티모달 사전학습렌더링된 과학 문서, 이미지-텍스트 교차 데이터, 다양한 과학 말뭉치로 텍스트와 시각 정보를 함께 학습
- 통합 후처리 파이프라인지도미세조정 → 다중과제 강화학습 → 화이트박스·블랙박스 에이전트 강화학습 → 온폴리시 증류로 이어지는 단계
- 시계열 이해·예측 모듈긴 시계열을 효율적으로 이해하는 인코더에 숫자값을 직접 예측하는 전용 예측 브랜치를 추가
- 메모리 디코더(별도 확장)397B 백본은 고정하고, 도메인별로 학습된 메모리를 라우터가 동적으로 섞어 특정 분야 지식을 보완
- 다중 벤치마크 평가과학, 멀티모달, 에이전트, 범용, 시계열 벤치마크에서 경쟁력 있거나 선두권 결과를 확인
무엇을 했나
- 과학 문헌은 텍스트뿐 아니라 그림, 표, 수식, 페이지 레이아웃, 시계열 신호 등 여러 형태로 정보가 흩어져 있는데, 이 모델은 이런 이형 데이터를 함께 학습하고 도구를 반복적으로 사용하는 긴 작업까지 수행하도록 만들어졌다.
- 학습은 렌더링된 과학 문서, 이미지-텍스트가 뒤섞인 데이터, 다양한 과학 말뭉치로 사전학습한 뒤, 지도미세조정, 다중과제 강화학습, 화이트박스·블랙박스 에이전트 강화학습, 온폴리시 증류로 이어지는 통일된 후처리 파이프라인을 적용했다.
- 아키텍처 측면에서 397B 모델은 시계열을 이해만 하던 것에서 나아가 숫자로 미래 값을 예측하는 전용 브랜치를 추가했고, 별도로 '메모리 디코더'라는 모듈을 붙여 397B 백본을 고정한 채로 특정 과학 분야에 빠르게 특화시키는 방법도 함께 연구했다.
- 과학, 멀티모달, 에이전트, 범용 벤치마크 전반에서 평가한 결과 397B 모델은 여러 설정에서 경쟁력 있거나 선두권 성능을 보였고, SciTS 벤치마크에서 시계열 이해와 예측 성능이 개선됐으며, 생물학 전용 메모리 확장(Intern-MemDec-4B)은 백본을 바꾸지 않고도 Biology-Instructions 평균 점수를 56.92에서 60.32로 끌어올렸다.

| Provider | Collection | #Tasks | #Environments |
|---|---|---|---|
| SWE-bench | SWE-smith [93] | 59,136 | 222 |
| SWE-Gym | SWE-Gym [59] | 2,438 | 2401 |
| R2E-Gym | R2E-Gym-V1 [38] | 7,480 | 8101 |
| Nebius | SWE-rebench-V2 [6] | 32,100 | 32075 |
| AweAI-Team | Scale-SWE [104] | 20,200 | 19472 |
| NVIDIA | Nemotron-Terminal-Synthetic-Tasks [60] | 80,000 | 8 |
| RUC-AIBOX | ClawGym-Task [7] | 13,500 | 1 |

| SciTS Task ID | ASU01 | ASU03 | BIU01 | BIU03 | EAU01 | MEU01 | NEU06 | PHU01 | PHU04 | RAU01 | RAU02 | |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Text LLM | GPT-4.1-mini | 67.2 | 15.6 | 0.2 | 12.7 | 67.0 | 44.0 | 16.1 | 24.0 | 52.7 | 24.6 | 10.6 |
| Gemini2.5-Flash | 64.1 | 16.3 | 1.5 | 12.4 | 67.6 | 60.9 | 5.8 | 20.7 | 64.8 | 20.9 | 13.5 | |
| DeepSeek-V3 | 1.1 | 12.3 | 0.0 | 5.8 | 40.2 | 59.3 | 13.6 | 28.9 | 50.7 | 19.4 | 4.2 | |
| VL LLM | GPT-5-mini | 65.7 | 18.9 | 0.8 | 17.9 | 67.6 | 30.4 | 13.3 | 21.4 | 47.8 | 24.3 | 9.1 |
| Gemini2.5-Flash | 61.6 | 15.2 | 0.9 | 8.3 | 72.5 | 64.1 | 11.6 | 22.7 | 59.0 | 31.6 | 11.3 | |
| Intern-S1-Pro | 98.0 | 75.9 | 20.8 | 88.3 | 99.5 | 65.6 | 71.3 | 36.8 | 93.2 | - | - | |
| Intern-S2-Preview-397B | 97.1 | 91.0 | 36.5 | 98.3 | 100.0 | 81.8 | 70.2 | 66.9 | 99.9 | 88.4 | 60.2 |

| SciTS Task ID | ENG02 | ENG03 | MEG03 | NEG03 | PHG02 | URG01 | URG05 | |
|---|---|---|---|---|---|---|---|---|
| Text LLM | GPT-4.1-mini | 125.0 (1.4) | 8.3 (96.0) | 42.1 (49.6) | 95.2 (96.4) | 1.1e3 (94.2) | 320.6 (18.6) | 126.6 (100) |
| Gemini2.5-Flash | 72.5 (5.9) | 9.6 (99.0) | 62.2 (57.9) | 63.5 (99.2) | 110.8 (99.0) | 246.0 (23.3) | 98.6 (100) | |
| DeepSeek-V3 | 117.2 (46.1) | 7.7 (98.0) | 46.4 (30.9) | 4.3 (3.1) | 200.1 (92.2) | 350.0 (18.6) | 296.7 (93.0) | |
| VL LLM | GPT-5-mini | 56.1 (4.5) | 11.2 (76.0) | 37.6 (51.8) | 74.3 (97.2) | 155.3 (97.4) | 182.1 (58.1) | 71.1 (72.9) |
| Gemini2.5-Flash | 103.9 (7.4) | 15.6 (53.0) | 53.1 (37.2) | – | 185.2 (36.9) | 351.9 (16.3) | 114.6 (91.2) | |
| Time Series Models | Moirai-Large [85] | 121.2 (100) | 12.8 (100) | 51.7 (100) | 59.1 (100) | 116.9 (100) | 294.7 (100) | 74.6 (100) |
| TimeMoE-Large [68] | 70.4 (100) | 11.6 (100) | 39.0 (100) | 70.1 (100) | 80.2 (100) | 218.4 (100) | 84.4 (100) | |
| Chronos-bolt-Base [5] | 73.7 (100) | 12.0 (100) | 41.5 (100) | 78.5 (100) | 109.3 (100) | 139.3 (100) | 70.6 (100) | |
| UniTS [31] | 70.1 (100) | 12.8 (100) | 42.0 (100) | 95.2 (46.4) | 135.9 (44.1) | 389.7 (100) | – | |
| TimeOmni [86] | 68.6 (100) | 7.4 (100) | 37.5 (100) | 78.7 (100) | 163.0 (100) | 247.0 (100) | 174.0 (100) | |
| Intern-S2-Preview-397B | 60.2 (100) | 7.1 (100) | 32.8 (100) | 59.2 (100) | 72.2 (100) | 138.9 (100) | 60.6 (100) |

실제로 확인된 결과
- 397B 모델은 Biology-Instructions(56.92), Mol-Instructions(52.37), SciReasoner(63.97)에서 강력한 오픈·클로즈드 소스 모델들을 능가했고, 내부 MP20·ProteinBinder-9 평가셋에서 최고 성능을 냈다.
- MolecularIQ(61.49), TOMG-Bench(65.66), XLRS-Bench(51.97), MicroVQA(68.81)에서 오픈소스 모델 중 최고 성능을 기록했고, MMLU-Pro(89.75), SimpleQA-Verified(69.90), MMMU-Pro(80.46), ChartQAPro(69.65)에서도 오픈소스 최고 성능을 보였다.
- 과학 지향 에이전트 과제에서 DeepSeek-V4-Pro와 Qwen3.5-397B를 대체로 앞섰고 GLM-5.2에만 뒤졌으며, 일반 에이전트 과제에서는 Qwen3.5-397B를 꾸준히 앞서고 Kimi-K2.7-Code와 비슷한 수준이었다.
- SciTS 시계열 이해 과제에서 텍스트·비전언어 LLM들을 일관되게 앞섰고, 파라미터 수가 절반도 안 되면서 1조 파라미터급 Intern-S1-Pro보다 9개 중 7개 과제에서 더 나은 성능을 보였다(PHU01의 F1 점수는 36.8에서 66.9로 상승).
- 생물학 도메인에 특화된 Intern-MemDec-4B는 397B 백본을 그대로 둔 채 Biology-Instructions 평균 점수를 56.92에서 60.32로 올렸고, 일반 지식·추론·멀티모달 벤치마크에서는 백본과 비슷한 수준을 유지해 목표 분야만 선택적으로 강화됨을 보였다.
어디에 쓸 수 있나
- 과학 문헌의 그림·표·수식과 텍스트를 함께 이해해야 하는 문헌 분석 및 질의응답 시스템
- 생물학, 화학, 재료과학 등 특정 분야 지식을 백본 재학습 없이 모듈 형태로 빠르게 추가하려는 상황
- 긴 수치 시계열 데이터를 이해하고 미래 값을 예측해야 하는 천문학, 지구과학, 신경과학, 생리신호, 레이더 신호 분석 등의 과제
- 코딩, 터미널 작업, 소프트웨어 엔지니어링처럼 도구를 반복 사용하며 여러 단계를 거쳐야 하는 에이전트형 작업

한계와 남은 검증
- 이 논문은 '프리뷰' 시스템이라고 스스로 밝히며, 더 긴 과학 워크플로우에서의 신뢰성 개선, 도메인별 메모리 및 작업 환경 확장, 검증기 강화, 전문 과학 도구와의 통합 심화가 향후 과제로 남아 있다.
- 메모리 디코더는 생물학 한 분야만을 대표 사례로 평가했으며, 다른 과학 분야에 대한 메모리 확장 효과는 별도로 검증되지 않았다.
- 메모리 디코더의 교차 도메인 평가는 일반 지식·추론·멀티모달 벤치마크에서 백본과 '비슷한 수준을 유지'하는지를 확인한 것으로, 모든 분야에서 부작용이 전혀 없다는 것을 증명한 것은 아니다.
- 일반 시계열 예측 벤치마크인 GIFT-Eval에서는 제로샷 MASE 0.785로 '경쟁력 있는' 수준으로만 보고되어, 특화 모델을 능가했는지는 별도로 명시되지 않았다.
왜 중요한가
과학 연구는 텍스트 질의응답을 넘어 그림·수치·도구를 넘나들며 여러 단계를 거쳐야 하는데, 이 모델은 그런 워크플로우 전체를 하나의 시스템으로 다루려는 시도를 보여준다. 또한 새 분야 지식을 백본을 다시 학습시키지 않고 모듈만 붙여 확장하는 방식은 연구자가 특정 도메인에 빠르게 모델을 맞추면서도 기존 범용 능력을 잃지 않을 수 있는 실용적 방향을 제시한다.
이 논문의 용어
- 에이전트 강화학습(agentic RL) · 모델이 도구나 환경과 상호작용하며 여러 단계를 거쳐 문제를 푸는 과정을 보상 신호로 학습시키는 방법
- 메모리 디코더 · 기본 모델(백본)을 고정한 채 별도로 학습시켜 붙이는 지식 저장 모듈로, 도메인별 지식을 추가해준다
- 온폴리시 증류 · 여러 전문화된 정책이 학습한 능력을 하나의 통합 모델로 옮겨 담는 학습 기법
- 시계열 예측 브랜치 · 숫자를 텍스트 토큰으로 쓰지 않고 별도의 신경망 경로로 직접 예측해 정밀도를 지키는 구조
- SciTS 벤치마크 · 과학 시계열 신호의 이해와 예측 능력을 평가하는 벤치마크
본문에 싣지 못한 그림
- Figure 5: The pipeline of the image retrieval process, including image encoding, vector database construction, and online text-to-image and image-to-image retrieval with post-processing.
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다
- AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다
- AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다
METAL MEDIA 최신 기사
그림 출처: Lei Bai et al., arXiv:2608.13505, CC BY 4.0