이미지 생성 AI를 훈련시킬 때, 데이터셋을 따로따로 만들지 않고 능력별로 서로 연결되게 설계하면 더 잘 배운다
이미지 생성 AI를 훈련시킬 때, 데이터셋을 따로따로 만들지 않고 능력별로 서로 연결되게 설계하면 더 잘 배운다
이 연구는 텍스트로 이미지를 만드는 것(T2I), 이미지를 편집하는 것, 지식과 연결된 이미지를 만드는 것을 서로 독립된 데이터셋으로 다루던 기존 방식 대신, 세 가지를 서로 연결된 하나의 데이터 인프라로 설계했다. 4억4천만 장의 텍스트-이미지 데이터, 1억2천만 개의 편집 쌍, 2700만 개의 이미지-지식 쌍을 구축하고, 이를 학습 순서(커리큘럼)에 맞게 단계적으로 투입하는 방식으로 3B와 6B 크기의 이미지 생성 모델을 처음부터 학습시켰다. 그 결과 다양한 스타일의 이미지 생성과 복잡한 편집 작업에서 폭넓은 성능을 보였다.
METAL MEDIA 해설 도표
이미지 생성 AI를 훈련시킬 때, 데이터셋을 따로따로 만들지 않고 능력별로 서로 연결되게 설계하면 더 잘 배운다
- 01기존 이미지 생성 AI 학습법은 텍스트→이미지, 이미지 편집, 지식 연결 이미지 생성을 각각 별개의 데이터셋으로 다뤄 능력 간 지식 전이가 어려웠다
- 02이 연구는 세 가지 작업을 위한 전문 데이터 엔진을 따로 만들되, 캡션(이미지 설명 문구) 작성 방식을 공유해서 한 작업에서 배운 개념이 다른 작업에도 재활용되게 했다
- 03이미지 편집 데이터를 만들 때 인위적으로 합성한 것뿐 아니라, 같은 사람·상품이 등장하는 실제 사진들, 사용 전후 사진처럼 자연스럽게 연관된 이미지 쌍을 발굴해 더 현실적인 편집 학습 자료로 삼았다
- 04학습을 5단계로 나눠 처음엔 넓고 기초적인 이미지-텍스트 정렬부터, 점점 복잡한 구조·지식·텍스트 렌더링·이미지 편집으로 난이도를 높이며, 화질도 256픽셀에서 1024픽셀로 단계적으로 키웠다
- 05모델이 못하는 부분(성능 격차)을 평가로 찾아내 그 부분의 데이터를 더 모으거나 전문가가 직접 만들어 재투입하는 피드백 루프를 운영했다
무엇을 했나
- 기존 이미지 생성 AI 학습법은 텍스트→이미지, 이미지 편집, 지식 연결 이미지 생성을 각각 별개의 데이터셋으로 다뤄 능력 간 지식 전이가 어려웠다
- 이 연구는 세 가지 작업을 위한 전문 데이터 엔진을 따로 만들되, 캡션(이미지 설명 문구) 작성 방식을 공유해서 한 작업에서 배운 개념이 다른 작업에도 재활용되게 했다
- 이미지 편집 데이터를 만들 때 인위적으로 합성한 것뿐 아니라, 같은 사람·상품이 등장하는 실제 사진들, 사용 전후 사진처럼 자연스럽게 연관된 이미지 쌍을 발굴해 더 현실적인 편집 학습 자료로 삼았다
- 학습을 5단계로 나눠 처음엔 넓고 기초적인 이미지-텍스트 정렬부터, 점점 복잡한 구조·지식·텍스트 렌더링·이미지 편집으로 난이도를 높이며, 화질도 256픽셀에서 1024픽셀로 단계적으로 키웠다
- 모델이 못하는 부분(성능 격차)을 평가로 찾아내 그 부분의 데이터를 더 모으거나 전문가가 직접 만들어 재투입하는 피드백 루프를 운영했다
| Model | Parameters | CPI-General | CPI-Practical | Overall↑ |
|---|---|---|---|---|
| Our Model-3B | 3B | 3.95 | 3.91 | 3.93 |
| Our Model-6B | 6B | 3.96 | 3.92 | 3.94 |
왜 중요한가
이미지 생성 AI의 성능은 모델 구조뿐 아니라 데이터를 어떻게 조직하느냐에 크게 좌우되는데, 이 연구는 데이터 설계 자체를 능력 중심으로 재구성하는 구체적 방법론과 규모(수억 장급)를 공개했다. 실무자들에게는 데이터셋을 개별적으로 늘리는 것보다, 작업 간 의존관계와 학습 순서를 고려한 데이터 설계가 더 효율적일 수 있다는 실증적 근거를 제공한다.
이 논문의 용어
- T2I(Text-to-Image) · 글로 쓴 설명을 보고 그에 맞는 이미지를 만들어내는 작업
- MM-DiT · 이미지와 텍스트를 함께 다루는 확산모델(디퓨전 모델) 구조의 한 종류
- 커리큘럼 스케줄링 · 쉬운 것부터 어려운 것 순서로 학습 데이터를 단계별로 투입하는 훈련 전략
- VLM(비전-언어 모델) · 이미지를 보고 이를 설명하는 글을 만들거나 이해할 수 있는 AI 모델
- SFT(지도 미세조정) · 이미 학습된 모델을 특정 목적에 맞게 정답 데이터로 추가 훈련시키는 단계
본문에 싣지 못한 그림
- Figure 1: Capability-specific data construction in our framework. Shared collection and wrangling feed three specialized but interoperable engines for visual expression, editing association, and knowledge-grounded reasoning.
- Figure 2: Distribution of the curated T2I corpus. The inner ring distinguishes collected and constructed data, while the outer ring reports the composition of visual domains retained for training.
- Figure 3: Composition of the image-editing corpus. The left Sankey diagram shows the relative mixture of single-image and multi-image editing tasks, and the right panels illustrate representative task families.
- Figure 4: Multi-granularity T2I supervision. Starting from a comprehensive annotation of an image, we construct entity descriptions, tags, short prompts, and long-form captions at multiple levels of details.
- Figure 5: Pipeline for constructing T2I-aligned editing instructions. Dual-view perception produces a target-image caption and a raw editing instruction; task-specific actors align local or global changes with reusable T2I descriptions, followed by consistency verification and iterative revision.
- Figure 6: Capability-gap-driven active feedback loop. Capability-aware evaluation identifies failure cases, which seed neighboring-data retrieval and expert-driven construction. Gap-aware resampling then increases the weights of persistent failures and down-weights resolved gaps in subsequent training.
- Figure 7: Qualitative T2I results across illustration, graphic design, knowledge visualization, portraiture, landscapes, multi panel composition, and photographic style control.
- Figure 8: Qualitative comparison on challenging single image editing cases. The examples cover hybrid editing, reasoning based transformation, object segmentation, and style transfer.
- Figure 9: Visualization of degradation-aware restoration for different degradation types.
- Figure 10: Qualitative comparison on multi image editing. The examples evaluate viewpoint alignment, reference relation understanding, and composition capabilities. Comparison cases are grouped by with/without explicit image index reference.
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다
- AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다
- AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다