컴백부터 K-뷰티까지 — K-컬쳐의 모든 것을 메일로 받아보세요메일로 받아보기

METAL MEDIA

이미지 생성 AI를 훈련시킬 때, 데이터셋을 따로따로 만들지 않고 능력별로 서로 연결되게 설계하면 더 잘 배운다

arXiv:2608.180762026-08-17

From Corpora to Co-Evolving Capabilities: Capability-Centric Data Design for Generalist Image Generation

이미지 생성 AI를 훈련시킬 때, 데이터셋을 따로따로 만들지 않고 능력별로 서로 연결되게 설계하면 더 잘 배운다

이 연구는 텍스트로 이미지를 만드는 것(T2I), 이미지를 편집하는 것, 지식과 연결된 이미지를 만드는 것을 서로 독립된 데이터셋으로 다루던 기존 방식 대신, 세 가지를 서로 연결된 하나의 데이터 인프라로 설계했다. 4억4천만 장의 텍스트-이미지 데이터, 1억2천만 개의 편집 쌍, 2700만 개의 이미지-지식 쌍을 구축하고, 이를 학습 순서(커리큘럼)에 맞게 단계적으로 투입하는 방식으로 3B와 6B 크기의 이미지 생성 모델을 처음부터 학습시켰다. 그 결과 다양한 스타일의 이미지 생성과 복잡한 편집 작업에서 폭넓은 성능을 보였다.

METAL MEDIA 해설 도표

이미지 생성 AI를 훈련시킬 때, 데이터셋을 따로따로 만들지 않고 능력별로 서로 연결되게 설계하면 더 잘 배운다

  1. 01기존 이미지 생성 AI 학습법은 텍스트→이미지, 이미지 편집, 지식 연결 이미지 생성을 각각 별개의 데이터셋으로 다뤄 능력 간 지식 전이가 어려웠다
  2. 02이 연구는 세 가지 작업을 위한 전문 데이터 엔진을 따로 만들되, 캡션(이미지 설명 문구) 작성 방식을 공유해서 한 작업에서 배운 개념이 다른 작업에도 재활용되게 했다
  3. 03이미지 편집 데이터를 만들 때 인위적으로 합성한 것뿐 아니라, 같은 사람·상품이 등장하는 실제 사진들, 사용 전후 사진처럼 자연스럽게 연관된 이미지 쌍을 발굴해 더 현실적인 편집 학습 자료로 삼았다
  4. 04학습을 5단계로 나눠 처음엔 넓고 기초적인 이미지-텍스트 정렬부터, 점점 복잡한 구조·지식·텍스트 렌더링·이미지 편집으로 난이도를 높이며, 화질도 256픽셀에서 1024픽셀로 단계적으로 키웠다
  5. 05모델이 못하는 부분(성능 격차)을 평가로 찾아내 그 부분의 데이터를 더 모으거나 전문가가 직접 만들어 재투입하는 피드백 루프를 운영했다
METAL MEDIA이 원문을 바탕으로 재구성한 해설 도표이며, 논문 저자의 원문 figure가 아닙니다.

무엇을 했나

  1. 기존 이미지 생성 AI 학습법은 텍스트→이미지, 이미지 편집, 지식 연결 이미지 생성을 각각 별개의 데이터셋으로 다뤄 능력 간 지식 전이가 어려웠다
  2. 이 연구는 세 가지 작업을 위한 전문 데이터 엔진을 따로 만들되, 캡션(이미지 설명 문구) 작성 방식을 공유해서 한 작업에서 배운 개념이 다른 작업에도 재활용되게 했다
  3. 이미지 편집 데이터를 만들 때 인위적으로 합성한 것뿐 아니라, 같은 사람·상품이 등장하는 실제 사진들, 사용 전후 사진처럼 자연스럽게 연관된 이미지 쌍을 발굴해 더 현실적인 편집 학습 자료로 삼았다
  4. 학습을 5단계로 나눠 처음엔 넓고 기초적인 이미지-텍스트 정렬부터, 점점 복잡한 구조·지식·텍스트 렌더링·이미지 편집으로 난이도를 높이며, 화질도 256픽셀에서 1024픽셀로 단계적으로 키웠다
  5. 모델이 못하는 부분(성능 격차)을 평가로 찾아내 그 부분의 데이터를 더 모으거나 전문가가 직접 만들어 재투입하는 피드백 루프를 운영했다
Table 1: Image editing quantitative evaluation on CPI-General-Bench and CPI-Practical-Bench. Overall denotes their arithmetic mean.
ModelParametersCPI-GeneralCPI-PracticalOverall↑
Our Model-3B3B3.953.913.93
Our Model-6B6B3.963.923.94

왜 중요한가

이미지 생성 AI의 성능은 모델 구조뿐 아니라 데이터를 어떻게 조직하느냐에 크게 좌우되는데, 이 연구는 데이터 설계 자체를 능력 중심으로 재구성하는 구체적 방법론과 규모(수억 장급)를 공개했다. 실무자들에게는 데이터셋을 개별적으로 늘리는 것보다, 작업 간 의존관계와 학습 순서를 고려한 데이터 설계가 더 효율적일 수 있다는 실증적 근거를 제공한다.

이 논문의 용어

  • T2I(Text-to-Image) · 글로 쓴 설명을 보고 그에 맞는 이미지를 만들어내는 작업
  • MM-DiT · 이미지와 텍스트를 함께 다루는 확산모델(디퓨전 모델) 구조의 한 종류
  • 커리큘럼 스케줄링 · 쉬운 것부터 어려운 것 순서로 학습 데이터를 단계별로 투입하는 훈련 전략
  • VLM(비전-언어 모델) · 이미지를 보고 이를 설명하는 글을 만들거나 이해할 수 있는 AI 모델
  • SFT(지도 미세조정) · 이미 학습된 모델을 특정 목적에 맞게 정답 데이터로 추가 훈련시키는 단계

본문에 싣지 못한 그림

  • Figure 1: Capability-specific data construction in our framework. Shared collection and wrangling feed three specialized but interoperable engines for visual expression, editing association, and knowledge-grounded reasoning.
  • Figure 2: Distribution of the curated T2I corpus. The inner ring distinguishes collected and constructed data, while the outer ring reports the composition of visual domains retained for training.
  • Figure 3: Composition of the image-editing corpus. The left Sankey diagram shows the relative mixture of single-image and multi-image editing tasks, and the right panels illustrate representative task families.
  • Figure 4: Multi-granularity T2I supervision. Starting from a comprehensive annotation of an image, we construct entity descriptions, tags, short prompts, and long-form captions at multiple levels of details.
  • Figure 5: Pipeline for constructing T2I-aligned editing instructions. Dual-view perception produces a target-image caption and a raw editing instruction; task-specific actors align local or global changes with reusable T2I descriptions, followed by consistency verification and iterative revision.
  • Figure 6: Capability-gap-driven active feedback loop. Capability-aware evaluation identifies failure cases, which seed neighboring-data retrieval and expert-driven construction. Gap-aware resampling then increases the weights of persistent failures and down-weights resolved gaps in subsequent training.
  • Figure 7: Qualitative T2I results across illustration, graphic design, knowledge visualization, portraiture, landscapes, multi panel composition, and photographic style control.
  • Figure 8: Qualitative comparison on challenging single image editing cases. The examples cover hybrid editing, reasoning based transformation, object segmentation, and style transfer.
  • Figure 9: Visualization of degradation-aware restoration for different degradation types.
  • Figure 10: Qualitative comparison on multi image editing. The examples evaluate viewpoint alignment, reference relation understanding, and composition capabilities. Comparison cases are grouped by with/without explicit image index reference.
원문에서 그림 보기 →

저자 · Xingjian Wang

arXiv에서 원문 보기

최신 논문

논문 전체 보기 →

METAL MEDIA 최신 기사