컴백부터 K-뷰티까지 — K-컬쳐의 모든 것을 메일로 받아보세요메일로 받아보기

METAL MEDIA

한 문장에 담긴 여러 편집 지시를 동시에 실행하는 영상 편집 데이터셋과 모델이 나왔다

arXiv:2608.175662026-08-17

CoinVE-200K: A Large-Scale High-Quality Dataset for Compositional Instruction-Guided Video Editing

한 문장에 담긴 여러 편집 지시를 동시에 실행하는 영상 편집 데이터셋과 모델이 나왔다

기존 영상 편집 데이터셋은 배경 바꾸기, 물체 지우기 같은 한 가지 지시만 다루는데, 실제 사용자는 여러 편집을 한 번에 요청한다. 이 논문은 한 영상에 2~5개의 편집 지시가 동시에 들어간 20만 개 영상 쌍 데이터셋 CoinVE-200K와, 이를 학습해 여러 지시를 서로 헷갈리지 않고 정확한 영역에만 적용하는 220억 개 파라미터 규모 모델 CoinVE-Edit을 함께 내놓았다. 평가를 위한 전용 벤치마크 CoinVE-Bench도 함께 공개했다.

METAL MEDIA 해설 도표

한 문장에 담긴 여러 편집 지시를 동시에 실행하는 영상 편집 데이터셋과 모델이 나왔다

  1. 011080p 해상도, 최대 201프레임짜리 원본 영상에서 사람·사물·배경을 대상으로 추가·삭제·수정·스타일 변경 등 6가지 편집 유형을 조합해 지시문을 만들고, 마스크 기반 방식으로 편집 영상을 합성한 뒤 Gemini 2.5 Pro로 엄격하게 걸러내 20만 개의 고품질 영상-편집 쌍을 완성했다.
  2. 02완성된 데이터셋은 영상당 평균 2.55개 지시문을 포함하며(2개 57.7%, 3개 31.7%, 4개 8.5%, 5개 2.1%), 지역 추가 24.1%, 배경 교체 23.8%, 사물 교체 22.8%, 지역 삭제 18.5%, 배경 스타일화 6.4%, 사물 스타일화 4.5%로 비교적 고르게 분포한다.
  3. 03CoinVE-Edit은 Wan2.1-T2V-14B 영상 생성 모델과 Qwen3VL-8B 이해 모델을 결합하고, 각 지시문이 담당하는 영상 속 위치(영역)를 미리 예측해 그 영역에만 해당 지시가 작동하도록 어텐션을 분리하는 방식으로 지시문 간 간섭을 줄였다.
  4. 04OpenVE-Bench(단일 지시)와 자체 CoinVE-Bench(복합 지시) 실험에서 CoinVE-Edit은 오픈소스 모델은 물론 상용 모델 Seedance 2.0, Kling O3보다도 편집 영역 정확도(89.45, 최고 경쟁 모델 대비 1.74 우위) 등에서 앞섰고, 지시문을 그냥 이어붙이거나 단순한 방식으로 영역을 지정한 변형 모델보다도 정확도와 영상 자연스러움 모두에서 우수했다.
METAL MEDIA이 원문을 바탕으로 재구성한 해설 도표이며, 논문 저자의 원문 figure가 아닙니다.

무엇을 했나

  1. 1080p 해상도, 최대 201프레임짜리 원본 영상에서 사람·사물·배경을 대상으로 추가·삭제·수정·스타일 변경 등 6가지 편집 유형을 조합해 지시문을 만들고, 마스크 기반 방식으로 편집 영상을 합성한 뒤 Gemini 2.5 Pro로 엄격하게 걸러내 20만 개의 고품질 영상-편집 쌍을 완성했다.
  2. 완성된 데이터셋은 영상당 평균 2.55개 지시문을 포함하며(2개 57.7%, 3개 31.7%, 4개 8.5%, 5개 2.1%), 지역 추가 24.1%, 배경 교체 23.8%, 사물 교체 22.8%, 지역 삭제 18.5%, 배경 스타일화 6.4%, 사물 스타일화 4.5%로 비교적 고르게 분포한다.
  3. CoinVE-Edit은 Wan2.1-T2V-14B 영상 생성 모델과 Qwen3VL-8B 이해 모델을 결합하고, 각 지시문이 담당하는 영상 속 위치(영역)를 미리 예측해 그 영역에만 해당 지시가 작동하도록 어텐션을 분리하는 방식으로 지시문 간 간섭을 줄였다.
  4. OpenVE-Bench(단일 지시)와 자체 CoinVE-Bench(복합 지시) 실험에서 CoinVE-Edit은 오픈소스 모델은 물론 상용 모델 Seedance 2.0, Kling O3보다도 편집 영역 정확도(89.45, 최고 경쟁 모델 대비 1.74 우위) 등에서 앞섰고, 지시문을 그냥 이어붙이거나 단순한 방식으로 영역을 지정한 변형 모델보다도 정확도와 영상 자연스러움 모두에서 우수했다.
Table 1: Evaluation matrix of CoinVE-Bench. The proposed metrics are grouped by evaluator type into MLLM-based checklist evaluation and specialized evaluator-based evaluation with task-specific models, covering four evaluation dimensions and eleven fine-grained metrics.
DimensionMetric (Abbr.)RangeEvaluatorDescription
MLLM-Based (Gemini 3.6 Flash)
Editing Accuracy (per Instruction)Semantic Accuracy (SA)[0,100]MLLM + checklistCorrect execution of the intended edit semantics
Scope Accuracy (SPA)[0,100]MLLM + checklistCorrect edit localization without leakage or interference
Editing Persistence (EP)[0,100]MLLM + checklistTemporal consistency of the edit throughout the video
Physical NaturalnessAppearance Naturalness (AN)[0,100]MLLM + checklistNatural blending of lighting, shadows, textures, and style
Scale Consistency (SC)[0,100]MLLM + checklistPlausibility of the edited object’s scale and perspective
Motion Naturalness (MN)[0,100]MLLM + checklistPlausibility of motion and physical interactions
Semantic PreservationContent Preservation (CP)[0,100]MLLM + checklistPreservation of non-edited regions, objects, and structures
Specialized Evaluator-Based
Video QualityAesthetic Quality (AQ)[1,10]Aesthetic Predictor v2.5Overall frame-level aesthetic appeal
Technical Quality (TQ)(1, 100)DOVER++Technical blur, noise, compression, flicker, and jitter
Comprehensive Quality (CQ)[1, 5]VisualQuality-R1Overall frame-level visual quality
Temporal Stability (TS)[0, 1]Optical-flow fieldsTemporal motion smoothness
Table 2: Single-instruction video editing comparison on OpenVE-Bench evaluated by Gemini 2.5 Pro.
ModelOverallGlobal StyleBackground ChangeLocal ChangeLocal RemoveLocal AddSubtitle Edit
Runway3.513.722.624.184.162.783.62
VACE1.551.491.552.071.461.261.48
Ditto2.254.011.682.031.531.412.81
OpenVE-Edit2.573.162.362.981.852.152.91
VINO2.914.051.673.123.322.662.64
OmniWeaving3.013.942.033.492.932.063.58
KiwiEdit3.173.602.633.873.312.832.75
SAMA3.333.872.643.913.312.633.63
CoinVE-Edit3.413.613.113.843.812.533.53
Table 3: Compositional-Instruction Video Editing Comparisons on CoinVE-Bench.
ModelEdit. Acc.Phys. Natural.Seman. Pres.Video Quality
SASPAEPANSCMNCPAQTQCQTS
Seedance 2.085.3487.7188.0893.1995.8492.8793.914.4719.554.410.62
Kling O386.9180.9389.0692.5590.3093.9184.514.4918.364.370.61
VACE3.9817.156.5026.6913.8215.2187.834.0517.594.110.62
Ditto34.6936.4140.8535.9647.7938.4851.983.5917.243.960.67
VINO83.6366.7589.0678.0982.3485.9161.704.0617.284.080.68
OmniWeaving59.6755.9461.1154.4966.0365.1075.093.7917.953.840.62
KiwiEdit76.5069.9280.2878.3778.5080.7670.314.1419.334.300.68
SAMA75.5873.3579.6383.4383.8888.1490.083.6118.084.190.72
CoinVE-Edit87.9789.4589.6091.8591.1795.3090.834.1319.574.310.72
Table 4: Performance comparison among different variants of CoinVE-Edit on CoinVE-Bench.
VariantComponentsEdit. Acc.Phys. Natural.Seman. Pres.
MaskQ-BlendingSASPAEPANSCMNCP
Instr.-Concat.××82.6184.4389.1786.5290.0292.1789.30
Q-Bias×83.3585.4988.1987.0889.6491.9590.13
CoinVE-Edit87.9789.4589.6091.8591.1795.3090.83

왜 중요한가

실제 영상 편집 요청은 배경만 바꾸거나 물체 하나만 지우는 단순한 경우보다 여러 요청이 섞인 경우가 많은데, 이 데이터셋과 모델은 그런 복합 요청을 정확한 위치에만 반영하고 나머지는 그대로 보존하는 능력을 훈련하고 검증할 수 있는 토대를 제공한다. 데이터셋과 벤치마크가 공개되면 상용 영상 생성 서비스들도 복합 편집 성능을 끌어올리는 기준점으로 삼을 수 있다.

이 논문의 용어

  • MLLM(멀티모달 대형언어모델) · 이미지·영상과 텍스트를 함께 이해하는 대형 언어모델
  • DiT(Diffusion Transformer) · 트랜스포머 구조를 쓴 확산 기반 영상 생성 모델
  • 어텐션(attention) · 모델이 입력의 어느 부분에 집중할지 계산하는 메커니즘
  • SAM2/SAM3 · 이미지·영상에서 특정 대상의 영역(마스크)을 자동으로 찾아주는 분할 모델
  • Q-Blending 크로스어텐션 · 편집 지시별 영역 정보를 부드럽게 섞어 넣어 지시끼리 간섭을 줄이는 CoinVE-Edit의 어텐션 방식

본문에 싣지 못한 그림

  • Figure 1: Demonstration of compositional instruction-guided video editing cases from our proposed CoinVE-200K.
  • Figure 2: Data construction pipeline of CoinVE-200K.
  • Figure 3: Data statistics of CoinVE-200K.
  • Figure 4: An overview of the proposed CoinVE-Edit framework.
  • Figure 5: Quality comparison of single-instruction video editing on OpenVE-Bench.
  • Figure 6: Quality comparison of compositional-instruction video editing on CoinVE-Bench.
  • Figure 7: Visualization of predicted editing mask of each instruction for two editing examples.
원문에서 그림 보기 →

저자 · Fuchen Long

arXiv에서 원문 보기

최신 논문

논문 전체 보기 →

METAL MEDIA 최신 기사