한 문장에 담긴 여러 편집 지시를 동시에 실행하는 영상 편집 데이터셋과 모델이 나왔다
한 문장에 담긴 여러 편집 지시를 동시에 실행하는 영상 편집 데이터셋과 모델이 나왔다
기존 영상 편집 데이터셋은 배경 바꾸기, 물체 지우기 같은 한 가지 지시만 다루는데, 실제 사용자는 여러 편집을 한 번에 요청한다. 이 논문은 한 영상에 2~5개의 편집 지시가 동시에 들어간 20만 개 영상 쌍 데이터셋 CoinVE-200K와, 이를 학습해 여러 지시를 서로 헷갈리지 않고 정확한 영역에만 적용하는 220억 개 파라미터 규모 모델 CoinVE-Edit을 함께 내놓았다. 평가를 위한 전용 벤치마크 CoinVE-Bench도 함께 공개했다.
METAL MEDIA 해설 도표
한 문장에 담긴 여러 편집 지시를 동시에 실행하는 영상 편집 데이터셋과 모델이 나왔다
- 011080p 해상도, 최대 201프레임짜리 원본 영상에서 사람·사물·배경을 대상으로 추가·삭제·수정·스타일 변경 등 6가지 편집 유형을 조합해 지시문을 만들고, 마스크 기반 방식으로 편집 영상을 합성한 뒤 Gemini 2.5 Pro로 엄격하게 걸러내 20만 개의 고품질 영상-편집 쌍을 완성했다.
- 02완성된 데이터셋은 영상당 평균 2.55개 지시문을 포함하며(2개 57.7%, 3개 31.7%, 4개 8.5%, 5개 2.1%), 지역 추가 24.1%, 배경 교체 23.8%, 사물 교체 22.8%, 지역 삭제 18.5%, 배경 스타일화 6.4%, 사물 스타일화 4.5%로 비교적 고르게 분포한다.
- 03CoinVE-Edit은 Wan2.1-T2V-14B 영상 생성 모델과 Qwen3VL-8B 이해 모델을 결합하고, 각 지시문이 담당하는 영상 속 위치(영역)를 미리 예측해 그 영역에만 해당 지시가 작동하도록 어텐션을 분리하는 방식으로 지시문 간 간섭을 줄였다.
- 04OpenVE-Bench(단일 지시)와 자체 CoinVE-Bench(복합 지시) 실험에서 CoinVE-Edit은 오픈소스 모델은 물론 상용 모델 Seedance 2.0, Kling O3보다도 편집 영역 정확도(89.45, 최고 경쟁 모델 대비 1.74 우위) 등에서 앞섰고, 지시문을 그냥 이어붙이거나 단순한 방식으로 영역을 지정한 변형 모델보다도 정확도와 영상 자연스러움 모두에서 우수했다.
무엇을 했나
- 1080p 해상도, 최대 201프레임짜리 원본 영상에서 사람·사물·배경을 대상으로 추가·삭제·수정·스타일 변경 등 6가지 편집 유형을 조합해 지시문을 만들고, 마스크 기반 방식으로 편집 영상을 합성한 뒤 Gemini 2.5 Pro로 엄격하게 걸러내 20만 개의 고품질 영상-편집 쌍을 완성했다.
- 완성된 데이터셋은 영상당 평균 2.55개 지시문을 포함하며(2개 57.7%, 3개 31.7%, 4개 8.5%, 5개 2.1%), 지역 추가 24.1%, 배경 교체 23.8%, 사물 교체 22.8%, 지역 삭제 18.5%, 배경 스타일화 6.4%, 사물 스타일화 4.5%로 비교적 고르게 분포한다.
- CoinVE-Edit은 Wan2.1-T2V-14B 영상 생성 모델과 Qwen3VL-8B 이해 모델을 결합하고, 각 지시문이 담당하는 영상 속 위치(영역)를 미리 예측해 그 영역에만 해당 지시가 작동하도록 어텐션을 분리하는 방식으로 지시문 간 간섭을 줄였다.
- OpenVE-Bench(단일 지시)와 자체 CoinVE-Bench(복합 지시) 실험에서 CoinVE-Edit은 오픈소스 모델은 물론 상용 모델 Seedance 2.0, Kling O3보다도 편집 영역 정확도(89.45, 최고 경쟁 모델 대비 1.74 우위) 등에서 앞섰고, 지시문을 그냥 이어붙이거나 단순한 방식으로 영역을 지정한 변형 모델보다도 정확도와 영상 자연스러움 모두에서 우수했다.
| Dimension | Metric (Abbr.) | Range | Evaluator | Description |
|---|---|---|---|---|
| MLLM-Based (Gemini 3.6 Flash) | ||||
| Editing Accuracy (per Instruction) | Semantic Accuracy (SA) | [0,100] | MLLM + checklist | Correct execution of the intended edit semantics |
| Scope Accuracy (SPA) | [0,100] | MLLM + checklist | Correct edit localization without leakage or interference | |
| Editing Persistence (EP) | [0,100] | MLLM + checklist | Temporal consistency of the edit throughout the video | |
| Physical Naturalness | Appearance Naturalness (AN) | [0,100] | MLLM + checklist | Natural blending of lighting, shadows, textures, and style |
| Scale Consistency (SC) | [0,100] | MLLM + checklist | Plausibility of the edited object’s scale and perspective | |
| Motion Naturalness (MN) | [0,100] | MLLM + checklist | Plausibility of motion and physical interactions | |
| Semantic Preservation | Content Preservation (CP) | [0,100] | MLLM + checklist | Preservation of non-edited regions, objects, and structures |
| Specialized Evaluator-Based | ||||
| Video Quality | Aesthetic Quality (AQ) | [1,10] | Aesthetic Predictor v2.5 | Overall frame-level aesthetic appeal |
| Technical Quality (TQ) | (1, 100) | DOVER++ | Technical blur, noise, compression, flicker, and jitter | |
| Comprehensive Quality (CQ) | [1, 5] | VisualQuality-R1 | Overall frame-level visual quality | |
| Temporal Stability (TS) | [0, 1] | Optical-flow fields | Temporal motion smoothness |
| Model | Overall | Global Style | Background Change | Local Change | Local Remove | Local Add | Subtitle Edit |
|---|---|---|---|---|---|---|---|
| Runway | 3.51 | 3.72 | 2.62 | 4.18 | 4.16 | 2.78 | 3.62 |
| VACE | 1.55 | 1.49 | 1.55 | 2.07 | 1.46 | 1.26 | 1.48 |
| Ditto | 2.25 | 4.01 | 1.68 | 2.03 | 1.53 | 1.41 | 2.81 |
| OpenVE-Edit | 2.57 | 3.16 | 2.36 | 2.98 | 1.85 | 2.15 | 2.91 |
| VINO | 2.91 | 4.05 | 1.67 | 3.12 | 3.32 | 2.66 | 2.64 |
| OmniWeaving | 3.01 | 3.94 | 2.03 | 3.49 | 2.93 | 2.06 | 3.58 |
| KiwiEdit | 3.17 | 3.60 | 2.63 | 3.87 | 3.31 | 2.83 | 2.75 |
| SAMA | 3.33 | 3.87 | 2.64 | 3.91 | 3.31 | 2.63 | 3.63 |
| CoinVE-Edit | 3.41 | 3.61 | 3.11 | 3.84 | 3.81 | 2.53 | 3.53 |
| Model | Edit. Acc. | Phys. Natural. | Seman. Pres. | Video Quality | |||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| SA | SPA | EP | AN | SC | MN | CP | AQ | TQ | CQ | TS | |
| Seedance 2.0 | 85.34 | 87.71 | 88.08 | 93.19 | 95.84 | 92.87 | 93.91 | 4.47 | 19.55 | 4.41 | 0.62 |
| Kling O3 | 86.91 | 80.93 | 89.06 | 92.55 | 90.30 | 93.91 | 84.51 | 4.49 | 18.36 | 4.37 | 0.61 |
| VACE | 3.98 | 17.15 | 6.50 | 26.69 | 13.82 | 15.21 | 87.83 | 4.05 | 17.59 | 4.11 | 0.62 |
| Ditto | 34.69 | 36.41 | 40.85 | 35.96 | 47.79 | 38.48 | 51.98 | 3.59 | 17.24 | 3.96 | 0.67 |
| VINO | 83.63 | 66.75 | 89.06 | 78.09 | 82.34 | 85.91 | 61.70 | 4.06 | 17.28 | 4.08 | 0.68 |
| OmniWeaving | 59.67 | 55.94 | 61.11 | 54.49 | 66.03 | 65.10 | 75.09 | 3.79 | 17.95 | 3.84 | 0.62 |
| KiwiEdit | 76.50 | 69.92 | 80.28 | 78.37 | 78.50 | 80.76 | 70.31 | 4.14 | 19.33 | 4.30 | 0.68 |
| SAMA | 75.58 | 73.35 | 79.63 | 83.43 | 83.88 | 88.14 | 90.08 | 3.61 | 18.08 | 4.19 | 0.72 |
| CoinVE-Edit | 87.97 | 89.45 | 89.60 | 91.85 | 91.17 | 95.30 | 90.83 | 4.13 | 19.57 | 4.31 | 0.72 |
| Variant | Components | Edit. Acc. | Phys. Natural. | Seman. Pres. | |||||
|---|---|---|---|---|---|---|---|---|---|
| Mask | Q-Blending | SA | SPA | EP | AN | SC | MN | CP | |
| Instr.-Concat. | × | × | 82.61 | 84.43 | 89.17 | 86.52 | 90.02 | 92.17 | 89.30 |
| Q-Bias | ✓ | × | 83.35 | 85.49 | 88.19 | 87.08 | 89.64 | 91.95 | 90.13 |
| CoinVE-Edit | ✓ | ✓ | 87.97 | 89.45 | 89.60 | 91.85 | 91.17 | 95.30 | 90.83 |
왜 중요한가
실제 영상 편집 요청은 배경만 바꾸거나 물체 하나만 지우는 단순한 경우보다 여러 요청이 섞인 경우가 많은데, 이 데이터셋과 모델은 그런 복합 요청을 정확한 위치에만 반영하고 나머지는 그대로 보존하는 능력을 훈련하고 검증할 수 있는 토대를 제공한다. 데이터셋과 벤치마크가 공개되면 상용 영상 생성 서비스들도 복합 편집 성능을 끌어올리는 기준점으로 삼을 수 있다.
이 논문의 용어
- MLLM(멀티모달 대형언어모델) · 이미지·영상과 텍스트를 함께 이해하는 대형 언어모델
- DiT(Diffusion Transformer) · 트랜스포머 구조를 쓴 확산 기반 영상 생성 모델
- 어텐션(attention) · 모델이 입력의 어느 부분에 집중할지 계산하는 메커니즘
- SAM2/SAM3 · 이미지·영상에서 특정 대상의 영역(마스크)을 자동으로 찾아주는 분할 모델
- Q-Blending 크로스어텐션 · 편집 지시별 영역 정보를 부드럽게 섞어 넣어 지시끼리 간섭을 줄이는 CoinVE-Edit의 어텐션 방식
본문에 싣지 못한 그림
- Figure 1: Demonstration of compositional instruction-guided video editing cases from our proposed CoinVE-200K.
- Figure 2: Data construction pipeline of CoinVE-200K.
- Figure 3: Data statistics of CoinVE-200K.
- Figure 4: An overview of the proposed CoinVE-Edit framework.
- Figure 5: Quality comparison of single-instruction video editing on OpenVE-Bench.
- Figure 6: Quality comparison of compositional-instruction video editing on CoinVE-Bench.
- Figure 7: Visualization of predicted editing mask of each instruction for two editing examples.
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다AI 모델을 '소유'하지 못한 조직은 안전 통제도 절반밖에 못 한다
- AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다AI가 선생님 모델을 따라 배우다가, 정답에 다가가는 '좋은 생각'까지 억누르는 문제를 잡아낸다
- AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다AI가 특정 사람 말투를 흉내내도록 시켜봤더니, 결국 AI 자신의 말투에서 못 벗어난다