K-文化的一切——从回归到 K-美妆,发送到您的邮箱订阅邮件

METAL MEDIA

CoinVE-200K: A Large-Scale High-Quality Dataset for Compositional Instruction-Guided Video Editing

arXiv:2608.175662026-08-17

新数据集和模型让AI能在一个视频里同时准确执行多条编辑指令而互不干扰

现有的指令视频编辑数据集大多只处理单一编辑操作,比如换背景或去掉一个物体,但用户实际常常一次性提出多个编辑需求。这篇论文发布了CoinVE-200K,一个每个视频配有2到5条组合编辑指令、共20万对的数据集,以及基于此训练的220亿参数模型CoinVE-Edit,能让多条指令各自作用在正确区域而不互相干扰,同时还配套发布了专用评测基准CoinVE-Bench。

METAL MEDIA 解读图

新数据集和模型让AI能在一个视频里同时准确执行多条编辑指令而互不干扰

  1. 01从最长201帧、1080p分辨率的原始视频出发,团队围绕人物、物体、背景组合了添加、删除、修改、风格化等六种编辑类型生成多指令提示词,用基于分割掩码的方式合成编辑后视频,再用Gemini 2.5 Pro严格筛选,最终保留20万条高质量视频编辑对。
  2. 02最终数据集平均每个视频含2.55条指令(含2条的占57.7%、3条31.7%、4条8.5%、5条2.1%),编辑类型分布较均衡:局部添加24.1%、背景替换23.8%、物体替换22.8%、局部删除18.5%、背景风格化6.4%、物体风格化4.5%。
  3. 03CoinVE-Edit结合了Wan2.1-T2V-14B视频生成骨干和Qwen3VL-8B理解模型,通过预测每条指令对应的视频空间区域,并将不同指令的注意力机制解耦,使编辑只作用于对应区域,避免相互干扰。
  4. 04在单指令基准OpenVE-Bench和新提出的多指令基准CoinVE-Bench上,CoinVE-Edit不仅超过开源模型,在区域编辑准确率等指标上也优于商业模型Seedance 2.0和Kling O3(区域准确率89.45,领先最佳竞品1.74),同时优于把指令直接拼接或采用简单区域注入方式的简化版本。
这是 METAL MEDIA 制作的解读图,并非论文作者提供的原图。

他们做了什么

  1. 从最长201帧、1080p分辨率的原始视频出发,团队围绕人物、物体、背景组合了添加、删除、修改、风格化等六种编辑类型生成多指令提示词,用基于分割掩码的方式合成编辑后视频,再用Gemini 2.5 Pro严格筛选,最终保留20万条高质量视频编辑对。
  2. 最终数据集平均每个视频含2.55条指令(含2条的占57.7%、3条31.7%、4条8.5%、5条2.1%),编辑类型分布较均衡:局部添加24.1%、背景替换23.8%、物体替换22.8%、局部删除18.5%、背景风格化6.4%、物体风格化4.5%。
  3. CoinVE-Edit结合了Wan2.1-T2V-14B视频生成骨干和Qwen3VL-8B理解模型,通过预测每条指令对应的视频空间区域,并将不同指令的注意力机制解耦,使编辑只作用于对应区域,避免相互干扰。
  4. 在单指令基准OpenVE-Bench和新提出的多指令基准CoinVE-Bench上,CoinVE-Edit不仅超过开源模型,在区域编辑准确率等指标上也优于商业模型Seedance 2.0和Kling O3(区域准确率89.45,领先最佳竞品1.74),同时优于把指令直接拼接或采用简单区域注入方式的简化版本。
Table 1: Evaluation matrix of CoinVE-Bench. The proposed metrics are grouped by evaluator type into MLLM-based checklist evaluation and specialized evaluator-based evaluation with task-specific models, covering four evaluation dimensions and eleven fine-grained metrics.
DimensionMetric (Abbr.)RangeEvaluatorDescription
MLLM-Based (Gemini 3.6 Flash)
Editing Accuracy (per Instruction)Semantic Accuracy (SA)[0,100]MLLM + checklistCorrect execution of the intended edit semantics
Scope Accuracy (SPA)[0,100]MLLM + checklistCorrect edit localization without leakage or interference
Editing Persistence (EP)[0,100]MLLM + checklistTemporal consistency of the edit throughout the video
Physical NaturalnessAppearance Naturalness (AN)[0,100]MLLM + checklistNatural blending of lighting, shadows, textures, and style
Scale Consistency (SC)[0,100]MLLM + checklistPlausibility of the edited object’s scale and perspective
Motion Naturalness (MN)[0,100]MLLM + checklistPlausibility of motion and physical interactions
Semantic PreservationContent Preservation (CP)[0,100]MLLM + checklistPreservation of non-edited regions, objects, and structures
Specialized Evaluator-Based
Video QualityAesthetic Quality (AQ)[1,10]Aesthetic Predictor v2.5Overall frame-level aesthetic appeal
Technical Quality (TQ)(1, 100)DOVER++Technical blur, noise, compression, flicker, and jitter
Comprehensive Quality (CQ)[1, 5]VisualQuality-R1Overall frame-level visual quality
Temporal Stability (TS)[0, 1]Optical-flow fieldsTemporal motion smoothness
Table 2: Single-instruction video editing comparison on OpenVE-Bench evaluated by Gemini 2.5 Pro.
ModelOverallGlobal StyleBackground ChangeLocal ChangeLocal RemoveLocal AddSubtitle Edit
Runway3.513.722.624.184.162.783.62
VACE1.551.491.552.071.461.261.48
Ditto2.254.011.682.031.531.412.81
OpenVE-Edit2.573.162.362.981.852.152.91
VINO2.914.051.673.123.322.662.64
OmniWeaving3.013.942.033.492.932.063.58
KiwiEdit3.173.602.633.873.312.832.75
SAMA3.333.872.643.913.312.633.63
CoinVE-Edit3.413.613.113.843.812.533.53
Table 3: Compositional-Instruction Video Editing Comparisons on CoinVE-Bench.
ModelEdit. Acc.Phys. Natural.Seman. Pres.Video Quality
SASPAEPANSCMNCPAQTQCQTS
Seedance 2.085.3487.7188.0893.1995.8492.8793.914.4719.554.410.62
Kling O386.9180.9389.0692.5590.3093.9184.514.4918.364.370.61
VACE3.9817.156.5026.6913.8215.2187.834.0517.594.110.62
Ditto34.6936.4140.8535.9647.7938.4851.983.5917.243.960.67
VINO83.6366.7589.0678.0982.3485.9161.704.0617.284.080.68
OmniWeaving59.6755.9461.1154.4966.0365.1075.093.7917.953.840.62
KiwiEdit76.5069.9280.2878.3778.5080.7670.314.1419.334.300.68
SAMA75.5873.3579.6383.4383.8888.1490.083.6118.084.190.72
CoinVE-Edit87.9789.4589.6091.8591.1795.3090.834.1319.574.310.72
Table 4: Performance comparison among different variants of CoinVE-Edit on CoinVE-Bench.
VariantComponentsEdit. Acc.Phys. Natural.Seman. Pres.
MaskQ-BlendingSASPAEPANSCMNCP
Instr.-Concat.××82.6184.4389.1786.5290.0292.1789.30
Q-Bias×83.3585.4988.1987.0889.6491.9590.13
CoinVE-Edit87.9789.4589.6091.8591.1795.3090.83

为什么重要

现实中的视频编辑需求往往是多个改动叠加而非单一操作,这套数据集和模型为训练与检验AI能否把每条指令精确落到对应区域、同时保持其余内容不变提供了具体基础。评测结果显示即便是领先的商业视频模型也存在明显不足,这也为整个行业提升组合编辑质量提供了可参照的目标。

本文术语

  • MLLM(多模态大语言模型) · 能够同时理解图像/视频和文本的大型语言模型
  • DiT(扩散Transformer) · 在扩散生成过程中使用Transformer结构的视频/图像生成模型
  • 注意力机制(attention) · 模型用来决定关注输入哪些部分的计算方式
  • SAM2/SAM3 · 能在图像或视频中自动找出目标对象所在区域(掩码)的分割模型
  • Q-Blending交叉注意力 · CoinVE-Edit中用于柔和地注入各指令对应区域信息、减少指令间干扰的注意力方法

无法转载的图表

  • Figure 1: Demonstration of compositional instruction-guided video editing cases from our proposed CoinVE-200K.
  • Figure 2: Data construction pipeline of CoinVE-200K.
  • Figure 3: Data statistics of CoinVE-200K.
  • Figure 4: An overview of the proposed CoinVE-Edit framework.
  • Figure 5: Quality comparison of single-instruction video editing on OpenVE-Bench.
  • Figure 6: Quality comparison of compositional-instruction video editing on CoinVE-Bench.
  • Figure 7: Visualization of predicted editing mask of each instruction for two editing examples.
在原文中查看图表 →

论文原文摘要(英文)

The quality and diversity of instruction-based video editing datasets are steadily improving, yet existing datasets mainly focus on single editing operations and fall short in supporting compositional instruction-guided video editing. In particular, multiple editing intents must be jointly understood and faithfully executed within the same video. To address this issue, we introduce CoinVE-200K, a large-scale, high-quality dataset for Compositional Instruction-Guided Video Editing. CoinVE-200K contains 1080p video-editing pairs of up to 201 frames, covering diverse compositional scenarios where each sample involves 2 to 5 atomic editing operations. The instructions target humans, objects, and backgrounds, and cover edit types such as addition, removal, modification, and stylization. All samples are built through a carefully designed generation and filtering pipeline to ensure instruction faithfulness, visual quality, temporal consistency, and compositional diversity. We also introduce CoinVE-Bench, a benchmark for compositional-instruction video editing across diverse subjects, operation types, and instruction complexities. Furthermore, we present CoinVE-Edit, a 22B compositional video editing model built upon Wan2.1-T2V-14B and Qwen3-VL-8B-Instruct. CoinVE-Edit disentangles region-aware attention for different editing instructions, enabling precise multi-region editing while preserving irrelevant content and temporal coherence. Experiments on CoinVE-Bench show that CoinVE-Edit achieves strong performance in instruction following, compositional editing accuracy, visual quality, and temporal consistency.

作者 · Fuchen Long

在 arXiv 阅读

最新论文

全部论文 →

METAL MEDIA 最新报道