VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System
让视频生成AI先用可执行的Blender代码把物理过程画成草稿,再变成逼真视频
文本生成视频模型常常在物理动态上出错,因为一句压缩的提示词要求模型隐式推断整个时间演化过程。VideoCoCo让编码智能体编写并运行Blender程序,渲染出画质低但物理上逐帧一致的草稿视频,再由编辑模型把这个草稿转化为逼真的最终视频。在两个物理一致性基准上,把VideoCoCo加到基线模型OmniWeaving上,PhyGenBench平均分从0.475提升到0.558,VBench-2.0平均分从52.18%提升到77.88%。
METAL MEDIA 解读图
VideoCoCo双引擎流程
证据状态已报告实测结果
- 文本提示词用户输入的压缩物理事件描述
- 编码智能体与仿真引擎编写并在沙盒中运行Blender Python程序,渲染出时间上密集但画质低的白模草稿视频
- 指令智能体同时阅读提示词和草稿,写出聚焦主体、材质、光照与风格的编辑指令
- 生成视频引擎(编辑模型)在VideoCoCo-3K上用LoRA适配的编辑模型,以草稿和指令为条件生成逼真的最终视频
- 基准验证在PhyGenBench和VBench-2.0上测得相对OmniWeaving基线的平均分提升
他们做了什么
- 论文指出此前的思维链方法(文本计划、关键帧或候选搜索)要么不可执行,要么时间上过于稀疏,难以完整控制时空过程。
- 第一阶段可执行仿真引擎:编码智能体根据提示词编写一个自包含的Blender Python程序,明确场景及其随时间的演变,再由沙盒执行渲染出画质低但每一帧都物理确定的白模草稿视频。
- 第二阶段生成视频引擎:指令智能体同时读取原始提示词和草稿视频,写出聚焦外观(主体、材质、光照、镜头风格)的编辑指令,连同草稿一起输入视频编辑模型,生成逼真的最终视频。
- 团队构建了VideoCoCo-3K数据集,包含草稿-指令-目标三元组,由智能体流水线和高保真教师模型Seedance 2.0生成,用于让编辑模型学会处理仿真草稿。
- 编辑器适配方式的消融实验显示,即使不做任何微调,仅靠草稿条件就能提升分数(0.475到0.506),而轻量级LoRA微调效果优于全参数微调(0.558对0.535)。

| Method | Mechanics (↑) | Optics (↑) | Thermal (↑) | Material (↑) | Average (↑) | |
|---|---|---|---|---|---|---|
| Closed | Pika [28] | 0.35 | 0.56 | 0.43 | 0.39 | 0.44 |
| Gen-3 [29] | 0.45 | 0.57 | 0.49 | 0.51 | 0.51 | |
| Kling [15] | 0.45 | 0.58 | 0.50 | 0.40 | 0.49 | |
| Open | CogVideoX [48] | 0.39 | 0.55 | 0.40 | 0.42 | 0.45 |
| Open-Sora V1.2 [54] | 0.43 | 0.50 | 0.44 | 0.37 | 0.44 | |
| LaVie [39] | 0.30 | 0.44 | 0.38 | 0.32 | 0.36 | |
| Vchitect-2.0 [6] | 0.41 | 0.56 | 0.44 | 0.37 | 0.45 | |
| HunyuanVideo [13] | 0.33 | 0.39 | 0.26 | 0.30 | 0.33 | |
| Wan2.2-TI2V-5B [34] | 0.55 | 0.58 | 0.53 | 0.50 | 0.54 | |
| Cosmos-Predict2.5 [25] | 0.30 | 0.33 | 0.41 | 0.39 | 0.35 | |
| LTX-Video-2B [7] | 0.51 | 0.58 | 0.48 | 0.45 | 0.51 | |
| Ours | OmniWeaving [27] | 0.48 | 0.56 | 0.43 | 0.39 | 0.48 |
| + VideoCoCo | 0.56 | 0.61 | 0.51 | 0.53 | 0.56 |

| Method | Mechanics (↑) | Thermotics (↑) | Material (↑) | Average (↑) | |
|---|---|---|---|---|---|
| Closed | Sora [3] | 62.22% | 43.36% | 64.94% | 56.84% |
| Kling 1.6 [14] | 65.55% | 59.46% | 68.00% | 64.34% | |
| Open | HunyuanVideo [13] | 76.09% | 56.52% | 64.37% | 65.66% |
| CogVideoX-1.5 [48] | 80.80% | 67.13% | 83.19% | 77.04% | |
| Ours | OmniWeaving [27] | 62.79% | 52.08% | 41.67% | 52.18% |
| + VideoCoCo | 92.31% | 72.92% | 68.42% | 77.88% |

| Method | Mech. (↑) | Opt. (↑) | Therm. (↑) | Mat. (↑) | Avg. (↑) |
|---|---|---|---|---|---|
| OmniWeaving [27] | 0.48 | 0.56 | 0.43 | 0.39 | 0.48 |
| + VideoCoCo (Tune-Free) | 0.50 | 0.53 | 0.48 | 0.51 | 0.51 |
| + VideoCoCo (Full-Tune) | 0.51 | 0.61 | 0.51 | 0.49 | 0.54 |
| + VideoCoCo (LoRA-Tune) | 0.56 | 0.61 | 0.51 | 0.53 | 0.56 |
研究结果
- 在PhyGenBench上,把VideoCoCo加到OmniWeaving上后平均物理一致性得分从0.475升至0.558,是表中所有系统里的最好成绩,其中材料动态(+0.133)和热学动态(+0.078)提升最大。
- 在VBench-2.0上,OmniWeaving单独得分为52.18%,加入VideoCoCo后升至77.88%,提升25.70个百分点,并在力学(92.31%)和热学(72.92%)上取得最高分,材料维度以68.42%排名第二,仅次于CogVideoX-1.5的83.19%。
- 在PhyGenBench上对编辑器适配方式的消融实验中,不做任何微调、仅用草稿作条件的版本已将平均分从0.475提升到0.506;全参数微调达到0.535;LoRA微调取得最佳平均分0.558。
可应用场景
- 需要精确呈现升华、蒸发/凝固、撞击破碎、浮力等明确物理过程的视频内容制作流程。
- 先根据提示词生成并检查一个物理仿真草稿,再将其转化为逼真视频的工作流设计。
- 教育或可视化场景中,需要将物理现象的中间步骤以代码形式检查或修改后再渲染的场合。
局限与待验证事项
- 作者指出,像湍流这类高度复杂的现象超出了Blender仿真器的表达能力,难以零样本合成。
- 草稿渲染加编辑的两阶段流程比单阶段生成增加了额外的推理延迟。
- 作者表示未来工作将探索整合Taichi等专用物理引擎,并研究通过知识蒸馏把这些可执行先验直接内化到端到端视频模型中。
为什么重要
视频生成模型在物理动态上的不一致一直是把它们用作世界模型或内容生产工具的主要障碍,这项工作说明先用可执行代码固定过程、再单独处理外观的方式能明显缩小这一差距。由于程序、草稿视频和编辑指令都是可读的中间产物,整条流程比端到端的黑箱生成更容易检查、调试和复现。
本文术语
- 思维链(Chain-of-Thought, CoT) · 让模型先走过中间推理步骤,而不是直接给出结果
- Blender · 一款可以搭建三维场景并运行物理仿真的开源软件
- 沙盒(Sandbox) · 一个隔离、安全且行为确定的程序运行环境
- LoRA · 一种只更新少量低秩参数、而非整个模型的轻量级微调方法
- OmniWeaving · 本研究用作对比基线的现有视频生成模型
论文原文摘要(英文)
Text-to-video models have achieved remarkable visual quality, yet they still struggle to generate physically consistent dynamics because the temporal evolution of a scene must be inferred implicitly from a highly compressed text prompt. Existing chain-of-thought approaches introduce intermediate plans or visual states, but these representations are typically non-executable or temporally sparse, limiting their ability to instantiate and control the complete spatiotemporal process. To address this
在 arXiv 阅读最新论文
- SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?让AI编程助手去修复真实科学软件,连最强的那个也有一半以上任务没做对
- FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving把稀疏注意力从论文原型变成能真正上线服务的加速方案
- PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents让客服AI坐席不只是拦住一个危险动作,而是把整个流程走对
- EXIMO: VLM Guided Exploration of VLA Policies不用人工遥控演示,让会说话的AI来教机械臂做新家务
- EnvHarness: Awakening Static Worlds for Agent Learning不重新搭建训练环境,而是给现有环境套一层可插拔组件,针对每个智能体的具体弱点重新塑形
- Bounded Sovereignty and the Control Tax: Pricing AI Oversight When the Deployer Does Not Own the Model租用AI而非拥有AI的机构,安全监管能力只剩一半
- Beyond Imitation: Filtering On-Policy Distillation by Reasoning ProgressAI模仿老师模型学习时,会误伤本来推理正确的步骤,新方法专门过滤掉这种误伤
- PersonalBench: Measuring the Authorship Gap in LLM Personalization让AI模仿某人的文风,结果发现它始终摆脱不了自己的腔调
METAL MEDIA 最新报道
图片来源: Haodong Li et al., arXiv:2607.27380, CC BY 4.0