OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models
在同时看视频、听声音的AI模型中,让一种感官替另一种感官做决定,可能会把答案丢掉
同时处理音频和视频的全模态大语言模型需要削减需要处理的信息片段(token)数量才能实时运行,但现有方法通常让一种模态(比如音频)的重要性分数来决定另一种模态(视频)该保留什么。本文指出,面对同一个问题,音频和视频真正重要的时刻往往并不一致,据此提出了OmniScope:让每种模态都以问题为共同基准,各自独立判断自己的相关性,而不是互相引导。该方法无需额外训练,在四个基准和两种模型规模上,在各种压缩比例下都取得了最高的平均准确率。
METAL MEDIA 解读图
OmniScope的三阶段压缩流程
证据状态已报告实测结果
- 基于查询的打分以同一个问题为基准,视频侧用CLIP、音频侧用模型自身的内部嵌入分别独立计算相关性分数,并据此分配各自的token预算
- 视频剪枝(AD-STC)偶数帧保留整体场景信息,奇数帧只保留相对前一帧发生变化的部分,同时保留全局语境和时间变化信息
- 音频合并在每一秒内将相似的音频token两两配对并取平均合并,减少冗余同时保持时间上的连续性
- 性能验证在四个基准、两种模型规模上,仅保留25%到45%的token测量准确率、速度和显存,结果优于对比方法
他们做了什么
- 问题所在:现有的全模态token压缩方法通常用一种模态(多为音频)的重要性分数来决定另一种模态(视频)保留哪些token,但同一个问题下,音频和视频真正重要的时刻常常不同,这种单向引导在压缩比较高时容易丢掉回答问题所需的关键信息。
- 方法设计:OmniScope把用户提出的问题作为两种模态共享的基准,但让音频和视频各自独立计算与问题的相关性分数,并据此分配各自的token预算。视频侧采用锚点-增量交替策略(AD-STC),部分帧保留整体场景信息、部分帧只保留相对前一帧发生变化的部分;音频侧则在每一秒内合并相似的token,在减少冗余的同时保持时间上的连续性。
- 验证方式:在四个音视频理解基准(WorldSense、DailyOmni、OmniVideoBench、Video-MME)和两种规模的Qwen2.5-Omni模型(7B和3B)上,在多个压缩比例下进行了测试。
- 结果:仅保留45%的token时几乎没有精度损失;在仅保留25%的更激进压缩下,7B模型的平均准确率相比使用全部token仅下降0.35分,而对比方法OmniZip下降了1.55分。同时最高可实现3.53倍的预填充(prefill,即处理输入阶段)加速,GPU显存占用减少超过15%。
- 机制分析:实验显示压缩会增强不同时间窗口和不同模态之间的注意力交互;当一种模态错误地引导另一种模态时,这种被增强的交互会被引向与答案无关的次要线索,而让每种模态独立压缩时,这种交互则会自然指向真正与问题相关的线索。


研究结果
- 在仅保留25%token的激进压缩下,7B模型的平均准确率相比使用全部token仅下降0.35分,而对比方法OmniZip下降1.55分、FastV下降0.82分、随机压缩下降1.57分。
- 在保留45%token的设置下,7B和3B模型相比使用全部token的准确率反而略有提升(分别+0.30和+0.03)或基本持平。
- 在7B模型上保留25%token时,预填充时间从6299毫秒降至1784毫秒,加速3.53倍;GPU峰值显存从28.31G降至24.00G,降幅超过15%。
- 分别对视频和音频的压缩比例独立扫描的实验(图4)显示,OmniScope相比其他对比方法的准确率下降曲线最为平缓。
- 若将基于查询的独立打分改为两种模态统一均匀压缩,平均准确率下降1.65分;若让一种模态引导另一种模态,则下降约1.0分,验证了独立压缩策略的有效性。


可应用场景
- 用于提升需要同时分析音频和视频的实时服务(如视频通话、视频流分析)的处理速度和显存效率
- 在不重新训练的前提下,降低现有全模态模型在长视频问答、内容审核、视频字幕生成等任务中的推理成本
- 为在资源受限(边缘)设备上运行音视频模型提供压缩设计思路参考


局限与待验证事项
- 实验仅在Qwen2.5-Omni系列模型(7B、3B)和四个特定基准上进行,尚未验证在其他全模态模型架构上的表现。
- 测试结果基于将视频输入限制在128帧的条件下,对更长视频或其他数据条件下的表现尚未单独验证。
- 视频侧的重要性打分需要额外运行一个外部CLIP模型,会带来固定的额外开销,在只需生成简短答案的任务中这部分开销的占比会相对更明显。
- 需要训练的对比方法OmniSIFT由于投稿时代码未公开,未能进行直接对比。
- 作者指出,模型内部基于音频的打分方式尚不足以直接套用到视频侧,因此视频侧仍需依赖外部CLIP模型。


为什么重要
视频通话、视频检索、内容审核等需要同时理解声音和画面的实时服务,常受限于需处理的token数量过多带来的速度和显存问题,而OmniScope提供了一个无需额外训练就能缓解这一问题的实用设计思路。由于该方法不依赖特定模型架构的微调,也为将类似思路迁移到其他全模态模型提供了参考。
本文术语
- 全模态大语言模型(OmniLLM) · 能够同时处理视频、音频和文本的AI模型
- token压缩 · 减少模型需要处理的信息片段(token)数量,从而节省速度和显存的技术
- 查询(query) · 用户提出的问题,本文中被用作判断压缩时该保留什么的共同基准
- 锚点-增量压缩(AD-STC) · 一种视频压缩方式,部分帧保留整体场景信息(锚点),其余帧只保留发生变化的部分(增量)
- 预填充(prefill) · 模型在生成回答之前,一次性处理全部输入内容的阶段
无法转载的图表
- Figure 6
- Figure 7
- Figure 8
- Figure 9
论文原文摘要(英文)
Existing token compression methods for omnimodal large language models typically rely on one modality to determine what to retain in the other. We show that this assumption often breaks down: for the same query, audio and video relevance often peaks at different moments. This cross-modal salience mismatch makes unidirectional guidance prone to discarding answer-critical cues under aggressive compression. We propose OmniScope, a training-free token compression framework that uses the query as a s
在 arXiv 阅读最新论文
- SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?让AI编程助手去修复真实科学软件,连最强的那个也有一半以上任务没做对
- FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving把稀疏注意力从论文原型变成能真正上线服务的加速方案
- PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents让客服AI坐席不只是拦住一个危险动作,而是把整个流程走对
- EXIMO: VLM Guided Exploration of VLA Policies不用人工遥控演示,让会说话的AI来教机械臂做新家务
- EnvHarness: Awakening Static Worlds for Agent Learning不重新搭建训练环境,而是给现有环境套一层可插拔组件,针对每个智能体的具体弱点重新塑形
- Bounded Sovereignty and the Control Tax: Pricing AI Oversight When the Deployer Does Not Own the Model租用AI而非拥有AI的机构,安全监管能力只剩一半
- Beyond Imitation: Filtering On-Policy Distillation by Reasoning ProgressAI模仿老师模型学习时,会误伤本来推理正确的步骤,新方法专门过滤掉这种误伤
- PersonalBench: Measuring the Authorship Gap in LLM Personalization让AI模仿某人的文风,结果发现它始终摆脱不了自己的腔调
METAL MEDIA 最新报道
图片来源: Jinsen Su et al., arXiv:2607.23193, arxiv-nonexclusive