论文信息
| 项目 | 内容 |
|---|---|
| 日期 | 2026-09-22 |
| 论文 | VideoMM: Adaptive Macro-Micro Inference for Efficient Video MLLMs |
| 作者 | Haoyu Guo, Yuan Feng, Junlin Lv, Mingjun Xiao, S Kevin Zhou, Xike Xie(中国科学技术大学,MIRACLE Center / Data Darkness Lab) |
| 链接 | https://arxiv.org/abs/2609.16722 |
| 代码 | https://github.com/adfh917k/VideoMM |
一句话总结
VideoMM把长视频MLLM推理从"压缩模型"范式转向"自适应感知粒度"范式:先用低分辨率宏观代理完成token筛选,再通过共识机制判断是否需要放大到高分辨率微观token做细粒度推理,在LongVideoBench上同时拿下6.13倍加速和7.4%的精度提升。
解决什么问题
长视频理解的核心瓶颈是视觉token爆炸:一段10分钟720p、1fps采样的视频,在Qwen3-VL中会产生超过30万个token,直接撑爆上下文窗口,推理成本高到无法接受。
现有token削减方案依赖辅助模型,陷入两难:
- 轻量编码器方案(如VisionZip、VidCom):用ViT注意力/嵌入多样性选token,快但语义感知弱,容易误删关键信息;
- 重量级MLLM方案(如SOTA的FlexSelect):用小MLLM做跨模态注意力筛选,准但辅助模型本身的开销把省下的算力又吃回去了。
核心方法
论文的关键洞察:细粒度视觉细节对"详细理解"必不可少,但对"选择哪些区域相关"这个前置任务基本是冗余的。选择不需要高清,推理才需要。
阶段一:宏观代理上的分组选择
- 空间降采样:把视频空间维度缩小k倍(主实验k=2),token数直接降为1/k²,保留显著特征的全局布局;
- 交错分组:帧按 i mod G 分成G组,每组都是视频的稀疏全局表示,各组独立用MLLM处理;
- 跨模态注意力打分:取中层(语义检索主要发生在中层)文本查询对视觉token的注意力:
$$s_i = \max_{l \in \mathcal{L}{mid}} \max_h \max_q A^{(l,h)}{q,i}$$
帧得分 $s_f = \sum_{i \in f} s_i$,每组保留top-50%帧,再从保留帧中按token预算B/G选出top token。
阶段二:自适应宏观-微观推理
模仿人类"先扫全局、再看细节"的注意力缩放:
- 共识机制:多个宏观组独立投票,答案一致 → 语义充分,直接输出,提前终止;
- 分歧即歧义:宏观组答案分歧时,才把选中的宏观区域映射回高保真微观token,做高分辨率精化推理。
这样重计算只花在真正需要细看的片段上。
实验结果
- 对比全量基线(LongVideoBench,Qwen2.5-VL-7B / GLM-4.1V-9B / Qwen3-VL-8B):平均6.13倍加速 + 7.4%精度提升——压缩后反而更准,因为去掉了无关token的干扰;
- 对比SOTA的FlexSelect:精度相当,推理再快2.73倍;
- 在三个benchmark上一致有效;降采样因子从2加大到3仍能保持精度,说明宏观代理的冗余度很大。
深层洞察
- 范式转移:此前所有工作都在"用什么规模的模型来压缩token"上内卷,这篇指出真正该变的是感知粒度——选择和推理对分辨率的需求天然不同,把它们解耦才是正解;
- 稀疏语义密度假设:长视频token海量但语义稀疏,多数问题宏观视角就够答,微观细节只对少数歧义片段必要。这个假设被共识机制的提前终止率实证支持;
- 级联思想的多模态版:类似speculative decoding的"先便宜后按需升级"逻辑,推广到了视觉token空间。
局限性
- 依赖中间层跨模态注意力做相关性打分,这是启发式的,对注意力分布异常的模型/任务可能失效;
- 提前终止依赖多组答案共识,开放生成类任务(无明确答案对齐)的共识判断不直观;
- 两阶段流水线带来工程复杂度;分组数G、token预算B、降采样因子k等超参需要调优;
- 只在视频理解场景验证,图像高分辨率场景是否受益待考。
工程实践启示
- 做RAG或多模态检索系统时,“粗粒度筛选+按需精读"是普适的降本架构:用低分辨率/低维表示做召回,命中且不确定时才加载全量数据;
- 中间层注意力是定位"模型真正在看什么"的廉价信号,可用于线上token裁剪、缓存预取等场景;
- 降采样2-3倍对"选择"任务几乎无损——做任何前置筛选时,先大胆降质,把算力留给最终推理。