📌 系列导航🔥 日报 · 📚 周报 · 📡 技术雷达 · 📄 论文精读 · 📮 情报站

论文信息

项目内容
日期2026-09-22
论文VideoMM: Adaptive Macro-Micro Inference for Efficient Video MLLMs
作者Haoyu Guo, Yuan Feng, Junlin Lv, Mingjun Xiao, S Kevin Zhou, Xike Xie(中国科学技术大学,MIRACLE Center / Data Darkness Lab)
链接https://arxiv.org/abs/2609.16722
代码https://github.com/adfh917k/VideoMM

一句话总结

VideoMM把长视频MLLM推理从"压缩模型"范式转向"自适应感知粒度"范式:先用低分辨率宏观代理完成token筛选,再通过共识机制判断是否需要放大到高分辨率微观token做细粒度推理,在LongVideoBench上同时拿下6.13倍加速和7.4%的精度提升。

解决什么问题

长视频理解的核心瓶颈是视觉token爆炸:一段10分钟720p、1fps采样的视频,在Qwen3-VL中会产生超过30万个token,直接撑爆上下文窗口,推理成本高到无法接受。

现有token削减方案依赖辅助模型,陷入两难:

  • 轻量编码器方案(如VisionZip、VidCom):用ViT注意力/嵌入多样性选token,快但语义感知弱,容易误删关键信息;
  • 重量级MLLM方案(如SOTA的FlexSelect):用小MLLM做跨模态注意力筛选,准但辅助模型本身的开销把省下的算力又吃回去了。

核心方法

论文的关键洞察:细粒度视觉细节对"详细理解"必不可少,但对"选择哪些区域相关"这个前置任务基本是冗余的。选择不需要高清,推理才需要。

阶段一:宏观代理上的分组选择

  1. 空间降采样:把视频空间维度缩小k倍(主实验k=2),token数直接降为1/k²,保留显著特征的全局布局;
  2. 交错分组:帧按 i mod G 分成G组,每组都是视频的稀疏全局表示,各组独立用MLLM处理;
  3. 跨模态注意力打分:取中层(语义检索主要发生在中层)文本查询对视觉token的注意力:

$$s_i = \max_{l \in \mathcal{L}{mid}} \max_h \max_q A^{(l,h)}{q,i}$$

帧得分 $s_f = \sum_{i \in f} s_i$,每组保留top-50%帧,再从保留帧中按token预算B/G选出top token。

阶段二:自适应宏观-微观推理

模仿人类"先扫全局、再看细节"的注意力缩放:

  • 共识机制:多个宏观组独立投票,答案一致 → 语义充分,直接输出,提前终止;
  • 分歧即歧义:宏观组答案分歧时,才把选中的宏观区域映射回高保真微观token,做高分辨率精化推理。

这样重计算只花在真正需要细看的片段上。

实验结果

  • 对比全量基线(LongVideoBench,Qwen2.5-VL-7B / GLM-4.1V-9B / Qwen3-VL-8B):平均6.13倍加速 + 7.4%精度提升——压缩后反而更准,因为去掉了无关token的干扰;
  • 对比SOTA的FlexSelect:精度相当,推理再快2.73倍
  • 在三个benchmark上一致有效;降采样因子从2加大到3仍能保持精度,说明宏观代理的冗余度很大。

深层洞察

  1. 范式转移:此前所有工作都在"用什么规模的模型来压缩token"上内卷,这篇指出真正该变的是感知粒度——选择和推理对分辨率的需求天然不同,把它们解耦才是正解;
  2. 稀疏语义密度假设:长视频token海量但语义稀疏,多数问题宏观视角就够答,微观细节只对少数歧义片段必要。这个假设被共识机制的提前终止率实证支持;
  3. 级联思想的多模态版:类似speculative decoding的"先便宜后按需升级"逻辑,推广到了视觉token空间。

局限性

  • 依赖中间层跨模态注意力做相关性打分,这是启发式的,对注意力分布异常的模型/任务可能失效;
  • 提前终止依赖多组答案共识,开放生成类任务(无明确答案对齐)的共识判断不直观;
  • 两阶段流水线带来工程复杂度;分组数G、token预算B、降采样因子k等超参需要调优;
  • 只在视频理解场景验证,图像高分辨率场景是否受益待考。

工程实践启示

  • 做RAG或多模态检索系统时,“粗粒度筛选+按需精读"是普适的降本架构:用低分辨率/低维表示做召回,命中且不确定时才加载全量数据;
  • 中间层注意力是定位"模型真正在看什么"的廉价信号,可用于线上token裁剪、缓存预取等场景;
  • 降采样2-3倍对"选择"任务几乎无损——做任何前置筛选时,先大胆降质,把算力留给最终推理。