[CVPR 2025/Archived] Quant Experts: 突破多模态大模型量化瓶颈,Token 感知的自适应专家补偿
Quant Experts: Token-aware Adaptive Error Reconstruction with Mixture of Experts for Large Vision-Language Models Quantization
本文提出了 Quant Experts (QE),一种针对多模态大模型 (VLMs) 的后训练量化 (PTQ) 框架。该方法通过 Mixture of Experts (MoE) 架构实现 Token 级的自适应误差补偿,在 Qwen2VL-72B 模型上,即使在极具挑战性的 W4A6 量化设置下,精度仍能提升 5.09%,几乎追平全精度模型。
TL;DR
传统的后训练量化 (PTQ) 在面对多模态大模型 (VLMs) 时常显得“力不从心”。本文提出的 Quant Experts (QE) 首次揭示了 VLM 中重要通道分布的动态性:不仅跨模态不同,甚至在相同模态的不同 Token 之间也存在显著偏移。通过引入 Mixture of Experts (MoE) 架构来处理量化误差,QE 在 W4A6 等极低比特设置下,依然能让 72B 规模的模型表现出近乎无损的性能。
痛点深挖:消失的“通用”离群点
在 LLM 量化研究中,人们习惯于认为某些通道(Outlier Channels)是恒定敏感的,只要对其进行平滑(Smoothing)或高精度保留即可。
然而,作者通过深入观察(Observation)发现:
- 位置偏移:重要通道的位置在不同 Token 之间不断跳变,不仅图像 Token 和文本 Token 不同,语义差异大的 Token 也会引起通道敏感性的迁移。
- 频率分布不均:只有极少数通道是“全局常驻”的(Token-independent),大多数重要通道仅在特定输入下才会被激活(Token-dependent)。
这意味着,传统的 静态全局补偿策略(如静态的低阶重建)在面对 VLMs 时,就像是用一把固定的尺子去量一段不断波动的曲线,必然存在巨大的残差。
核心方案:Quant Experts (QE) 架构
为了解决这一问题,QE 将误差补偿任务解耦为 全局稳定分量 和 局部动态分量。
1. 架构解析
QE 引入了一个由 Shared Expert (SE) 和 Routed Experts (REs) 组成的 MoE 框架:
- 共享专家 (SE):使用一个全局的低阶适配器,专门对付那些在所有 Token 中频繁出现的“常驻”离群通道。
- 路由专家 (REs):通过对 Token 特征进行共现分析和谱聚类(Spectral Clustering),预先构建多个针对特定局部特征的子专家。
图 4:QE 框架概览。左侧展示了通道依赖性划分,右侧展示了 SE 与 REs 的协作过程。
2. 动态路由机制 (Inference Process)
在推理阶段,模型通过一个轻量级的路由矩阵(Router),根据当前输入 Token 的特征实时估算不同路由专家的误差期望,并激活最匹配的那一个。这种设计确保了补偿机制能随着 Token 的语义动态“变身”。
图 5:QE 的推理计算流程。注意到路由选择是动态的,适配不同 Token 的局部误差。
实验与结果:全线 SOTA
作者在 Qwen2-VL 和 InternVL2 等主流模型上进行了详尽测试,涵盖了从 2B 到 70B 的不同规模。
- 性能表现:在最严苛的 W4A6 设置下,Qwen2VL-72B 的平均得分从基线方法(MBQ)的约 72% 提升到了 77% 以上,与全精度模型的差距被压缩至极小。
- 泛化能力:不仅在多模态理解任务(如 OCRBench, ScienceQA)上表现优异,在纯语言任务(MMLU)上也展现了极强的稳定性,解决了以往量化方法可能导致的语言能力退化问题。
表 3:Qwen2VL-72B 在不同量化设置下的表现对比。可以看到 QE 在 W4A6 下的巨大优势。
消融分析 (Ablation Study)
实验证明,如果不进行聚类而随机分配路由,或者移除共享专家,模型的精度都会显著下降。这印证了作者关于“全局”与“局部”误差互补的直觉。
深度洞察与总结
QE 的核心价值在于它重新定义了 PTQ 的补偿颗粒度。 以往我们认为量化是一个“静态的权重修复”问题,而 QE 将其转化为一个“动态的特征恢复”问题。
局限性预测: 虽然引入了轻量化设计,但 MoE 架构在推理阶段仍会带来额外的显存占用(专家权重的存储)。尽管文中提到可以通过高效算子(FlightLLM 风格)来加速,但在计算资源极其受限的端侧设备上,如何平衡专家数量与内存开销仍是未来的研究方向。
总结 (Takeaway): 本文通过 Token 级别的 MoE 重建,巧妙地解决了 VLMs 中复杂的分布偏移问题。这不仅为 VLM 的低比特部署铺平了道路,也为未来大规模 Heterogeneous(异构)特征的量化研究提供了新的范式。
