孤本网
/ 0 阅读
0

OMP-MoE提出免训练专家剪枝框架,在Qwen3-30B上50%压缩保留93.3%性能

一句话结论

OMP-MoE以线性复杂度实现MoE专家剪枝,在50%压缩率下将Qwen3-30B推理加速1.55倍且保留93.3%原始性能。

关键要点

  • OMP-MoE是免训练框架,将专家剪枝重构为稀疏信号重建问题,通过正交匹配追踪(Orthogonal Matching Pursuit)贪心选择专家,单次计算复杂度为线性。
  • 跨层专家分配采用注水(water-filling)策略,同时考虑重建质量与路由稳定性两个约束。
  • 增强版OMP-MoE†引入自适应推理机制,基于能量预测动态调整专家激活数量。
  • 在Qwen、DeepSeek-V2、GPT-OSS和Mixtral四个MoE模型族上,25%至50%剪枝比例区间内,各项指标均优于现有方法。
  • Qwen3-30B-A3B在50%压缩下保留93.3%原始性能,搜索速度提升33倍,推理速度提升1.55倍。

背景与事实

专家混合(Mixture-of-Experts,MoE)架构通过将模型容量分布于多个专家网络并在推理时仅激活部分专家,实现了大语言模型的高效扩展,但部署时仍需加载全部专家权重,显存占用成为主要瓶颈。现有剪枝方法存在两类局限:一类需要高昂的搜索成本,另一类忽略了专家之间的动态相互依赖关系。该论文于2026年9月9日提交至arXiv,类别为计算机科学-机器学习,提出OMP-MoE作为免训练压缩框架来降低MoE大语言模型中的专家冗余。

方法分三步执行。第一步,将单个专家的贡献视为字典原子,通过正交匹配追踪贪心选择能使重建误差最小的专家,整个过程保持线性计算复杂度,避免传统方法中昂贵的组合搜索。第二步,引入注水策略优化跨层专家分配,该策略在优化目标中同时纳入重建质量与路由稳定性,防止局部最优导致下游层性能塌缩。第三步,OMP-MoE†在此基础上增加自适应推理层,根据输入信号的预测能量动态决定激活专家数量,从而在保持精度的同时进一步降低计算开销。

实验覆盖四个主流MoE模型族:Qwen、DeepSeek-V2、GPT-OSS和Mixtral。在25%至50%的剪枝比例范围内,OMP-MoE在各基准任务上均取得一致改进。以Qwen3-30B-A3B为例,50%压缩率下保留93.3%的原始性能,搜索阶段耗时缩短至原方法的约1/33,推理吞吐量提升1.55倍。作者声明代码将在论文被接收后开源。

影响分析

对于中文开发者而言,OMP-MoE提供的免训练路径降低了MoE模型落地的工程门槛。过去企业若希望将百亿参数级MoE模型部署到有限显存环境,通常需要经历耗时的微调剪枝流程;OMP-MoE将这一过程简化为一次性线性搜索加跨层分配,使得团队可以在不触碰权重训练的前提下,用数小时甚至更短时间完成压缩部署。需要明确的是,"优于现有方法"这一结论基于论文自述的基准对比,实际效果仍取决于目标任务与下游评测。对于正在评估Qwen或DeepSeek-V2系列MoE版本的工程团队,33倍搜索加速和1.55倍推理加速意味着从模型选型到生产上线的周期可显著压缩。

适用边界

该结论在以下条件下不成立或不适用:首先,OMP-MoE针对的是专家数量的结构性剪枝,不解决单个专家内部的权重压缩或量化问题,若部署瓶颈来自单专家参数规模而非专家总数,需结合其他方法。其次,93.3%性能保留率对应的是Qwen3-30B-A3B在50%压缩这一特定配置,其他模型或更激进的剪枝比例下保留率可能明显下降。最后,OMP-MoE†的自适应机制依赖能量预测模块,若输入分布发生剧烈漂移,动态激活决策可能偏离最优。

孤本观察

该工作将信号处理领域的正交匹配追踪直接迁移到MoE专家选择问题,这一跨领域映射本身即构成可复用方法论;编辑判断认为,若后续版本能公开与主流基线的逐任务对比表格,对中文社区的实际参考价值将进一步提升。

OMP-MoE提出免训练专家剪枝框架,在Qwen3-30B上50%压缩保留93.3%性能

OMP-MoE提出免训练专家剪枝框架,在Qwen3-30B上50%压缩保留93.3%性能

OMP-MoE提出免训练专家剪枝框架,在Qwen3-30B上50%压缩保留93.3%性能

OMP-MoE提出免训练专家剪枝框架,在Qwen3-30B上50%压缩保留93.3%性能

OMP-MoE提出免训练专家剪枝框架,在Qwen3-30B上50%压缩保留93.3%性能

常见问题

Qwen3-30B-A3B在50%压缩率下保留多少原始性能?

保留93.3%原始性能。

OMP-MoE框架对Qwen3-30B-A3B的推理速度提升多少倍?

推理吞吐量提升1.55倍。

OMP-MoE框架需要训练模型权重吗?

不需要,它是免训练框架,通过正交匹配追踪贪心选择专家,避免触碰权重训练。

OMP-MoE能解决单个专家内部的权重压缩问题吗?

不能,它针对专家数量的结构性剪枝,不解决单专家内部权重压缩或量化问题。

OMP-MoE†的自适应推理机制依赖什么模块?

依赖能量预测模块,基于输入信号的预测能量动态决定激活专家数量。

来源:arXiv cs.LG