这项由北京大学深圳研究生院、鹏城实验室联合中山大学开展的研究,于2026年8月1日以预印本形式发布,论文编号为arXiv:2608.00574,有兴趣深入探究的读者可通过此编号查阅完整原文。
现代AI系统的背后,有一套极为精妙的"专家分工"机制在运转。这套机制叫做"专家混合模型"(Mixture of Experts,简称MoE)。在深入了解这项研究之前,不妨先借助一个贯穿全文的核心比喻来理解整件事:把一个AI语言模型想象成一家大型快餐厅,后厨里有若干个专门的厨师窗口(即"专家"),每一道点单(即每一段输入的文字或图片信息)都会被一个调度员(即"路由器")分配给其中的几位厨师处理。这家餐厅同时接待文字类顾客(发来纯文字订单)和图片类顾客(发来附有照片的订单),而照片的大小和数量时刻在变化。
整个研究的核心问题就在于:当照片顾客突然变多,或者每张照片忽然变得特别大时,调度员还能把工作均匀地分配给每一位厨师吗?答案令研究团队感到忧虑:现有的调度策略在这种情况下会严重失灵。
一、厨师们累得要死,调度员却说"一切正常"
在AI模型的实际运行中,"专家"就是负责处理信息的独立计算单元,每个单元都有自己的处理能力上限。如果某几个专家被迫承接了远超其他同行的工作量,整个系统就会被拖慢——正如快餐厅里某一个窗口永远在排长龙,而旁边的窗口却闲得发呆,整家店的出餐速度就被那个最忙的窗口所限制。
当前业界普遍使用的调度优化方案叫做"标准辅助损失"(Standard Auxiliary Loss,研究者简称为Std-Aux),它的工作原理就像一个统计员,把所有进店顾客的订单混在一起算一个总体均匀度分数,然后督促调度员尽量让每个厨师窗口的工作量趋于平均。
问题在于,这个统计员只看总体混合数据,完全不分图片顾客和文字顾客。文字顾客的订单可能让某些厨师过载,图片顾客的订单可能让另一批厨师过载,而这两种过载恰好方向相反,加在一起看起来是均衡的——但实际上每一类顾客的体验都很糟糕。更糟糕的是,一旦图片顾客的比例发生变化(比如突然涌入一大批发高清照片的顾客),这种"表面均衡"就会立刻崩塌。
研究团队在实验中用一款叫做Split-Qwen3VL-4B的视觉语言模型验证了这一点。当图片分辨率从低调到高时,用Std-Aux训练出来的同一个调度员,其负载不均匀程度会剧烈变化,最高和最低相差超过五倍。换句话说,在某个分辨率下运转良好的调度策略,换一种图片分辨率就会变得一团糟。
二、为什么调度员会被"迷惑"?一个关于反向误差抵消的数学故事
研究团队接下来做了一件事:把图片顾客和文字顾客的工作分配情况分开来看。结果令人大跌眼镜——Std-Aux训练出的调度员,图片顾客的订单总是倾向于被分配给某几个特定厨师,文字顾客的订单则倾向于被分配给另外几个特定厨师,而这两种偏向恰好方向相反。
用数字来描述这个发现:在Split-Qwen3VL-4B模型中,图片负载和文字负载的Pearson相关系数(衡量两者方向一致程度的指标)高达-0.949,而且两者之间的平均差异(L1条件差距G1)达到了0.798。这意味着图片顾客和文字顾客的工作分配几乎完全相反,但因为两者相加后看起来均衡,统计员给了调度员一个"合格"的分数。研究团队把这种现象称为"模态互补负载"。
这里有一个精妙的数学推导。假设在某个特定的图片比例a?下,混合后的工作分配是均衡的,那么一旦图片比例变成a,偏离均衡的程度就完全由(a - a?)乘以"图片负载与文字负载的差值向量"所决定。图片负载和文字负载之间的差距越大,只要图片比例稍微偏离那个"甜蜜点"a?,失衡程度就会急剧恶化。反过来,如果能让图片负载和文字负载各自都趋于均衡,两者的差距就小,整个系统就能在大范围的图片比例变化下保持稳定。
从数学上看,负载曲线是一条抛物线,开口大小(曲率κ)由图片负载和文字负载在每一层网络中的差值向量的平方之和决定。这就是为什么降低两种模态之间的差距,能够从根本上解决"比例变化导致失衡"的问题。
三、调度员的"视角盲区":为什么图片和文字天生就不一样?
研究团队还做了一番侦探式的现场勘查,深入观察了AI模型内部的"信息地形图"——即路由器(调度员)在接收到每个信息块时所看到的数字空间。
他们发现了两条清晰的地理边界。第一条是"模态边界":图片类信息和文字类信息在数字空间中占据截然不同的区域,就像餐厅里中式料理顾客和西式料理顾客各自聚集在不同的区域,调度员一眼就能认出谁是谁。在研究测试的两款原生大型语言模型(Qwen3-VL-MoE-30B和Qwen3.5-MoE-35B)中,分别有52%和61%的专家厨师窗口对某一类顾客有明显偏好,其接待量超过另一类顾客两倍以上。
第二条是"图片边界":同一张图片被切割成若干图像块(tiles)后送入模型,这些来自同一张图片的信息块在数字空间中紧紧簇拥在一起,形成一个紧密的小团体——就像同一家公司的员工在员工餐厅里总是凑在一起吃饭。而来自不同图片的信息块之间则保持着一定的距离,尽管这个距离比来自同一张图片的信息块之间的差异要大,但比文字顾客之间的差异要小。文字样本之间的跨样本差异大约是图片样本间差异的两倍。
这两条边界共同揭示了一个重要的设计思路:应该把图片类和文字类的负载分开来优化,并且对于图片类信息,应该以每张完整图片为单位来评估调度均匀程度,而不是以每一个图像块为单位。
四、ReBA登场:在内部放宽约束,在边界强化均衡
正是基于以上发现,研究团队提出了他们的解决方案,命名为ReBA(Relax Within, Balance Across),中文意思是"内部放宽,边界均衡"。这个名字精准地概括了方案的核心哲学:在每一类顾客内部,允许不同个体有各自的偏好;但在图片顾客和文字顾客这两大类别之间,必须各自独立地实现均衡。
ReBA的第一个设计选择是把图片负载和文字负载的优化目标彻底分开。Std-Aux只有一个混合的优化目标,而ReBA有两个独立的目标:图片端的工作分配必须均衡,文字端的工作分配也必须均衡,二者缺一不可。由于两个目标都是非负数,它们不可能相互抵消——就算图片端的偏差很大,也无法靠文字端的反向偏差来掩盖。从数学上可以严格证明:在理想对齐条件下,ReBA的唯一最优解就是图片负载均衡且文字负载也均衡。
ReBA的第二个设计选择是以每张完整图片为一个路由实例。具体做法是:把同一张图片的所有图像块的路由分布取平均,得到这张图片的"集体偏好画像",然后把所有图片的画像等权重平均后,再计算均衡程度。等权重的意思是:不管这张图片被切成多少块,它在优化目标中占的权重都是一样的——一张1000块的超高清图片和一张10块的小图片的权重相同。文字方面则仍然保持把所有文字token打包在一起作为一个整体来评估。
这个设计的好处显而易见:高分辨率图片会被切成大量图像块,如果按token数量计算权重,高清图片的权重就会远大于普通图片,导致优化器"过度在乎"高清图片的感受,形成新的失衡。等权重方案则保证了不同图片的优化权重公平,同时保留了不同图片使用不同专家的自由度。
用餐厅的比喻来说:ReBA就像新来了一位更聪明的调度主管,他宣布:"今后,所有图片顾客的窗口分配必须自己均衡,所有文字顾客的窗口分配也必须自己均衡,两者不能互相掩护。而且,每桌顾客(即每张图片)无论人数多少,在考核调度均匀性时都算作同等分量的一桌。"
从实现角度看,ReBA几乎不需要任何额外的计算开销。它不添加新的路由器,也不增加任何新的专家参数,仅仅改变了统计路由分布时的分组方式。每一层的额外计算量只有O(|M|N),其中|M|是图片数量,N是专家数量,这相比专家FFN本身的计算量微乎其微。
五、实验室里的验证:四个模型,七项任务,一份令人信服的成绩单
研究团队把ReBA放到了四款不同的"分割型"视觉语言模型上进行测试。这四款模型分别是从Qwen3-VL-4B-Instruct、Qwen2.5-VL-3B、Qwen2-VL-7B和InternVL3-8B改造而来的稀疏专家版本。改造方式叫做"FFN分割":把原本密集的前馈神经网络层的参数按神经元分组,拆分成若干个独立的专家,原始参数总量保持不变,只新增一个小型路由矩阵。每个模型在Cambrian-737K数据集上训练一轮,唯一的变量就是所用的负载均衡损失函数。
在七项视觉语言理解基准任务上(包括POPE视觉幻觉测试、HallusionBench、MME、MMBench、MMStar、SEEDBench和ScienceQA),ReBA在每一项任务、每一款模型上都实现了更低的负载不均匀度(用变异系数CV衡量),同时平均任务准确率与Std-Aux相当。
以主要测试模型Split-Qwen3VL-4B为例,在所有七项任务上,ReBA的平均层CV从Std-Aux的0.43大幅降至0.16,降幅超过六成。而准确率方面,ReBA的平均分为66.1%,Std-Aux为65.8%,两者差异极小。另外三款模型也呈现类似的模式:负载均匀性显著改善,准确率保持可比水平(四款模型的平均准确率差异分别为+0.3、+0.2、-0.2和+0.6个百分点)。
更值得关注的是条件负载改善情况。在ReBA训练后,图片负载和文字负载之间的Pearson相关系数从-0.949降至-0.166,L1条件差距从0.798降至0.137。这说明ReBA有效消除了模态互补负载现象,负载的降低不是靠新的图文抵消,而是真正地让两种模态各自均衡了。
在抗扰动测试中,研究团队对Split-Qwen3VL-4B进行了五种不同分辨率的物理运行测试(像素预算从200,704到1,605,632),ReBA在其中四个分辨率下的表现优于Std-Aux,在最高分辨率下,聚合RMS-CV从Std-Aux的0.351降至ReBA的0.115。对InternVL分割模型进行1至12块tiles的测试时,ReBA在每个tiles数量下都低于Std-Aux,在3到12块时最为突出。
六、把每张图片当成一个整体有没有必要?消融实验给出答案
研究团队还精心设计了一系列消融实验,逐一检验ReBA设计中每个选择的必要性。他们测试了五种中间方案,通过比较可以理清每个设计决策的贡献。
Coupled-ImgInst方案把每张图片的图像块取平均,但仍然用一个混合的图文损失函数,结果图片负载的CV从0.447降至0.170,但文字负载的CV却从0.445飙升至0.640。整体CV看起来只有0.097,是因为图文依然在互相抵消。这证明了仅仅以图片为单位还不够,图文必须分开优化。
Coupled-SymInst方案尝试把文字也按行(每条query)分组,但仍使用混合损失,结果整体CV反而升到0.348,比Std-Aux还差。这说明在混合损失框架下,强行给文字分组反而会破坏原有的平衡。
Decoupled-Matched方案使用分离的图文损失,但用了与Coupled-ImgInst内部两个二次项等权重匹配的系数,整体CV降至0.154,比Std-Aux的0.273好,但比完整ReBA的0.077差。这证明了系数选择(使用实际观测到的图文token比例作为权重)比匹配系数方案更优。
ReBA-TextInst方案在完整ReBA基础上,把文字也按每条query分组,整体CV为0.098,略高于完整ReBA的0.077。这说明文字部分保持整体池化是更好的选择,因为文字样本之间本身就有较大的跨样本差异,不需要刻意分组。
七、对计算效率意味着什么?一个理想化的速度代理
在AI推理系统中,"专家并行"是一种常见的加速策略:把不同的专家分配到不同的计算设备上,所有设备同时工作。但这种策略有一个致命弱点:每一层的处理时间取决于工作量最多的那个专家——就像流水线上速度最慢的那个工序决定了整条流水线的产能。
研究团队设计了一个理想化的"专家计算代理指标":把每一层中工作量最多的专家所处理的token数量加总,作为衡量瓶颈工作量的指标。然后把Std-Aux的总量除以ReBA的总量,得到理想加速比Sideal。
结果显示,在中等到高分辨率的图片设置下(401,408像素及以上),ReBA相比Std-Aux的理想加速比达到1.23至1.25倍,也就是说在这个理想化代理下,系统处理瓶颈工作量约可降低20%以上。在最低分辨率设置下,因为Std-Aux本身已接近其最佳工作点,ReBA几乎没有额外收益,理想加速比接近1。InternVL的各tiles数量设置下,理想加速比均在1.046至1.074之间,全部大于1。
研究团队特别强调,这只是理想化代理指标,不是实际测量的延迟或吞吐量。真实的推理速度还受到设备间通信、内存带宽、核函数实现细节等诸多因素影响。但这个代理指标至少表明,更均衡的负载分配在系统层面有潜在的效率收益。
八、原生稀疏大模型里也有同样的问题吗?
除了在分割型模型上训练和验证ReBA之外,研究团队还对两款原生稀疏大模型——Qwen3-VL-MoE-30B和Qwen3.5-MoE-35B——进行了诊断性测试(注意:这部分不训练ReBA,只是观察问题是否存在)。
两款模型在图片类和文字类输入上都存在明显的条件负载差距。以Qwen3-VL-MoE-30B为例,图片端的RMS-CV为0.822,文字端的RMS-CV为1.051,而混合后的RMS-CV仅为0.632——混合后的值比任何一种单独模态都要小,这正是模态互补负载的典型特征。固定条件负载轮廓后计算得到的曲率κ分别为1.865和2.246,表明这两款原生模型在图文token比例发生变化时同样会经历可观的负载波动。
在物理分辨率扫描测试中,研究团队还发现了另一个重要现象:随着分辨率的升高,不仅图文比例发生了变化,图片端的条件负载轮廓本身也发生了改变。对于30B模型,条件轮廓变化使得物理运行的负载曲线比固定轮廓预测的更为平坦;对于35B模型,条件轮廓变化甚至完全逆转了预测的增长趋势,实际物理负载在高分辨率下反而有所下降。这说明,物理分辨率变化对负载的影响可以分为两部分:一部分是纯粹由图文比例变化引起的(固定轮廓定律所捕捉的),另一部分是由条件轮廓本身变化引起的。在某些情况下,后一部分的影响比前一部分更大。
原生模型的诊断结果表明,ReBA所针对的问题不只是分割型模型的专属问题,在主流发布的原生稀疏视觉语言大模型中同样普遍存在。研究团队因此认为,ReBA的思路有望推广到对原生MoE模型的训练优化中。
说到底,这项研究干了一件看似简单、实则颇具洞察力的事:它发现现有的AI调度策略存在一个系统性盲区——只看"合并后的平均分",却忽视了"图片和文字各自的偏科程度";只保证在某一个特定图文比例下均衡,却没有考虑到实际部署中图文比例时刻在变化。
ReBA给出的解法直接对症下药:把图片任务和文字任务分开考核,并且以每张图片为单位进行评估,这两个改动加在一起,使得负载不均匀程度大幅下降,而模型的任务准确率几乎不受影响。对于普通用户而言,这意味着使用视觉语言AI处理不同分辨率图片时,响应速度可能更加稳定;对于AI系统的部署者而言,这意味着在多卡并行推理时,资源浪费在等待最忙的专家上的时间有望减少。
当然,研究本身也有明确的局限性:所有训练验证都在分割型模型上进行,原生MoE模型上应用ReBA的效果尚未经过训练实验验证;理想加速比代理指标与真实推理速度之间仍有差距;论文中也坦诚地指出,物理预处理对条件负载轮廓的改变有时比图文比例的变化更大,固定轮廓定律无法捕捉这一变化。这些都是值得后续研究继续探索的方向。对这些细节感兴趣的读者,可以通过arXiv论文编号2608.00574查阅完整原文和详尽的数学推导。
Q&A
Q1:ReBA和传统标准辅助损失Std-Aux相比,最核心的区别是什么?
A:Std-Aux把图片token和文字token混在一起统一评估负载均衡,这样两种模态的偏差可以互相抵消,导致表面均衡而实际偏斜。ReBA则把图片和文字的负载优化目标彻底分开,要求各自独立均衡,并且对图片以每张完整图片为单位(而非每个图像块)进行等权重评估,从根本上消除了模态之间的互相掩盖效应。
Q2:视觉语言MoE模型的专家负载不均衡会带来什么实际影响?
A:在多设备并行推理时,每一层的处理速度取决于工作量最大的那个专家,其他专家必须等待它完成。负载越不均衡,等待浪费的时间越多。研究发现在中等到高分辨率图片的设置下,使用ReBA相比Std-Aux可将理想化的瓶颈计算量降低约20%,同时任务准确率几乎不受影响。
Q3:ReBA方法的固定轮廓定律有什么局限性?
A:固定轮廓定律只分析图文token比例变化对负载的影响,假设图片和文字各自的条件负载轮廓保持固定。但在实际推理中,改变图片分辨率或使用不同的分块策略时,条件轮廓本身也会发生变化,这种轮廓变化有时比比例变化对负载的影响更大,甚至会逆转定律的预测方向,InternVL多tiles测试中就出现了这种情况。