解题思路
核心思路:本题是稀疏 Mixture-of-Experts 上一次带容量约束的两阶段自适应路由。先按当前专家原型做完整软指派,再把每个专家的原型改写成第一阶段实际接收特征的加权平均,这对应 EM / soft k-means 的一次「分配—更新」;然后用新原型从匹配分数开始重新路由。第一阶段结果只用于更新原型,计分只用第二阶段匹配分数,进不了专家的激活走残差分支。
实现方法:
- 每个输入块按绝对值峰值做特征归一化:Ai,k=Xi,k×Q/Mi,全零块置零。除法一律向零取整。
- 匹配分数 Si,j=max(Ai⋅Pj,0)。Ti>0 时先按比例拆 fi,j=Li×Si,j/Ti,余数只补给 Si,j>0 的专家,按分数降序、编号升序各加 1。
- 专家超容量时按 gi,j=fi,j×Cj/Uj 裁剪,再按原份额降序、输入块编号升序回填;之后按输入块编号把剩余激活补进「仍有空位且 Si,j>0」中分数最高的专家,一次送 min(D,E)。