核心思路:
按照 Token 的输入顺序逐行处理打分矩阵。对于每个 Token,将所有专家按照以下规则排序:
在混合专家大模型中,为了节省算力,并不是所有的神经网络层都会处理所有的Token。
当系统包含E个专家时,对于输入的每一个Token,路由器会给各个专家打分,并只将该Token分配给得分排名前K的专家。同时,为了防止某个专家被分配了过多的Token导致显存溢出,系统为每个专家设置了最大处理容量C。如果某个专家达到了容量上限,后续被路由到该专家的Token将被强制“掩蔽”并丢弃。
给定N个Token对E个专家的原始打分矩阵S(维度N×E),具体流程如下:
Scan the QR code below with WeChat to sign in
First-time scan will create your account automatically
请使用微信扫描下方二维码完成注册