2026-06-30 · 🏗️ 基建← 本期
Beyond Uniform Experts: Cost-Aware Expert Execution for Efficient Multi-Device MoE Inference
多设备部署一个 671B 大模型,真正卡脖子的常常不是最快那张卡能算多快,而是最慢那台设备什么时候把活干完。混合专家模型把这块短板放大了。
先说清结构。所谓混合专家(MoE),是把每一层拆成几十上百个"专家"小网络,每个词经过时由路由临时挑少数几个来算。参数量因此能堆到 6710 亿,实际每步只动用一小部分。代价是这些专家得分散存在不同设备上,一个词到底用哪几个要临场决定,于是推理时不停有权重在设备间来回搬。
直觉上想省钱,把不重要的专家剪掉就行,难点在于 CAEE 点破的两件事其实是耦合的。其一,专家的开销和它的贡献不挂钩——一个几乎不影响输出的专家,占的显存和搬运带宽跟关键专家差不多,等于花大钱养闲人。其二,多设备被最慢的那台统一拖住,你在快设备上省得再多,只要慢设备没松动,端到端一点没变。
CAEE 把这两件事合进一个成本模型:既看专家对当前词的重要性,也看它在具体硬件上的执行与传输开销,联合起来把"贡献低、开销高"的那批专家优先剪掉。这个成本模型是轻量校准的,不用大改推理框架。剪掉后并非一丢了之,而是配一个补偿机制近似还原被剪专家的那部分贡献,关键在于补偿本身不引入新的跨设备搬运,否则省下的又被吐回去。
在 DeepSeek-R1 671B 上,覆盖专家 offload 和纯设备端两类部署,端到端延迟降 8% 到 18%,精度掉幅压在 1% 以内。8% 到 18% 这个区间本身就说明省多少高度依赖部署形态:慢设备越是瓶颈、闲专家越多的场景,收益越靠上限。
MoE 推理提速这些年有几条并行的路:把权重量化到低比特、把冷门专家 offload 到内存或 CPU、优化专家并行的通信。CAEE 走的是更细的一支,不均匀对待所有专家,而是按系统级性价比选择性执行,且专门盯住多机不均衡这个常被单机视角忽略的痛点。它不换硬件、不改精度格式,是纯调度侧的软优化,理论上能和量化叠着用。边界也摆在那:论文对外只给了延迟和精度两个数,成本模型怎么校准、补偿的近似误差在长生成里会不会累积,都没展开,真要上多机生产,省多少还得按自己的设备拓扑量一遍。