Cursor 称以“warp decode”重构 MoE 解码后,Blackwell GPU 小批量推理吞吐提升 1.84 倍 Cursor 公布一项名为“warp decode”的 MoE 推理方案,称其在 Blackwell GPU 的小批量自回归解码场景中,将计算组织方式从“围绕专家”改为“围绕输出”,把传统路径中 8 个阶段里的 5 个数据整理环节去掉,并将整个 MoE 计算层压缩为两个 kernel。按文中说法,这一做法适用于小批量 decode,不是对专家中心执行方式的通用替代;在 prefill 和大批量推理中,后者仍然更有优势。 Cursor 称,该方案在其内部推理系统、基于…