Skip to content

v28.0 — SM103 BF16 Grouped GEMM + Combine

Choose a tag to compare

@github-actions github-actions released this 30 Sep 06:05
· 1 commit to main since this release

BF16 专家 FC2 GEMM→跨 rank scatter 基线收口。支持 native/CUTLASS、单/双 CTA UMMA;通信顺序适配 GEMM 遍历,空闲及完成计算的 CTA 协助路由,保留完整输出分片 ready 与远端完成协议。top-k 加权归并不在算子边界内。

保留 native 尾波任务收拢、通信任务组及向量化 LD/ST push。离线服务驱动的通信预算 Auto 为实验性可选路径,不宣称全量最优或原保留率目标全部达到。

发布表区分已审计的 9 月 28 日 EP4 历史矩阵(232 有效、23 显存跳过)与当前代码 5 个点复测;两份随机输入、Graph10+50、max-rank 计时。EP8 不声称最新全量复测。最终配置、证据与限制:results/sm103/v28.0。

186 项本地测试通过;当前生产/诊断 CUDA 构建及代表点数值校验通过。未采用最后的 fence 候选;详细动态路由 Perfetto 导出仍有限制。按用户验收的当前状态发布,不继续旧优化目标,不附调优流水账、profile 或依赖。