Skip to content

v24.0 — SM103 MXFP8 forward and complete backward baselines

Choose a tag to compare

@github-actions github-actions released this 14 Sep 01:50
· 10 commits to main since this release

典型泛化场景几何平均PFLOPS/卡:OProj前向2.249637、完整反向2.122491(各36点);QKVProj前向2.200574、完整反向2.081297(各27点)。QwenDense作为补充场景保留全部逐点数据,不计入主汇总;包含它的原QKV全量均值为2.047223/1.870026(各33点)。这是统计分组调整,不是性能提升或普遍泛化证明。预取原全量同配置回归仍为O反向+1.44%、Q反向+1.82%,69/69观测点提升;典型场景Q反向预取收益+1.17%。

QKVProj / OProj MXFP8 双融合前向与完整 B+dW 反向。CP4/8×128K/256K/512K,合法几何分别固定33/36物理点;两份非零Philox分别Graph10+50及独立完整前后数值/路由校验。最终吞吐、配置与证据见 results/sm103/v24.0。

有效优化:寄存器内K32量化、合并FP8/scale写回、量化期间下一组输入cp.async预取;QKV反向完整head并行acquire、异步payload搬运、scale提前读取;独立dW GEMM布局与beta=0源无关epilogue。不削弱ready/fence或精度合同。

按用户接受的当前结果发布;典型场景汇总达到目标,不宣称原全量目标均达成或新增Auto。前向含动态BF16权重量化/GEMM/A2A;反向含必要转置量化、两次GEMM和路由。上游激活/梯度量化与跨CP dW归约为明确外部边界。

收拢SM103模块文档和优化总结,删除过时逐轮流水账;未引入额外核心公共文件。norm/RoPE默认关闭且仍实验性,不宣称特殊KDA/MLA/KV复制路由或完整模型训练验收。不附调参过程、profile、原始大日志或依赖。

统计说明更新于发布后,原 v24.0 tag 和算子代码保持不变。修订后的完整表格与统计口径。