Repository navigation
Releases: CyberSecurityErial/fuse
Release list
v29.0 — BF16 grouped Dispatch transport options
保留 CTASP,Dispatch 支持独立选择 cp.async/TMA 与 staging 行数门槛:0 保持旧策略,32/64/128/256 等正值显式启用;完整 panel ready、同步协议和 GEMM 参数不变。
EP4 全量 255 点,250 有效、5 显存不足。有限候选离线选优后,满148SM强纯GEMM保留率79.01%→80.16%,同轮吞吐几何平均+1.45%;小token81.88%,大token78.62%。有收益用新配置,否则保留旧配置。
两份随机输入、Graph10+50及变长路由正确性验证;优胜配置尚未独立复测,不宣称全局最优或达到原85%目标。Combine生产算法、Projection和SM90未优化。最终表、逐点配置和复现方式:results/sm103/v29.0。按用户验收收口,不附调优流水账或原始profile。
v28.0 — SM103 BF16 Grouped GEMM + Combine
BF16 专家 FC2 GEMM→跨 rank scatter 基线收口。支持 native/CUTLASS、单/双 CTA UMMA;通信顺序适配 GEMM 遍历,空闲及完成计算的 CTA 协助路由,保留完整输出分片 ready 与远端完成协议。top-k 加权归并不在算子边界内。
保留 native 尾波任务收拢、通信任务组及向量化 LD/ST push。离线服务驱动的通信预算 Auto 为实验性可选路径,不宣称全量最优或原保留率目标全部达到。
发布表区分已审计的 9 月 28 日 EP4 历史矩阵(232 有效、23 显存跳过)与当前代码 5 个点复测;两份随机输入、Graph10+50、max-rank 计时。EP8 不声称最新全量复测。最终配置、证据与限制:results/sm103/v28.0。
186 项本地测试通过;当前生产/诊断 CUDA 构建及代表点数值校验通过。未采用最后的 fence 候选;详细动态路由 Perfetto 导出仍有限制。按用户验收的当前状态发布,不继续旧优化目标,不附调优流水账、profile 或依赖。
v27.0 — SM103 BF16 Dispatch + Grouped GEMM
核心优化:精确接入native/CUTLASS、单/双CTA UMMA的GEMM优胜参数;通信按实际GEMM消费遍历适配,保持完整计算cluster与full-K ready协议。小token保留20/32/40通信CTA有限搜索优胜配置。
EP4全255点融合结果有效;相对v26共同249点吞吐几何平均+11.23%(小token+7.24%,大token+15.00%),实际满148SM强GEMM保留率79.71%。EP8未复测,历史结果保留在v26。
附overhead四列诊断:93.54% / 93.17% / 92.91% / 85.16%。overhead为三次profile敏感性估计,不是可保证消除的时间;六个搬运测量缺口保留。Graph10+50双随机输入完整校验,小token搜索优胜尚未独立全量复验,不宣称全局最优或新Auto。
最终表、配置、复现与限制:results/sm103/v27.0。BF16 Dispatch基线到此收口;不附调优流水账、profile或依赖。
v26.0 — SM103 BF16 Grouped Dispatch adaptive transport
核心优化:Grouped Dispatch 支持可选全warp cp.async与TMA;默认M<=128使用cp.async、M>=192使用TMA,显式策略仍可覆盖。负载感知CTASP策略允许空闲计算CTA协助小token搬运,不改变full-K/128-row ready语义。
完整重测510点,504点有效。相对v25.1几何平均:EP4 +4.72%,EP8 +5.11%,合计+4.92%;小token M<=128分别+11.17%/+10.89%。
两份非零随机输入、Graph10+50、max-rank计时及完整数值/路由/tail校验。6个EP4点显存不足;3个有效EP8点缺历史强GEMM分母。结果与逐点配置见results/sm103/v26.0。
v25.1 — SM103 BF16 Dispatch + Grouped GEMM complete bench
补齐BF16 Dispatch→专家FC1完整bench发布表:v25.0漏掉的M<192小token行已从此前external-reference矩阵恢复到results/sm103/v25.1。
完整矩阵覆盖EP4/8、17个物理模型几何和M=1/8/16/32/64/96/128/192/256/384/512/1024/2048/4096/8192,共510行;500行valid,10行insufficient_memory。
强参考仍为满148SM的CUTLASS/DeepGEMM grouped GEMM有效较快者,不含通信;只保留winner/configuration,不宣称穷举全局最优。
M<192行是恢复已有证据,不是最新代码重新复测;EP4 M>=192、EP8 M>=192和小token恢复cohort在README/table/results中明确分开。
本版为benchmark完整性修正,不新增生产CTA/GEMM Auto,不改变Combine/swapAB验收边界,也不修改Projection/SM90算法。
最终表、逐点参数和证据:results/sm103/v25.1。不附调优流水账、profile、大日志或依赖。
v25.0 — SM103 BF16 Dispatch + Grouped GEMM
新增独立的BF16 Dispatch→专家FC1通算融合:动态专家token数、持久化CTASP、FP32累加/BF16输出,支持Graph replay。router/激活/top-k归并不在边界内。
有效优化:8个warp发起者、24KiB完整行bulk搬运槽、按实际工作量分批、协作预取路由地址、尾块负载均衡。默认全量buffer;有限buffer仅用于显存紧张,可能显著降速。保持完整K交付、单ready和原同步协议。
最新代码等价EP4实测128/136点,几何平均0.904028 PFLOPS/卡,满148SM强纯GEMM保留率68.5577%,相对历史融合+38.6095%。两份非零随机输入分别Graph10+50,完整数值/路由校验;不是同轮全量A/B。
EP8保留前一次完整搬运快照134/136点,与最新代码复测明确分开;2个有效点缺参照。强参考只留CUTLASS/DeepGEMM中有效较快者,不含通信,不宣称穷举全局最优。
按用户接受的当前基线发布,原每点15%提升/60%保留率目标未全部达到。没有新增生产CTA/GEMM Auto;Combine/swapAB仍开发路径,不列为v25验收成果。Projection/SM90算法不变。
最终表、逐点参数和证据:results/sm103/v25.0。删除未采用搬运分支;4个融合kernel清理前后SASS指令/编码一致。不附调优流水账、profile、大日志或依赖。
v24.1 — QKV MXFP8 quantization maintenance
QKV前向典型泛化场景27点几何平均2.227942 PFLOPS/卡,比v24.0历史结果+1.24%;包括补充QwenDense的全33点2.077387P(+1.47%)。固定配置、两份实际非零Philox各Graph10+50、完整数值和路由校验。历史对照不是同轮全量A/B,不挑旧新较快值。
保留有效优化:all模式量化后经原grid join一次发布完整panel,消除冗余贡献计数;连续物理chunk寻址。K32数值和消费端ready/异步内存序不变。
all选择处新增并行配置限制说明:独立量化可选择自己的执行资源,实测中更有利;显式separate对照在同一个Graph内计时量化及GEMM+A2A,不是缓存权重的纯GEMM。默认选择不改,发布33点仍是all。
OProj与两个反向沿用v24.0,不保留无整体收益的试验。新版all详细量化发布Perfetto尚未适配,显式返回不支持;不伪造旧发布协议trace。
最终表、逐点参数和证据:results/sm103/v24.1;不附调优流水账、profile、大日志或依赖。
v24.0 — SM103 MXFP8 forward and complete backward baselines
典型泛化场景几何平均PFLOPS/卡:OProj前向2.249637、完整反向2.122491(各36点);QKVProj前向2.200574、完整反向2.081297(各27点)。QwenDense作为补充场景保留全部逐点数据,不计入主汇总;包含它的原QKV全量均值为2.047223/1.870026(各33点)。这是统计分组调整,不是性能提升或普遍泛化证明。预取原全量同配置回归仍为O反向+1.44%、Q反向+1.82%,69/69观测点提升;典型场景Q反向预取收益+1.17%。
QKVProj / OProj MXFP8 双融合前向与完整 B+dW 反向。CP4/8×128K/256K/512K,合法几何分别固定33/36物理点;两份非零Philox分别Graph10+50及独立完整前后数值/路由校验。最终吞吐、配置与证据见 results/sm103/v24.0。
有效优化:寄存器内K32量化、合并FP8/scale写回、量化期间下一组输入cp.async预取;QKV反向完整head并行acquire、异步payload搬运、scale提前读取;独立dW GEMM布局与beta=0源无关epilogue。不削弱ready/fence或精度合同。
按用户接受的当前结果发布;典型场景汇总达到目标,不宣称原全量目标均达成或新增Auto。前向含动态BF16权重量化/GEMM/A2A;反向含必要转置量化、两次GEMM和路由。上游激活/梯度量化与跨CP dW归约为明确外部边界。
收拢SM103模块文档和优化总结,删除过时逐轮流水账;未引入额外核心公共文件。norm/RoPE默认关闭且仍实验性,不宣称特殊KDA/MLA/KV复制路由或完整模型训练验收。不附调参过程、profile、原始大日志或依赖。
统计说明更新于发布后,原 v24.0 tag 和算子代码保持不变。修订后的完整表格与统计口径。
v23.0 — SM103 MXFP8 OProj forward 2.2P milestone
OProj A2A→GEMM 纯双融合:36/36 大尺寸长序列物理点,CP4/8×128K/256K/512K,固定配置 Graph10+50、双非零 Philox、完整数值/路由及测后校验通过。几何平均2.256462 PFLOPS/卡,达到2.2P平均目标;7个单点仍低于2.2P。
相对v21历史发布吞吐+17.85%,为历史满设备纯cuBLASLt的83.1%;是历史对照,不是同场配对A/B。完整边界含BF16权重量化、A/SFA通信、GEMM及同步;上游激活量化不包含。
核心优化:计算CTA在启动阶段协助权重量化,通信立即搬运激活;均衡scale交货;容量适配搬运槽;离线选择与GEMM消费顺序匹配的通信窗口和CTA预算。不放宽ready/fence协议,不宣称新Auto。
保存当前开发进展:OProj MXFP8 B+dW已有6个CP8/128K物理点初始基线,GM1.355P,尚未达到2P;QKV前向和两个反向目标仍继续开发,QKV MXFP8反向尚未实现。norm/RoPE仍默认关闭、实验性且不计入主表;不宣称完整模型训练验证。
最终表、逐点配置、复现和证据:results/sm103/v23.0。不打包调参过程、profile、原始大日志或依赖。
v22.0 — Experimental SM103 MXFP8 norm/RoPE forward fusion
新增默认关闭的实验功能:Qwen3 QKV→Q/K head RMSNorm→RoPE→A2A;Llama QKV→RoPE→A2A;A2A→OProj→残差相加→完整 hidden RMSNorm。保留独立残差和供后续 MLP 使用;没有 OProj RoPE。原纯 GEMM+通信及 v20/v21 表独立保留。
优化:QKV 在现有通信 SMEM 槽完成双 lane/head、BF16 成对 norm/RoPE;OProj 复用已完成原工作的 CTA,完整行 ready 后异步暂存输入、容量适配2/4行归约。完整 TMA drain/ready 数值与同步合同不放宽。
Graph10+50,双非零 payload:QKV15/15合计1.918 PFLOPS/卡,其中 Qwen3三点1.785P、Llama十二点1.953P;OProj16/18已通过点1.743P,两 Llama405B CP4/256K、512K数值失败明确留空。不是所有类别均达到1.9P,也不是全量正确性通过。
独立同配置融合/分离对照:QKV几何平均1.0901x,OProj1.0308x;部分最终配置不同,不能用主表除以旧分离时间冒充配对收益。完整新边界含动态W量化/A2A/新增操作;上游激活量化和位置表生成不包含。
显式通信预算;没有新增 Auto、MXFP8/norm/RoPE反向或整模型训练验收声明。最终表、配置、样本与证据:results/sm103/v22.0;不附调参过程、profile或依赖。