Skip to content

feat: use backend-native FP8 matmul when supported - #1916

Merged
leejet merged 1 commit into
masterfrom
feat/backend-native-fp8-matmul
Aug 30, 2026
Merged

feat: use backend-native FP8 matmul when supported#1916
leejet merged 1 commit into
masterfrom
feat/backend-native-fp8-matmul

Conversation

@leejet

@leejet leejet commented Aug 27, 2026

Copy link
Copy Markdown
Owner

Summary

  • Detect whether the selected backend supports FP8 mul_mat.
  • Preserve E4M3/E5M2 weights for native FP8 execution on capable backends.
  • Fall back to BF16 weight conversion when native FP8 matmul is unavailable.

Related Issue / Discussion

N/A

Additional Information

.\bin\Release\sd-cli.exe --diffusion-model ..\models\diffusion_models\krea2_turbo_fp8_scaled.safetensors --llm ..\models\text_encoders\Qwen3-VL-4B-Instruct-Q4_K_M.gguf --vae ..\models\vae\wan_2.1_vae.safetensors -p "a lovely cat holding a sign says 'krea2.cpp'" --steps 8 --cfg-scale 1  --diffusion-fa -v --offload-to-cpu

Before: 2.52it/s
After: 5.35it/s

Test on RTX4090.

Checklist

@leejet
leejet merged commit 2540a4f into master Aug 30, 2026
10 checks passed
@leejet
leejet deleted the feat/backend-native-fp8-matmul branch August 30, 2026 13:57
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant