Skip to content

b10728

Pre-release
Pre-release

Choose a tag to compare

@github-actions github-actions released this 31 Aug 21:46
e4b9af0

CUDA: XOR swizzle flash attn K,V smem fp16 tiles (#25635)

  • CUDA: XOR swizzle flash attn K,V smem fp16 tiles

Signed-off-by: ynankani ynankani@nvidia.com

  • Fix use 64bit generic pointer instead of 32bit shared pointer

Signed-off-by: ynankani ynankani@nvidia.com

  • fix shared memory race in FA on DGX Spark

  • Handle corener case

Signed-off-by: ynankani ynankani@nvidia.com

  • Add swizzle test cases and gate sync for swizzled path only

Signed-off-by: ynankani ynankani@nvidia.com

  • gate CUDA PTX

Signed-off-by: ynankani ynankani@nvidia.com

  • offset calculation specific for swizzle branch

Signed-off-by: ynankani ynankani@nvidia.com

  • Reafctor code

Signed-off-by: ynankani ynankani@nvidia.com

  • Refactor FA swizzle ldmatrix if/else into helpers (K row/col, V offset)

Signed-off-by: ynankani ynankani@nvidia.com

  • rebase and update test case args

Signed-off-by: ynankani ynankani@nvidia.com

  • Allow swizzle for non-pow2 shapes, for which nbatch_2%32==0

Signed-off-by: ynankani ynankani@nvidia.com


Signed-off-by: ynankani ynankani@nvidia.com

Website:

Attestations:

macOS/iOS:

Linux:

Android:

Windows:

openEuler:

  • DISABLED
  • openEuler x86 (310p)
  • openEuler x86 (910b, ACL Graph)
  • openEuler aarch64 (310p)
  • openEuler aarch64 (910b, ACL Graph)

UI: