Skip to content

Hexagon 后端【高通NPU直接编程支持】 - #4633

Merged
Qxinyu merged 2 commits into
alibaba:masterfrom
jxt1234:feature/hexagon
Jul 21, 2026
Merged

Hexagon 后端【高通NPU直接编程支持】#4633
Qxinyu merged 2 commits into
alibaba:masterfrom
jxt1234:feature/hexagon

Conversation

@jxt1234

@jxt1234 jxt1234 commented Jul 16, 2026

Copy link
Copy Markdown
Collaborator

qwen3-0.6b 8gen4 (v79)

Block64 sym

  • pp512: 2728.66 tok/s
  • tg128: 76.16 tok/s

性能测试结果

测试设备: SM8750 (骁龙 8 Elite), Hexagon v79
模型: Qwen3-0.6B (4-bit 对称量化, block64, C4)
测试工具: llm_bench

表 1: SDK 5.x vs SDK 6.x 编译性能对比

指标 SDK 5.x (v75, clang 15) SDK 6.x (v79, clang 19) 差异
Skeleton 大小 415 KB 426 KB -2.6%
pp512 (5 reps) 2672.70 ± 26.30 tok/s 2678.14 ± 33.98 tok/s -0.2%
tg128 (5 reps) 68.58 ± 0.72 tok/s 69.47 ± 0.90 tok/s -1.3%

结论: 两个 SDK 版本编译的 DSP skeleton 性能基本一致,差异在误差范围内。

表 2: Qwen3-0.6B 三后端性能对比

后端 pp512 (tok/s) tg128 (tok/s) vs CPU prefill vs CPU decode
Hexagon NPU 2667 68.5 7.9x 0.73x
OpenCL GPU 1491 71.4 4.4x 0.76x
CPU 336 94.3 1.0x 1.0x

结论: Hexagon NPU 在 prefill 上优势最大 (7.9x),OpenCL GPU 次之 (4.4x)。CPU 在 decode 上最优。

@Qxinyu
Qxinyu merged commit e128c55 into alibaba:master Jul 21, 2026
8 of 10 checks passed
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

3 participants