rc3 ROCm Beta · AMD 双平台测试版
Pre-release
Pre-release
ROCm Beta:AMD 显卡双平台支持(Windows / Linux)
kvmem 的 AMD ROCm 适配测试版。16GB 显存的 A 卡即可跑满 Qwen3.8-27B 的 256K 上下文。本版本基于 rc3,CUDA 用户不受影响。
测试性质:beta 版,欢迎反馈 issue(请附上显卡型号、系统、ROCm/驱动版本)。
下载
| 平台 | 文件 | 说明 |
|---|---|---|
| Windows | kvmem-rocm-windows.zip |
原生 HIP,含 gfx1100/gfx1200/gfx1201(RX 7900 系列 / 9060 XT / 9070 系列) |
| Linux / WSL2 | kvmem-rocm-linux.tar.gz |
Ubuntu 24.04 + ROCm 7.2.x 构建,其他发行版建议源码编译 |
每个包附 .sha256 校验文件;包内另有逐文件 SHA256SUMS、README.md(使用说明)与 VALIDATION.md(验证范围)。
模型需单独下载(包内 README 有链接):IQ3 主模型 + mmproj 视觉投影。
快速开始
# Windows
powershell -NoProfile -ExecutionPolicy Bypass -File .\scripts\rocm\start-iq3.ps1 `
-Model 'D:\models\Qwen3.8-27B-GSQ-RCO-IQ3_S-mtp.gguf' `
-Mmproj 'D:\models\mmproj-Qwen3.8-27B-Q5_K-MIX.gguf'# Linux / WSL2
bash scripts/rocm/start-iq3.sh /path/to/model.gguf /path/to/mmproj.gguf模型加载完成后打开 http://127.0.0.1:18200/
硬件要求
- 显存:16 GiB(256K 上下文实测峰值约 15.1~15.4 GiB)
- 内存:16 GiB(全程实测约 13~14 GiB)
- Windows:AMD 最新驱动 + Visual C++ x64 运行库
- Linux:ROCm 7.2.x;WSL2 请装 Linux 版 ROCm(不能用 Windows DLL)
注意事项
- 杀软误报:本地编译的二进制没有数字签名,360/电脑管家可能启发式报毒,恢复并添加信任即可(我们实测遇到过,文件校验值可对)
- Windows 用户请不要改动启动脚本里的
--load-mode none:改用 mmap 加载会让内存读数从 ~13 GiB 涨到 23 GiB 以上 - 启动脚本默认 MTP2(该配置在 9060 XT 上 decode 更快、命中率更高);想试 MTP3 改脚本里的
--spec-draft-n-max即可 - 其他 AMD 显卡可从源码编译,构建时自动检测架构,详见包内 README
实测数据(RX 9060 XT 16GB,256K 上下文,33 轮压测)
| 指标 | Windows HIP | Linux ROCm (WSL2) |
|---|---|---|
| Prefill | 125.9 tok/s | 126.4 tok/s |
| Decode(MTP3) | 19.68 tok/s | 17.36 tok/s |
| 内存峰值 | 13108 MiB | 14234 MiB |
| 显存峰值 | 无 OOM | 15125 MiB |
贡献者
感谢 @dockylf(Windows HIP 基础)与 @FangJiangyi(Linux ROCm)的原始工作,本版本为三方整合成果。
源码分支:rocm-beta。已知问题与反馈请开 issue。