Releases: PangTianHua/llama-kelingmoe3.cpp
Releases · PangTianHua/llama-kelingmoe3.cpp
Release list
llama.cpp bailingmoe3 Windows 预编译 (CUDA 12.4)
Windows 预编译 llama.cpp(带 bailingmoe3 支持)
这是 llama.cpp 在 aetherbird/llama.cpp bailingmoe3-support 分支的 Windows x64 预编译版本,专门支持蚂蚁百灵 (inclusionAI) 的 Ling-3.0-tiny (BailingMoE3) 7.9B MoE 模型。
包含内容
llama-server.exe— OpenAI 兼容 API serverggml-cuda.dll— CUDA 12.4 后端cudart64_12.dll/cublas64_12.dll/cublasLt64_12.dll— CUDA runtime- 完整
*.dll(无外部依赖)+ 89 个 helper exe
系统要求
- OS: Windows 10/11 x64
- GPU: NVIDIA Turing+(RTX 20 系及以上)
- 显存: 4 GB 最低,6 GB 推荐
- CUDA Driver: 525.60+
- 模型: Q4_K_M GGUF 4.5 GB(见下)
配套模型
下载 GGUF(必须是 bailingmoe3 架构,不是普通 Q4_K_M):
Mike0021/Ling-3.0-tiny-GGUF(已有,4.5 GB Q4_K_M)
https://huggingface.co/Mike0021/Ling-3.0-tiny-GGUF
快速开始
# 1. 解压
Expand-Archive llama-bailingmoe3-cuda12.4-bin-win-x64.zip D:\llama\
# 2. 启动 server
cd D:\llama\llama-bailingmoe3-cuda12.4-bin-win-x64
.\llama-server.exe -m D:\models\Ling-3.0-tiny-Q4_K_M.gguf -ngl 99 -c 4096