Skip to content

llama.cpp bailingmoe3 Windows 预编译 (CUDA 12.4)

Latest

Choose a tag to compare

@PangTianHua PangTianHua released this 16 Aug 14:18
6ea215d

Windows 预编译 llama.cpp(带 bailingmoe3 支持)

这是 llama.cpp 在 aetherbird/llama.cpp bailingmoe3-support 分支的 Windows x64 预编译版本,专门支持蚂蚁百灵 (inclusionAI) 的 Ling-3.0-tiny (BailingMoE3) 7.9B MoE 模型。

⚠️ 必须用这个 build(或同源 build)才能跑 Ling-3.0-tiny,bailingmoe3 架构还没合并到官方 llama.cpp upstream。

包含内容

  • llama-server.exe — OpenAI 兼容 API server
  • ggml-cuda.dll — CUDA 12.4 后端
  • cudart64_12.dll / cublas64_12.dll / cublasLt64_12.dll — CUDA runtime
  • 完整 *.dll(无外部依赖)+ 89 个 helper exe

系统要求

  • OS: Windows 10/11 x64
  • GPU: NVIDIA Turing+(RTX 20 系及以上)
  • 显存: 4 GB 最低,6 GB 推荐
  • CUDA Driver: 525.60+
  • 模型: Q4_K_M GGUF 4.5 GB(见下)

配套模型

下载 GGUF(必须是 bailingmoe3 架构,不是普通 Q4_K_M):

Mike0021/Ling-3.0-tiny-GGUF(已有,4.5 GB Q4_K_M)
https://huggingface.co/Mike0021/Ling-3.0-tiny-GGUF

快速开始

# 1. 解压
Expand-Archive llama-bailingmoe3-cuda12.4-bin-win-x64.zip D:\llama\

# 2. 启动 server
cd D:\llama\llama-bailingmoe3-cuda12.4-bin-win-x64
.\llama-server.exe -m D:\models\Ling-3.0-tiny-Q4_K_M.gguf -ngl 99 -c 4096