a4api v0.3.0
a4api v0.3.0
重磅:完整合并 a4agent,新增「本地模型」推理控制台
把 llama.cpp 的 llama-server 封装为一键启动的 OpenAI 兼容 API 服务——装哪个引擎、选哪个模型、给什么参数,全程可视化操作。与「API 切换」组合,即得 Claude Code 完全离线方案。
首次配置向导
- 硬件检测与预设推荐:
nvidia-smi+ 注册表双路枚举显卡(厂商 / 显存 / 驱动),按显存档位推荐推理预设(上下文长度、KV 缓存量化、MTP 投机解码) - 引擎自动获取:按显卡自动下载 llama.cpp 官方预编译引擎(Vulkan / CUDA 12.4 / CUDA 13.3 / CPU,钉定
b10919,二进制可复现),CUDA 主包与 cudart 运行库自动解压合并、原子换入;支持离线安装;已装旧版 a4agent 时自动接管其引擎,免重复下载 - 模型库:多目录扫描
.gguf,解析大小 / 量化级别 / 原生上下文 / MTP 层,一键设为默认模型;显存溢出两档预警
服务运行
- 运行状态机(启动中 / 运行中 / 失败 / 已停止)+ 实时日志滚动;4 分钟健康检查;端口占用 / 引擎缺失 / 进程崩溃明确报错;运行就绪后定时内存裁剪
- 推理参数可视化:上下文长度、KV 缓存(f16/q8_0/q4_0)、Flash Attention、GPU 层数、MTP 步数(自动探测引擎新 spec / 旧
--mtp两种写法)、附加参数逃生舱 - API Key 鉴权:一键生成
sk-随机密钥,局域网开放时建议开启 - 局域网开放切换(
0.0.0.0),接入页给出 Base URL / Chat 地址 / curl / openai SDK 示例 - 「接入配置方案」:一键创建指向本地服务的配置方案,到「配置方案」页切换即可让四端用上本地模型,与云上 API 无缝互切
交互细节
- pywebview 原生文件夹 / 文件选择对话框(添加模型目录、浏览 mmproj),浏览器模式自动退化为手动输入
- 全局统一的 layui primary 复选框皮肤与品牌色单选;运行日志与推理设置卡片等高布局
其他
- 新增浏览器调试入口
dev_server.py(uv run python dev_server.py):与已安装版共享同一份数据(%APPDATA%\a4api),先在浏览器验证再打包,免装快迭代 - 测试从 172 例增至 212 例(GGUF 合成二进制解析、预设边界、驱动降级推荐、解压路径穿越防护、进程命令行拼装、运行时管理器等)
校验
- 安装包:
a4api-setup-0.3.0.exe - SHA256:
CBC5CE69CB2A0E52F2453FCC825883609448824D312FF4A1CB9E16108FC28E36 - 建议下载后核对校验值,确保文件完整未被篡改。