Skip to content

a4api v0.3.0

Choose a tag to compare

@eogee eogee released this 17 Sep 10:39
· 14 commits to master since this release

a4api v0.3.0

重磅:完整合并 a4agent,新增「本地模型」推理控制台

把 llama.cpp 的 llama-server 封装为一键启动的 OpenAI 兼容 API 服务——装哪个引擎、选哪个模型、给什么参数,全程可视化操作。与「API 切换」组合,即得 Claude Code 完全离线方案。

首次配置向导

  • 硬件检测与预设推荐:nvidia-smi + 注册表双路枚举显卡(厂商 / 显存 / 驱动),按显存档位推荐推理预设(上下文长度、KV 缓存量化、MTP 投机解码)
  • 引擎自动获取:按显卡自动下载 llama.cpp 官方预编译引擎(Vulkan / CUDA 12.4 / CUDA 13.3 / CPU,钉定 b10919,二进制可复现),CUDA 主包与 cudart 运行库自动解压合并、原子换入;支持离线安装;已装旧版 a4agent 时自动接管其引擎,免重复下载
  • 模型库:多目录扫描 .gguf,解析大小 / 量化级别 / 原生上下文 / MTP 层,一键设为默认模型;显存溢出两档预警

服务运行

  • 运行状态机(启动中 / 运行中 / 失败 / 已停止)+ 实时日志滚动;4 分钟健康检查;端口占用 / 引擎缺失 / 进程崩溃明确报错;运行就绪后定时内存裁剪
  • 推理参数可视化:上下文长度、KV 缓存(f16/q8_0/q4_0)、Flash Attention、GPU 层数、MTP 步数(自动探测引擎新 spec / 旧 --mtp 两种写法)、附加参数逃生舱
  • API Key 鉴权:一键生成 sk- 随机密钥,局域网开放时建议开启
  • 局域网开放切换(0.0.0.0),接入页给出 Base URL / Chat 地址 / curl / openai SDK 示例
  • 「接入配置方案」:一键创建指向本地服务的配置方案,到「配置方案」页切换即可让四端用上本地模型,与云上 API 无缝互切

交互细节

  • pywebview 原生文件夹 / 文件选择对话框(添加模型目录、浏览 mmproj),浏览器模式自动退化为手动输入
  • 全局统一的 layui primary 复选框皮肤与品牌色单选;运行日志与推理设置卡片等高布局

其他

  • 新增浏览器调试入口 dev_server.py(uv run python dev_server.py):与已安装版共享同一份数据(%APPDATA%\a4api),先在浏览器验证再打包,免装快迭代
  • 测试从 172 例增至 212 例(GGUF 合成二进制解析、预设边界、驱动降级推荐、解压路径穿越防护、进程命令行拼装、运行时管理器等)

校验

  • 安装包:a4api-setup-0.3.0.exe
  • SHA256:CBC5CE69CB2A0E52F2453FCC825883609448824D312FF4A1CB9E16108FC28E36
  • 建议下载后核对校验值,确保文件完整未被篡改。