Replies: 1 comment 1 reply
|
我去,还真是要配置 |
1 reply
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
Uh oh!
There was an error while loading. Please reload this page.
环境
http://127.0.0.1:8080/v1症状
llama-server 自带 WebUI 里拖图识别完全正常(说明服务端视觉链路 OK),但 DSH 里读图被拦,错误信息:
根因
DSH 的 read_image 有一道"能力闸门":当前模型必须在配置里显式声明支持图像输入,才允许把图读进上下文。模型条目没写
input时按纯文本处理——图片请求在 DSH 端就被拒掉,根本不会发到 llama.cpp,所以服务端毫无感知。修复(就一行)
~/.dsh/settings.yaml的模型条目加input: [text, image]:settings.yaml 有热加载 watcher,改完即生效,无需重启 DSH。
llama.cpp 侧启动命令(视觉 + MTP + ngram,24GB 实测)
参数要点:
--image-min-tokens 1024:服务器日志自荐参数。Qwen-VL 做 grounding(图上定位)任务时默认每图 576 token 精度不够,加这个保精度--cache-type q8_0:24GB 卡跑 27B 级权重的实测安全档;f16 K @128k 会静默溢出到 CPU,表现为长 prompt 处理速度断崖(实测 176→94→66 t/s 指纹),别踩--spec-type draft-mtp,ngram-mod:MTP + ngram 双草稿(Qwen3.8 自带 1 层 MTP,GGUF 里就有),实测草稿接受率 ~57%--fit off:显存不足时明确报错退出,而不是静默降配置DSH 模型配置的其他坑(openai-completions)
contextWindow按服务端--ctx-size的实际值填(本例 131072),别照抄云端模型的值cost全填 0,本地不花钱,否则统计跑出天文数字low / medium / high三档reasoning_effort,不认xhigh/minimal(DLL 字符串级验证)。Qwen3.8 默认思考深度是 xhigh,映射要写xhigh: 'high'而不是xhigh: 'xhigh',后者发过去就是 400/v1/models动态拉reasoning_effort字段 b10430 原生支持,不需要加compat: { supportsReasoningEffort: false }验证
DSH 里发一张图,llama-server 日志随即出现 mtmd/clip 图像处理行——看到它就是整条链路通了。
性能参考(RTX 4090 + 上述参数)
Agent 编程场景实测:生成 82 tok/s、首 token 平均 0.8s、提示缓存命中 91%——
--cache-prompt在 Agent 每轮重发大上下文的场景下收益极大。All reactions