使用llama-server本地部署的deepseek v4 flash 如何在deepseek harness中调整思考强度? #1058
|
LLAMA_CPP_DIR="${LLAMA_CPP_DIR:-${HOME}/workspace/llama.cpp-dsv4-ckpt/}" MODEL="${MODEL:-/opt/models/unsloth__DeepSeek-V4-Flash-0731-GGUF/UD-Q8_K_XL/DeepSeek-V4-Flash-0731-UD-Q8_K_XL-00001-of-00005.gguf}" HOST="${HOST:-0.0.0.0}" 在deepseek harness如何自定义思考强度? |
Replies: 6 comments 2 replies
|
"思考强度"(reasoning effort)在 DSH 里的控制位置: 官方模型(deepseek-official)
llama-server / OpenAI 兼容端点 可行路径
如果官方 adapter 支持自定义端点的 reasoning 透传,欢迎补充——这块以源码 packages/llm 里的实现为准。 |
|
思考强度这件事在自定义路由上是有实测过的配置面的,给你已验证的姿势: DSH 侧选择的思考等级(minimal/low/medium/high/xhigh)到 wire 上发什么,由模型声明里的 对 llama-server:给它配一条自定义路由( 边界说明:这条链路保证的是"你选的档位被正确翻译上线";llama.cpp 那头认不认 |
|
更新一下我 08-14 那条里的边界说明:当时写的是「第三方端点不一定映射 reasoningEffort」——现在 @weijiafu14 给出了实测答案,这个边界可以收紧成一句可操作的规则:发到 wire 上的字段由模型声明的 所以 llama-server 这类自定义端点的正确做法是:走自定义路由,在模型条目里把档位映射到 llama-server 实际认的值(而不是期望它接受 装置与判决(录制代理抓请求体、断言「声明的映射赢过默认拼写」)在 https://github.com/weijiafu14/pi2dsh/tree/main/examples/gateway-compat ,比口头结论更值得引用。 |
|
可以用带effort管理的插件么比如 https://github.com/drscrewdriver/dsh-thinking-levels |
|
在 master(c291e7961)源码里核实了自定义端点声明思考强度的完整机制,供你对照 llama-server 配置:
配置示例(放在你的自定义 provider 模型条目下): models:
- id: <你的模型id>
contextWindow: 262144
reasoningEfforts:
off:
high: high
max: ultra注意:以上机制属于 llm-pi-ai(OpenAI 兼容路由);如果你用的是其他适配器插件,需查对应插件的 reasoning 配置。另外 harness 侧只负责把选中的 wire 值发出去,llama-server 是否识别该字段属于 llama.cpp 侧行为,我未验证(未验证);楼上"字段没生效"的实测大概率就是 llama-server 不认这个拼写,建议先确认 llama-server 期望的参数名。 |



"思考强度"(reasoning effort)在 DSH 里的控制位置:
官方模型(deepseek-official)
~/.dsh/settings.yaml里agent-default-model.reasoningEffort,取值min | low | medium | high | maxllama-server / OpenAI 兼容端点
DSH 走"自定义 provider"表单(Providers 页的 Custom 表单,支持自定义 base URL + 模型名)。这里有个现实边界需要说明:
reasoningEffort是 DSH 的会话偏好参数,最终会不会变成请求里的reasoning_effort/相应字段透传给 llama-server,取决于对应 LLM adapter 的实现——DSH 官方 adapter 是为 DeepSeek 官方 API 写的,第三方端点不一定映射这个参数。llama-server 侧的"思考强度"目前更直接的控制是它自己的参数(如--reasoning、--jinja、chat template 或温度/采样参数)。可行路径
reasoningEffort只作为 DSH 侧偏好设置,能否生效以请求抓包为准。…