You signed in with another tab or window. Reload to refresh your session.You signed out in another tab or window. Reload to refresh your session.You switched accounts on another tab or window. Reload to refresh your session.Dismiss alert
reacted with thumbs up emoji reacted with thumbs down emoji reacted with laugh emoji reacted with hooray emoji reacted with confused emoji reacted with heart emoji reacted with rocket emoji reacted with eyes emoji
Uh oh!
There was an error while loading. Please reload this page.
Uh oh!
There was an error while loading. Please reload this page.
案例:用本地 Qwen3.8 27B 驱动 DSH 长程 Agent Loop,并把复杂推理委托给远端模型
这是一份基于两个真实 DSH Web 会话导出的案例记录。目标是验证:一张 RTX 5090 上运行的 27B NVFP4 模型,能否作为 DSH 的主 Agent 持续调度工具、修改自身运行时、跨上下文压缩推进任务,并在必要时把深度推理或并行任务委托给远端模型。
使用的本地模型是
lyf/Qwen3.8-27B-Heretic-ARA-NVFP4-MTP-VL,由 vLLM 提供 OpenAI-compatible API;Agent Harness 是 DSH0.1.0-rc.7。运行结构
本地模型负责高频规划、工具调用、错误恢复和最终整合。远端模型只处理两类工作:需要更深推理的单项难题,以及适合并行 fan-out 的多个独立任务。这种结构接近“JavaScript 主线程 + worker pool”。
本地 vLLM 配置使用:
会话一:让 DSH 构建自己的混合 Agent preset
第一项任务要求 DSH 在运行中建立以下行为:
deep_think,路由到 Luna xhigh;deep_think_batch并行执行;这不是单纯写一段 system prompt。Qwen 先读取 DSH 的 composition 规则,区分 host plane 与 agent-preset plane,然后:
qwen-gpt56preset;轨迹规模
“累计输入 token”会重复计算每个 agent step 携带的历史上下文,因此不能视为唯一 token 或计费 token。这个 workload 的 system/tool/history 前缀很大,vLLM Prefix Cache 对实际 prefill 成本非常关键。
DSH 自修改与恢复
这一轨迹最有价值的部分是运行时恢复。模型遇到并修复了多类真实错误:
additionalProperties;required;deep_think首次真实调用报ctx is not defined。最后一个错误发生在端到端 smoke test。Qwen 定位到
collect使用了错误作用域中的ctx,修复参数传递,再通过未使用过的模块 URL 绕开 ESM 失败缓存,随后重新验证:deep_think成功;deep_think_batch并发成功;这说明 DSH 的“everything is a plugin”架构可以被模型实际操作:读取 composition、定义动态工具、运行、观察错误、修复、重新挂载并验证。
会话二:从能力测试推进到替换 web_search provider
第二个会话使用刚建立的
qwen-gpt56preset。任务逐步扩展为:agy的 one-shot 搜索;web_search,验证后端已经切换。轨迹规模
DSH 在这段长任务里做了多轮 summary compaction。压缩之后,Agent 仍保留了当前目标、关键路径、已完成修改和待验证假设,最终完成 provider package、profile patch、模块解析链接、HMR 激活以及真实搜索调用。
委托并不等于盲信
这个 preset 的一个重要行为是:远端专家和子代理提供结果,本地主 Agent 负责验证和整合。
292,Qwen 随后写本地动态规划脚本复核;主 Agent 又独立检查了结果。
第二个复杂案例中,Qwen 把 Cordis HMR 是否重建
WebRuntime的生命周期判断交给 Luna,随后结合本地源码与真实web_search调用完成最终确认。远端模型负责高难度判断,本地模型保留执行权和验收权。DSH 层面的观察
1. 插件化架构适合 Agent 自修改
DSH 把工具、provider、agent preset、compaction 和运行时能力统一成 composition rows。模型可以沿着同一种机制完成检查、定义、挂载、停止和替换,减少了“配置层”和“代码层”之间的断裂。
2. Session JSONL 足够还原真实 Agent 行为
导出的 JSONL 包含:
这些事件足以计算每步 TTFT、流式 decode 速度、上下文增长、工具失败和恢复轨迹,也可以把主 Agent 与 subagent 分开分析。
3. 长任务的瓶颈主要在 Agent 效率
本地模型的 decode 很快,主要问题是推理偏长和请求放大。一个复杂 turn 产生 91 次模型请求;简单子任务也可能先生成大量 reasoning 才执行脚本。对这类 workload,以下优化很有价值:
4. 混合路由提高能力上限,也引入远端尾延迟
本地 Qwen 的高频 agent loop 保持在本机;少量 Luna 请求提供深推理补强。一次 Luna 请求约 36 秒,复杂生命周期审查约 514 秒,因此远端专家会直接影响 turn 的 p99。委托条件需要足够严格。
结论
这两个会话证明了 DSH 可以把一台本地工作站上的 27B 量化模型组织成可持续工作的 coding agent:它能连续调用工具、修改 Harness 自身、生成并装载插件、管理 subagent、跨多轮 compaction 维持状态,并对远端专家结果进行本地验证。
效果最好的角色分工是:
这两段轨迹属于不同任务下的探索性案例,用于展示 DSH 的能力与运行特征,不构成模型间的严格 A/B benchmark。
All reactions