Skip to content
This repository was archived by the owner on Aug 15, 2026. It is now read-only.

v0.2.0

Latest

Choose a tag to compare

@github-actions github-actions released this 15 Aug 09:46

DSX v0.2.0

DSX 是 DeepSeek Harness(DSH)的桌面客户端:把官方 DSH 直接打包成双击即用的 Electron 应用,并额外内置了一个可供 AI 模型直接调用的 Chromium 浏览器、图片 OCR 与语音输入。

基于的 DSH 版本

  • 官方 npm 包:@deepseek-ai/dsh@0.1.0-rc.6

v0.2.0 新增

语音输入

  • 输入框右侧新增语音按键,录音后由多模态模型转成文字插入输入框。
  • 录音中直接按发送键或回车:先转写拼接在原有文本后,再自动发送。
  • 16kHz 单声道低码率录音,静音检测避免把空录音发给模型。
  • 语音转写由 DSH 插件后端直连多模态 API,不受浏览器 CORS 限制。

多模态链路统一与去思考

  • 浏览器截图、图片 OCR、语音转写共用同一套多模态配置(接口地址 / API Key / 模型名称)。
  • 所有多模态请求关闭模型思考(thinking: { type: "disabled" }),只返回识别内容或转写文本,不夹带推理过程。

macOS 完善

  • 点 Dock 图标可重新唤出隐藏窗口。
  • 菜单栏托盘改用模板图标,自动适配浅色 / 深色菜单栏。
  • DSH 以独立进程组运行,退出时整组终止,不残留子进程。
  • 为 DMG 提供应用图标。

既有功能

内置 AI 浏览器

  • 默认后台常驻、隐藏运行,模型调用不会突然弹窗。
  • 右侧滑入 / 滑出,分隔条可拖动,支持多标签页、地址栏、前进 / 后退 / 刷新。
  • 模型可直接调用 browser_openbrowser_snapshotbrowser_clickbrowser_typebrowser_screenshot 等工具。

图片 OCR

  • 上传的图片先经多模态模型识别成文字,再交给当前文本模型,DeepSeek 等纯文本模型也能直接看图。
  • 浏览器与图片 OCR 合并进同一个 dsx 插件(packages/dsx),配置走 DSH 官方插件设置接口。
  • 首次升级自动把旧插件 dsx-browser-tool 的设置迁移到 dsx 命名空间。

原生桌面体验

  • 不需要 npx @deepseek-ai/dsh web,也不需要一直开着命令行窗口。
  • 无标题栏、原生窗口控制;关闭窗口只是隐藏,不会退出;系统托盘常驻。
  • 单实例运行,DSH 意外退出后自动重启。

安全

  • 不再监听固定 3080 端口:每次启动使用随机端口 + 一次性访问令牌,只有 DSX 窗口能访问 Web UI 与 API。

安装包

  • Windows:DSX-Setup-0.2.0-x64.exe(NSIS 安装包,支持选择安装目录、桌面与开始菜单快捷方式)。
  • macOS:DSX-0.2.0-arm64.dmg(未签名)。
  • 安装包使用固实 7z 最大压缩,并剔除 README、License、Source Map、TypeScript 声明、测试 / 示例 / 文档目录等非运行文件。

说明

  • macOS 版本未签名,首次打开若被 Gatekeeper 拦截,请在「系统设置 → 隐私与安全性」中允许打开。

从 v0.1.0 升级

直接安装 v0.2.0 安装包即可;~/.dsh 与旧插件设置会自动保留。