Releases: xianyu-sheng/Xenon
Releases · xianyu-sheng/Xenon
Release list
v0.7.1 — Ecosystem Integration
[0.7.1] — 2026-07-23
版本性质: 正式发布 Agent Skills、机器可读集成 CLI、火山方舟 Ark 一等
Provider、llms.txt 优先文档检索和真实 Skill/MCP 互操作验证;该版本是 Xenon
接入 ArkCLI、VeADK 等外部 Agent 生态的稳定契约基线。
ArkCLI / VeADK 生态端到端验证
- 新增
xenon integrations verify:默认只读检查四层 Agent Skill 根目录、MCP
配置、stdio 命令和凭证权限;显式--connect-mcp后执行真实
initialize → initialized → tools/list协议链路。 - MCP 验证支持按服务器选择、0.1–30 秒单请求墙钟上限和最多 32 个服务器;报告
给出可达数、工具数、协商协议版本与握手耗时,不调用工具,也不回显 env/header
值或 URL query。 - MCPClient 的请求超时现同时覆盖初始化、工具发现、工具调用和资源请求;HTTP
transport 复用同一超时配置,避免“doctor 正常但真实连接长期挂起”。 - 使用 ArkCLI 1.0.4 的真实
+connect --path产物验证:24 个内嵌 Skills 全部被
Xenon 发现,加载错误为 0;生态文档同时明确 VeADK 协议兼容与正式 runtime
适配的边界。 - 验证结果:关联套件 79 passed、完整离线套件 1600 passed / 36 deselected;
VeADK 官方mcp==1.26.0weather 示例完成 initialize/list/call 全链路 479.6 ms,
最终 wheel 的真实握手为 460.7 ms。
llms.txt 优先文档检索
- 新增只读
docs_fetch工具:从文档页确定性发现站点根或 docs 子路径的
llms.txt,解析 H1、摘要、H2 文件列表和 Optional 分组,并按用户 query
在本地排序相关链接,不产生额外 LLM 调用。 - 兼容
llms-full.txt、llms-ctx.txt和llms-ctx-full.txt;站点未提供
llms.txt 时透明降级到原 URL 的 HTML 抓取,并在结果中返回 strategy、尝试记录、
选中来源、失败来源和截断状态。 - 文档抓取沿用 SSRF、DNS/IP 和逐跳重定向保护;最多发现 4 个入口、读取 8 个
链接页、返回 30,000 字符,单个链接失败不会推翻其余有效文档。 - ReAct、Plan-Execute、原生工具 schema、执行策略、并行只读工具、收束预算、
上下文压缩和/tools已统一识别docs_fetch。
火山方舟 Ark 一等 Provider
- 新增正式
ark/<model>provider,默认数据面为
https://ark.cn-beijing.volces.com/api/v3,支持ARK_API_KEY、
ARK_BASE_URL、/setup和实时/models发现;不再要求把方舟伪装成
custom provider。 - 兼容读取旧
_custom_providers中的官方 Ark 配置;兼容视图不静默改写文件,
删除 Ark 凭证时会清理旧条目而保留其他自定义厂商。 - Ark 模型目录按
task_type/ 输出模态过滤,只把文本生成模型加入聊天池;
同时读取真实上下文窗口、输出上限和 function-calling 能力元数据。 - 模型目录分页复用单个 HTTP 连接,真实 126 条目录发现由约一分钟级降至
1 秒内;离线时回退到经过核对的文本模型列表。 - 普通对话、流式输出和原生 function calling 复用统一 OpenAI-compatible
协议;流式请求显式启用 usage 尾帧,缓存统计兼容
prompt_tokens_details.cached_tokens并保持ark/<model>统计身份。
Agent Skills 兼容层
- 原有
~/.xenon/skills/*.yaml配方之外,新增标准目录式
<name>/SKILL.md;兼容共享~/.agents/skills、Xenon 用户目录以及项目级
.agents/skills/.xenon/skills,按“共享用户 → Xenon 用户 → 共享项目 →
Xenon 项目”确定性覆盖。 - 启动与
/skill list只读取 YAML frontmatter;技能正文仅在命中时加载,
references/、scripts/、assets/不会被预先塞入 Prompt。 - 标准技能显式调用后进入 Xenon 的 ReAct 与权限链路,保留工具确认、执行边界和
MCP 能力;SKILL.md 中的文字不会被误判成用户的持久记忆指令。 - 资源读取新增目录穿越、符号链接逃逸、UTF-8、单文件 128 KiB 和最多 500 个
资源索引保护;单个损坏技能被隔离,不再导致整个技能注册表清空。 - 新增
/skill doctor,显示扫描根、格式计数与逐文件错误;删除项目覆盖版本后,
下层同名用户技能会自动恢复可见。
外部集成 CLI
- 新增
xenon integrations describe --json版本化能力契约,公开 Agent Skills
目录、MCP 传输能力和稳定命令模板,外部安装器无需猜测 Xenon 私有配置。 - 新增
xenon skill install/list/doctor;安装会先校验完整目录与符号链接边界,
使用同文件系统临时目录原子落盘,支持四种作用域和显式--force替换回执。 - 新增
xenon mcp add/list/remove/doctor;stdio 环境变量和 HTTP 认证头可以通过
stdin JSON/YAML 安全注入,结构化输出仅显示键名,不回显 token、header 值或
URL query。 - MCP 配置写入加入跨进程锁与
0600原子文件权限;REPL 惰性连接链路现可把
持久化的 stdio env 和 HTTP headers 完整传递到 transport。 - JSON 模式保证 stdout 只含一个结构化对象;语法错误、业务错误和成功分别使用
稳定退出码 2、1、0,便于 Ark CLI 等外部 agent helper 自动判断结果。
会话凭证安全
- 自动保存、
/save和旧会话迁移统一移除api_key、token、authorization、password 等凭证字段;会话只保存恢复所需的非敏感模型元数据。 - 读取旧版会话时原子清理已落盘凭证并保持
0600权限,不删除对话、工具轨迹或工作记忆。
用户意图与执行边界
- 新增“仅回答 / 只读 / 可写入 / 可执行”四级逐轮执行策略;Prompt 优化、难度路由和思考范式不能把代码生成擅自升级为写盘或命令执行。
write_code默认仅在对话中返回代码;“输出到对话”“不写入文件”“不要执行”等显式限制具有最高优先级。- 执行边界下沉到 ToolExecutor:只读任务不能写,写入任务不能执行 shell,权限确认不能越过用户当前指令授权;MCP 工具按远端动作名保守分级。
- 新增独立
research调研意图;“打算提交到某平台,请查一下……”按最后一个明确请求子句判定为只读,不再把背景中的“提交”误当成本轮写入授权。 - 只读调研会从原生工具 schema 中移除
clone_repo等写工具,底层 ToolExecutor 同时保留硬拒绝,模型无法通过重试或权限确认越界。 - 代码落屏前新增完整性保护:过滤工具协议,校验闭合代码块,Python 使用 AST 解析;损坏或截断回复在展示前自动重试,裸代码统一包装为 Markdown 代码块。
- 新增真实 DeepSeek 回归:用户要求“输出到对话、不写盘、不执行”时不进入 ReAct,返回代码可解析且临时目录无新增文件。
调研任务与长工具收敛
github_fetch新增repo_activity,以统一的最近 30 条 PR 抽样返回 push、更新时间、近期活动和中位合并耗时等维护信号;结果明确标注为公开样本而非厂商 SLA。- GitHub API 遇到限流、服务端故障或网络失败时自动降级读取公开 HTML;组织、用户和搜索页继续走通用网页读取,不再误报
owner/repo格式错误。 - 有副作用的写入、命令、Git 与克隆工具不再因超时被执行器自动重放;克隆超时会清理不完整缓存并返回确定性失败。
clone_repo、command和git的交互式活动行持续显示已耗时、超时上限和Ctrl+C取消提示;成功、失败、中断与异常路径都会回收进度线程。- ReAct 连续三次工具失败后停止无效探索,使用已有证据生成最终答复;GitHub API/HTML 双重失败也不会无限重试。
启动模型状态
- 提供商发现提前到欢迎卡之前,
MODEL现在展示实际已加载的首选模型与总数,不再先显示“未配置”后又加载模型。 - 默认启动时仅抑制模型列表探测产生的
httpxINFO 噪声;-v仍保留完整诊断,正常任务的 Ctrl+O 日志不受影响。 - 无效提供商以脱敏摘要显示(如“认证失败 HTTP 401,已跳过”),不再输出原始请求行或响应正文;欢迎卡后统一展示可用模型和提供商数量。
家目录隐私边界
$HOME现在是明确的账户边界,不再因.git、package.json、pyproject.toml等标记被当作项目;家目录文件树、关键文件和项目规则不会自动注入模型。- 无项目模式仍加载用户全局指令,但项目上下文根保持为空;具体的无标记子目录仍可作为有界 scratch 工作区,不会向上继承家目录标记。
- 记忆注册表支持无项目状态,此时只启用
user与session;普通“记住”默认落入用户全局,显式 project-local/project-shared 会要求先进入项目。 /memory status明确显示未激活的项目作用域,/project refresh同步重建记忆边界;不再以Path.cwd()回退并在家目录创建项目记忆文件。
权限确认可用性
- 修复 Rich 将权限面板中的
[y]、[n]、[a]、[q]误当作标记并吞掉的问题;面板现在明确显示每个操作的输入键,底部输入提示同步显示[y/n/a/q],并接受大小写输入。
缓存观测核心层
- 为普通、流式和原生工具调用统一生成隐私安全的 Prompt Manifest,按模型、引擎、阶段、稳定前缀、工具模式和上下文压缩代次划分缓存族。
- 新增逐请求缓存事件:记录厂商真实 hit/miss token、字段覆盖率、预期可缓存比例、前缀效率以及 cold/warming/warm/unavailable 状态;不持久化原始 Prompt 或工具内容。
- 本地 JSONL 历史采用有界滚动存储;明确区分“厂商返回 0 命中”和“厂商未提供缓存字段”,避免把未知错误显示为 0%。
- Reflection、Plan、ReAct、Novel、组合引擎与 Direct 对话均标注独立调用阶段;上下文 compact、clear、undo 会开启新的缓存代次。
- 新增
/cache status、/cache explain、/cache history、/cache doctor,分别展示当前状态、最近一次证据、跨会话隐私安全历史和确定性诊断。 - 状态栏使用 cold/warming/n/a/实际命中率语义;
/cost与退出报告不再把未提供缓存字段错误显示为 0%。 - 普通文本、流式与原生工具请求统一经过五层 Prompt Compiler:STATIC、SESSION_STABLE、HISTORY、VOLATILE、CURRENT;编译器保持消息与工具协议语义顺序不变。
- 工具 schema 和 response format 递归规范化并按工具名稳定排序,注册顺序变化不再制造新的工具前缀;动态 system 内容会进入
/cache doctor告警而不会被静默改写。 - AutoRouter 新增保守缓存亲和:只接受 30 分钟内厂商真实 hit 证据,并只在同 tier、健康、基础分差不超过 0.25 的模型间打破平局;显式模型、会话锁、能力和健康始终优先。
- 新增
/cache optimize --dry-run|--apply|--disable与真实/fix-cache别名;设置以私有本地 JSON 原子保存,可逆且不会改写 Prompt、工具协议或制造付费预热请求。
缓存前缀稳定性与本地版本一致性
- 上下文注入拆分为稳定层与易变层:固定引擎指令和项目上下文前置,已有对话历史保持连续,工作记忆与按轮检索记忆靠近当前用户请求。
- 单轮 Prompt 指导不再作为会变化的 system overlay 插到历史之前,改为绑定到本轮用户消息;提示文案不再把“结构化 Prompt”和缓存提升作未经验证的因果关联。
- Direct 流式路径和各推理引擎的 DeepSeek 模型 ID 统一归一为
deepseek/<model>,避免/cost把同一模型拆成两个统计桶。 - 欢迎页与
xenon --version统一读取运行源码的xenon.__version__,避免 editable install 的旧 distribution metadata 显示过期版本。
Star Core 品牌与终端活动状态
- 正式视觉标志从圆角方形/六边形轨道更新为 Star Core:八芒氙蓝星核、非对称群星与断续轨道,小尺寸不再退化成方块。
- 启动动画、README Logo、社交预览和工作流标题统一使用 Star Core 视觉语言。
- 新增终端标签状态机:模型、工具和命令执行时以固定宽度星位循环闪耀;等待输入、权限确认、记忆确认和任务完成时保持静止。
- 标签动画仅在交互式 TTY 启用,支持 CI/dumb 终端自动降级、手动关闭、ASCII 帧和退出标题恢复。
- 活动线程惰性启动、daemon 化并在所有退出路径回收;标题写入失败不会影响模型或工具执行。
验证
- 完整离线回归:
1600 passed, 36 deselected。 - Ruff、
compileall、SVG XML 校验、git diff --check、wheel 与 sdist 构建通过;家目录真实 TTY 启动下的/project与/memory status已验证。
v0.7.0 — User-Governed Memory
[0.7.0] — 2026-07-22
版本性质: 新增 User-Governed Memory 第四大产品支柱,并完成终端交互、工具协议、权限回执、上下文连续性和 DeepSeek V4 兼容性的系统性加固。
User-Governed Memory
- 新增
user、project-local、project-shared、session四层作用域;自动候选默认项目本地,未经确认绝不持久化。 metadata.json保存权威状态与创建/更新/检索/使用时间、计数、重要度、置信度、固定、过期、来源和替代链;小型 Markdown 分类文件供用户直接检查。- 单条、分类、作用域和上下文注入均有 token 阈值;私有作用域超限后按重要度、置信度、时间、检索和成功使用次数自动归档,固定和项目共享记忆不自动淘汰。
- 原子替换与跨进程事务锁共同保护读改写;线程及真实多进程并发写入不会丢失记录。
- 潜在冲突只提示、不静默覆盖;
/memory replace与/memory rollback建立可逆的 supersession 版本链。 - 新增
/memory status/list/search --explain/inspect/doctor/add/archive/restore/pin/unpin/migrate操作面;损坏作用域可诊断且不阻断其他作用域检索。 XENON.md、XENON.local.md、AGENTS.md后备层级与安全@path导入;限制根目录、符号链接、循环、深度和总字节预算。
终端与工具调用修复
Ctrl+O/Shift+Tab通过 prompt-toolkit 的终端切出机制重绘,展开折叠详情不再打乱固定输入区和状态栏。- 权限确认显示规范化后的真实命令/参数,不再出现
命令: ?;会话级放行按精确参数指纹记录。 - ThinkingPanel 正确处理并行工具动作与观察,工具计数和顺序不再错位。
- 识别 DeepSeek 文本形式 DSML 工具调用;direct 模式先验证再渲染,避免把协议标记当普通回复直接显示。
- 项目上下文、长期记忆和单轮提示改为可替换 overlay,各推理引擎统一注入,避免跨轮累积和上下文遗漏。
验证
- 离线回归:
1432 passed, 35 deselected。 - 新增记忆并发、冲突/回滚、完整性诊断、上下文使用计数、指令层级和终端回归测试。
- Python 变更范围 Ruff、
git diff --check、wheel 与 sdist 构建通过。
Bug 修复与可靠性补强
- 危险工具统一接入权限闸门,文件写入/编辑/批量变更改为原子、可回滚操作。
- 模型回退区分配置错误与瞬时错误,补齐断路器半开恢复和流式失败处理。
- Plan 串行/DAG 执行传播结构化失败,依赖步骤不会在上游失败后继续执行。
- GitHub 工具支持 HTTPS/SSH/blob/tree/raw URL、私有仓库认证、真实默认分支和安全缓存更新。
- 工具轨迹、工作记忆和自动保存跨轮持久,降低长会话状态丢失。
DeepSeek V4 兼容性
- 离线模型列表只保留
deepseek-v4-pro与deepseek-v4-flash,默认上下文更新为 1M。 - V4 Pro 默认使用并持久化
reasoning_effort=max;普通、流式和原生工具调用均按模型配置透传。 - 修复模型配置按别名保存、引擎按 canonical model ID 路由时配置未生效的问题。
- 思考模式原生工具调用会保留
reasoning_content、tool_calls与tool_call_id结果,支持当前会话跨轮续接。 - ReAct 在正式 DeepSeek V4 为主模型时自动启用原生工具协议,仍可由调用方显式关闭。
- 强制
tool_choice时仅对该次 DeepSeek V4 请求关闭思考模式,避免官方 API 的不兼容组合返回 400。 - 人民币定价快照按 2026-07-21 官方文档校准;旧别名仅用于历史账单匹配。
TUI 布局更新
- TUI 改为贯穿终端的双线输入区、固定底部状态栏、无边框回答与可折叠工具详情。
- 优化后的 Prompt 改为无边框 dim 排版,模型回复保持正常亮度,HTTP/调试日志降低视觉权重。
- 输入下边界和状态栏分行;状态栏由
prompt_toolkit固定在整个终端屏幕底端。
工程质量
- CI 覆盖 Python 3.10–3.12,区分离线/live/e2e 测试,并启用 Ruff、55% 覆盖率和包构建校验。
- 评测运行器移除 Python 3.11 专属的
datetime.UTC/contextlib.chdir,恢复 Python 3.10 兼容。
v0.6.2
工具执行可见性 + 错误处理 + 工具检测全覆盖。详见 commits: v0.6.1...v0.6.2
v0.6.1 · 氙气轨道 🚀
🆕 新功能
✦ 视觉桥接器(Vision Bridge)
利用模型池多模态模型为 DeepSeek 提供"看图"能力——零外部 API 依赖、零额外 MCP 进程。
/vision on开启视觉模式 →Ctrl+Alt+V粘贴图片 → 自动转录 → DeepSeek 推理- 惰性加载设计:热键首次触发才初始化模型连接,REPL 启动零开销
- 智能模型匹配:先扫描模型池 → 兜底 credentials → 过滤 embedding 模型
- SHA256 缓存去重,避免重复调用
✦ 启动动画 Logo
氙气轨道 Σ-3:◇ 卫星入轨 + ✦ 氙气放电呼吸灯脉冲动画。
- 终端标签页
✦ Xenon,与 Logo 视觉统一 - SVG / PNG 全套品牌素材(GitHub 头像 + 社交预览)
- 非 TTY 环境自动退化静态彩色版本
🔥 DeepSeek 缓存追踪闭环(已发布)
- L1 底部 toolbar 实时:
💾96%💰<0.01💡92% - L2
/cost完整面板:按模型展示缓存 breakdown + 费用 - L3 会话结束自动省钱报告
- 全部走本地确定性计算,零额外 LLM 消费
🐛 修复
- VisionBridge 缓存命中标志未设置(
cached = True) - VisionBridge 误匹配
doubao-embedding-visionembedding 模型 - VisionBridge credentials 兜底扫描缺失
- GIF demo 更新加入
/vision视觉模式步骤
📦 完整变更
📄 PR #301
awesome-deepseek-agent 收录 PR 持续更新中:
https://github.com/awesome-deepseek-agent/awesome-deepseek-agent/pull/301
v0.6.0 — MCP/Skill 云端库 + 惰性加载
🚀 新特性
📡 MCP 云端库 — Smithery 注册中心
/mcp discover实时浏览 7000+ MCP 服务器/mcp install <name>一键安装,惰性连接,自动持久化- Smithery 远程服务器通过 SSE 连接,本地服务器通过 npx 命令
- 30 分钟本地缓存,离线兜底
⚡ MCP 惰性加载
- 启动时不再阻塞于 MCP 子进程连接(12306-mcp 节省 ~4.4s)
- 首次
/mcp_call时才按需启动子进程 /mcp list显示惰性状态 vs 已连接
🛠 Skill 云端库
/skill-discover浏览 28 个精选技能(开发/运维/安全/效率/文档/数据库/网络)/skill-install <name>一键安装- GitHub 云端拉取,始终最新
📖 使用指南
/mcp和/skill直接输出完整使用指南,不走 LLM
📦 升级
pip install --upgrade omniagent-cliv0.5.5 - 智能调度路由层增强(P0-P3)+ 工具体验修复
[0.5.5] - 2026-07-17
智能调度路由层增强(P0-P3)
整合两份外部 AI 路由报告 + 自研方案,落地批量注册、会话粘性、资源感知、限流退避、配置热加载:
- P0 配置链路打通:修复
--config只喂ModelRegistry不喂ModelPool的隐藏 bug(AutoRouter 用 Pool,故配置实际失效);load_from_fileweight 丢失修复;首跑/向导每 provider 注册数可配(OMNIAGENT_MAX_MODELS_PER_PROVIDER)。 - P1-A 批量注册(
/import_models):新模块batch_register.py--YAML/JSON 解析 + 校验 +${ENV}展开 + discover 探测子模型 + probe 健康探活 + 逐项容错注册;配套config/models.example.yaml、/reload_models、main.py models import -f/--file --no-probe。 - P1-B SAAR 会话感知路由:新模块
session_lock.py--工具流锁定首模型,防 ReAct 中途换模型导致上下文漂移 + prompt cache 失效;锁定短路/健康失败释放重锁/漂移降级。 - P2 资源感知调度 + 限流退避:
ModelPool新增perf_profile(fast|cost|balanced)权重向量 +in_flight负载因子 +acquire/release;engine/base._call_llm并发计数配对 + 全链瞬时失败退避重试(429/5xx/网络,Retry-After 上限 30s,depth≤2);/set_profile命令。 - P3 配置热加载:新模块
config_watcher.py--纯 stdlib ctypes 调 libc inotify(零新依赖),监听models.yaml变更自动热加载;监听目录+过滤文件名(正确处理 vim/emacs atomic rename)、debounce 0.5s 防抖、非 Linux 静默降级;OMNIAGENT_CONFIG_WATCH=0可关。 - benchmark 自动 tier:
model_poolregister 时接入benchmark_fetcher(HuggingFace Leaderboard 数据,7 天缓存)校准 tier。
工具执行体验修复
- 文件列举爆炸:
list_files/search_files剪枝垃圾目录(node_modules/.git/venv 等)+ 500/2000 上限;scout300 上限。模拟 930->30 文件。 - "工具调用失败"噪音根治:终端错误分类扩展 + 逐工具补
error/success字段;refactor analyze补success(最高频误判);command/git/weather 补 error;各read_text捕 UnicodeDecodeError;git commitreplacebug;weather IndexError/None°C。 - edit_file/batch_edit 模糊匹配:精确未命中时空白容忍兜底;
batch_write校验阶段原子化 + 诚实契约描述。 - github_fetch:支持
GITHUB_TOKEN环境变量认证(60/h->5000/h)+ 检测 API 截断。 - mcp transport:
StdioTransport后台 drain stderr 防管道死锁;SSETransport加__del__释放连接池。 - 日志级别:默认 INFO->ERROR(第 4 级),静默例行噪声(verbose 仍 DEBUG)。
文档
- 添加终端操作演示视频 + README 嵌入展示。
约束
- 1241/1241 测试全绿(+56 路由层 + 13 watcher 新增)
- 不破坏既有引擎/工具契约
v0.5.4 — TUI 双线输入框 + 仓库清理 + README 重构
v0.5.4 (2026-07-16)
TUI 优化
- 双线输入框:Claude Code 风格——两条平行横线框出输入区域
- 状态栏重构:值+分隔符,无冗余标签
仓库清理
- 移除误入库文件:
=3.0、晨光咖啡/ - 清理构建产物
文档
- README 全面重构:新增竞品对比表
- CHANGELOG 新增 v0.5.4
测试
- 1116/1116 全绿
🤖 Generated with Claude Code
v0.5.3: Bug 修复版本
3 个 Bug 修复: git stdout 字段统一, search_files 文本表示, 参数拦截恢复提示。1110 测试全绿。
v0.5.2: UI 重构 + 模型路由修复 + README 全面重构
UI 重构(prompt_toolkit 集成)
将终端输入从自建 Unix/Windows 双路径统一到 prompt_toolkit:
- 输入体验:
>提示符 + 命令/路径/模型名三级补全(OmniCompleter)+ 历史持久化 - 状态栏:底部工具栏实时显示模型 · Token 用量 · 消息数 · 延迟
- 流式渲染修复:移除 Rich Live 渲染,消除双重/残留面板问题
- 回退兼容:prompt_toolkit 不可用时自动回退
Bug 修复
- 模型路由空 key(critical):自定义模型商中文名导致空 key,模型 ID 格式错误(
/glm-5-2-260617),三处加兜底
文档
- README 全面重构(268 → ~570 行):新增 FAQ / 故障排查 / 配置指南 / 命令参考
- 修正工具列表,所有 badge 更新到 v0.5.2
工程
__version__0.1.0 → 0.5.2(三处统一)- 新增
omniagent --version+ MIT LICENSE - SVG demo 重绘
测试
- 1110/1110 全绿 · PTY 端到端 5 类场景全部通过
完整变更: CHANGELOG.md
v0.4.0: 智能调度系统 — 多优先级队列 + HumanEval 88.4%
🚀 v0.4.0: 智能调度系统
🏆 HumanEval Pass@1: 88.4% (145/164)
使用 OpenAI 官方 评测框架, 模型,完全公开可复现。
核心特性
🎯 多优先级队列调度
- 参考 OS 进程调度思想,模型按能力分 5 级队列 (Q1-Q5)
- 意图识别自动给任务打标签,分发到匹配队列
- 工作窃取机制:高优先级队列可借用低优先级模型
📊 BenchmarkFetcher
- 新模型注册时自动从 HuggingFace Open LLM Leaderboard 拉取评测分数
- 根据 MMLU/BBH/GSM8K/HumanEval 平均分自动定级
- 本地缓存 7 天,失败静默回退到名称推断
📜 /history 路由历史
- 记录每次调度决策:任务意图、复杂度、tier、选中模型、分数
- 环形缓冲区 100 条,可选持久化
🔄 Shift+Tab 切换范式
- 终端快捷键循环切换 8 种思考范式
- 状态栏 3 秒通知横幅
🔀 子任务级模型路由
- 多步任务每步独立选模型:规划用旗舰、执行用性价比
- 全部 7 种引擎已集成
💾 /resume 会话恢复
- 退出自动保存,启动提示可恢复
- 7 天自动过期清理
Bug 修复
- 全部 7 个引擎构造函数透传 model_pool + auto_router 参数
- _load_credentials yaml 优先于 env(对齐 provider_registry)
测试
- 925 单元测试全部通过
- 新增 53 个 v0.4.0 专项测试
🤖 Generated with Claude Code