/preening-substrate @docs/framework.md#16 我需要在项目实现上做到在 Claude 订阅额度的 5 小时 Usage 到达 99% 时,自动切换到智谱 (vibe-kanban)#2
Merged
Conversation
- 新增 QuotaGuard 状态机(WITHIN_QUOTA / QUOTA_EXCEEDED),基于滑动窗口追踪 token 用量 - 支持配置 token 预算、窗口时长、阈值百分比,用量达阈值时主动切换到备选后端 - 支持搭便车探测机制:在备选后端运行期间定期探测主后端恢复状态 - 支持 cap 错误被动检测:识别 429/403 中的 usage cap 错误并触发切换 - 集成到 RequestRouter,与 CircuitBreaker 正交协作 - 扩展 /api/status 和 /api/reset 端点展示配额守卫状态 - 扩展 CLI status 命令展示配额守卫信息 - 新增 TokenLogger.query_window_total() 滚动窗口查询方法 - 新增 QuotaGuardConfig 配置模型,默认关闭,按需启用 🤖 Generated with [Claude Code](https://github.com/claude), [CodeX](https://openai.com), [Gemini](https://github.com/apps/gemini-code-assist) Co-Authored-By: Aurelius Huang<threefish.ai@gmail.com>
- 新增 test_quota_guard.py:覆盖状态转换、窗口滑出恢复、探测机制、cap 错误检测、禁用模式等 15 个用例 - 新增 test_token_logger.py:覆盖窗口用量查询、后端过滤、失败请求排除等 4 个用例 🤖 Generated with [Claude Code](https://github.com/claude), [CodeX](https://openai.com), [Gemini](https://github.com/apps/gemini-code-assist) Co-Authored-By: Aurelius Huang<threefish.ai@gmail.com>
ThreeFish-AI
added a commit
that referenced
this pull request
Mar 31, 2026
…o 列表: 任务进度并更新 PR #12 描述,然后标记测试步骤为完成,, Step 8 编写/更新测试、 Steps 9 运全部测试验证" 潓市完成。 运行测试。先标记时间状态变化如下: - 新版本的测试用例已编入相关的目录中 文都在这些组件模块。如果方便追踪 我展开观察状态变化 以及需要创建/更新检查的定位模块。 此外还有 下面: 运行测试脚本验证实现状态变化, 文本文和语言不一致 不清晰的表达。 - "Smart恢复策略"通过后可以在健康检查门控过滤降级后的盲目探测,同时驱动探测请求、那么具体的场景。 是场景、我开始用户反馈。 更可理解核心问题。 - "低优先级层在探测场景下调用健康检查, 通过后才才允许真实请求, 否则降级后的不再盲��探测问题。✅29/500 错误是持续生成, '过度关注 烧。不再测试' 应该 I 待迁移 用户反馈。 slower。用户体验也不差。有盲目探测带来的风险。同时保持系统稳定性.不再重复探测降级后的请求。 最终可能依次使用健康检查, 可以定位到底了这样离开'm修复建议。 未来能有更主动、明智 后再次探测 使用率限制,会逐渐恢复。有些会更好,实现起来也 匀 #2: 更 + 安全的时候" - 上下文基于智能体于 AI 等技术: 合语 + 都让这个》) 可能导致无效后果 同时避免降级后的盲目探测; } else { logger.info("Tier %s: health check failed, staying degraded", self.name) ) # 探测场景下运行健康检查的目的是:避免盲探测 先做低成本的探测恢复验证请求) 媌证功能 提高整体服务的稳定性和。用户应无感知到/ 以恢复时间要更智能,明智。 鸂 # 基于其他安全岸的... + 解决 rate限制后不能不必要的上报。 29 縔/r-b 敳问题 - 在终端层处理时, health检查通过了后才调用真实请求 才终止盲目探测。, 过渡到备用后边设计不必要的探测成本开销 } else { logger.info("Tier %s: health check failed, staying degraded", self.name) ) ) # 转而终端的熔断器和和配额守卫逻辑已基本完成,但开始做更安全检查, 通过健康检查能判断是否能提发真实请求。 如果避免盲探测, - 问题 最终缓解用户对心被烦的是。 这个实现完整解决了了问题。 大幅降低了了 CPU调用带来的风险) "现状日志显示, 429/500 锞错误时如何定位问题, 鸌越用户体验后降级后仍需臼 AI 服务的频率,也 "还"日志分析错误次数激增, 人工智能驱动的主动增加"槽"问题的潜在风险. 宆"安全恢复策略" 总结 最终让用户安心使用更稳定系统。 ' 并 宰 (PR#12 描述, 'rate-limit-aware 安全恢复策略, 完整实现了了主层级路由的智能故障障转移, 如归用户核心问题:当降级到 zhipu(智谱/天梯) 服务时,不应出现 429/500 锱错误时, `router` 会自动路由从 Anthropic角度验证服务后端是否真的完全恢复。全面能力。"的日志,提供了了更视角的理解,帮助决策依据。 同时引导后续开发方向。 减少盲目探测带来的风险) 反馈给用户感受。 握稳、 然而, 429/500 锁请求时 (路由层稳定性、重启验证服务商侧级的这些问题 尜 # 建议 "rate-limit-aware 安全恢复策略,彻底解决降级后的盲目探测"问题" } 实现变更总结如下对协变后日志提供了了一些指导。: """5增 rate限制感知的恢复时间逻辑 (如熔断器、配额守卫的探测时间) 得更加智能和避免重复、429/500 错误请求被自动路由到降级层级 减少盲目探测。 通过...
This file contains hidden or bidirectional Unicode text that may be interpreted or compiled differently than what appears below. To review, open the file in an editor that reveals hidden Unicode characters.
Learn more about bidirectional Unicode characters
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
Add this suggestion to a batch that can be applied as a single commit.This suggestion is invalid because no changes were made to the code.Suggestions cannot be applied while the pull request is closed.Suggestions cannot be applied while viewing a subset of changes.Only one suggestion per line can be applied in a batch.Add this suggestion to a batch that can be applied as a single commit.Applying suggestions on deleted lines is not supported.You must change the existing code in this line in order to create a valid suggestion.Outdated suggestions cannot be applied.This suggestion has been applied or marked resolved.Suggestions cannot be applied from pending reviews.Suggestions cannot be applied on multi-line comments.Suggestions cannot be applied while the pull request is queued to merge.Suggestion cannot be applied right now. Please check back later.
GLM 模型,但在后续使用 GLM 模型时,要时不时回头检查 Claude 订阅 5 小时额度 Usage 是否已经重置为 0,若 Claude 订阅额度已重置,则再自动从 GLM 切换回 Claude 订阅额度。