feat: add eval-optimize-loop pipeline (Evaluation + Prompt Optimization) - #247
feat: add eval-optimize-loop pipeline (Evaluation + Prompt Optimization)#247Joannaxxx123 wants to merge 7 commits into
Conversation
6-stage: Baseline -> Attribution -> Optimize -> Validate -> Gate -> Report. Trace mode (<1s, no API) + Live mode (DeepSeek API). 12 test cases covering optimizable/ineffective/overfitting. Output: JSON + MD with per-case trace and gate decision.
|
CLA Assistant Lite bot All contributors have signed the CLA ✍️ ✅ |
AI Code Review没有重载。已确认该 bug。 现在我来撰写最终的审查报告。## 发现的问题 🚨 Critical
|
Codecov Report❌ Patch coverage is
Additional details and impacted files@@ Coverage Diff @@
## main #247 +/- ##
==========================================
Coverage ? 87.87114%
==========================================
Files ? 482
Lines ? 45165
Branches ? 0
==========================================
Hits ? 39687
Misses ? 5478
Partials ? 0 ☔ View full report in Codecov by Harness. 🚀 New features to boost your workflow:
|
|
注意api-key等凭证信息,一定要脱敏,防止泄漏 |
…y; replace hardcoded API keys with env vars; fix trace train candidate silent fallback
AI Code Review已确认:报告生成器(reporter)中的 这证实了已提交的报告来自于不同版本的报告生成器。因此,这种不同步是确实存在的,且涉及 gate 和 reporter 两个部分。 现在我已经有了完整的概念。让我来撰写审查报告。 发现的问题
|
|
I have read the CLA Document and I hereby sign the CLA |
AI Code Review确认。现在让我来编写审查报告。我还需要更仔细地验证一下 trace-mode 下 让我再次确认关于检测带有 现在进行总结。 发现的问题🚨 Critical
|
AI Code Review我现在完全理解了。让我来整理一下评审意见。我会先验证几个候选问题。 问题 A — 问题 B — 对比器 让我验证一个真正的问题:orchestrator trace 模式 Stage 4 候选验证调用了 现在,问题 C(真正的 Bug):在实时模式下,当 我打算重点关注的实际问题,我先仔细检查一下 然而, 现在让我再找一个我想验证的真正的正确性 Bug:gate 的 让我再检查一下 现在让我敲定真正的问题。让我重新检查评估器的 现在让我再重新考虑一下 orchestrator 中 trace 模式的 我现在已经有了足够的验证。让我写下最终确定的发现。 让我再仔细检查一下:comparator 中第 36 行左右的 现在,关于 现在让我确认一下我想要标记的最重要的实际问题。让我重新读一下评估器对 现在让我重新考虑我认为最有说服力的 Bug:在 让我重新思考一下,是否存在任何 Critical 问题。让我重新检查 测试涵盖了 Windows 驱动器路径、带用例的 Windows 路径以及 unix 路径。很好。SDK 修改很可靠。 现在让我确保没有遗漏安全性问题。 现在,关于示例 agent 我现在已经有了充分的了解。让我最终确定。我会将 attributor 中死代码/失效启发式的问题标记为 Warning(可达但无用的矛盾检测),以及评估器 让我重新考虑最值得标记的事项。让我看看 让我重新考虑 现在,一个真正的担忧: 好的,让我最终确定。我认为坦率地说没有 Critical 问题。让我重新考虑是否有一个值得 Warning 的问题。 实际上,让我重新检查 orchestrator 的环境变量竞态条件,将其视为影响维护性/稳定性的一个真正问题:流水线设置了进程全局的 还有 让我写下最终评审。考虑到限制条件,我会保持精确。 发现的问题
|
Summary
新增
examples/optimization/eval_optimize_loop/,实现"评测 → 失败归因 → Prompt 优化 → 回归验证 → 产物审计"的自动闭环 Pipeline。Pipeline Flow
Stage 1: Baseline Evaluation → 评测 train + val set
Stage 2: Failure Attribution → 按类型聚类 (hallucination / tool_call_error / missing_information / overgeneralization)
Stage 3: Optimization → 基于训练集失败诊断, 定向修改 prompt
Stage 4: Candidate Validation → 用 optimized prompt 重新跑 val set
Stage 5: Delta Comparison + Gate → 5 项检查决定 ACCEPT / REJECT
Stage 6: Report Generation → JSON + Markdown 双格式输出
Features
Files Changed
examples/optimization/eval_optimize_loop/— 全部新增