Skip to content

v0.1

Latest

Choose a tag to compare

@CR-730 CR-730 released this 21 May 03:59

发布说明

v0.1 - 2026-05-21

首个公开版本。

新增

  • 新增 MIMO 兼容的自动化评估 runner:支持质量评估、触发评估、baseline 对照、单 case 运行和迭代结果归档。
  • 新增 test/ 评估资产:包含输出质量用例、触发用例和评估说明。
  • 新增 uv 项目配置,方便一条命令安装依赖并运行评估。

改进

  • 强化默认交付模式:默认直接输出可部署 system prompt,避免额外设计说明混入最终提示词。
  • 强化 prompt engineering 原则:更强调明确目标、正向指导、格式样例、判断标准和可执行替代行为。
  • 强化运行时隔离:避免把 schema 字段、class 名、上下游管线词、业务代号直接写进目标 agent 的提示词。
  • 强化角色命名规则:默认使用职责和专业领域定义角色,而不是项目名、品牌名或 pipeline step 名。
  • 强化工具契约规则:只有真实 runtime spec 存在时才写具体工具名、参数和返回字段;只有语义能力时不虚构 API。
  • 强化内部评估流程:写完初稿后先按 references/evaluation.md 做质量检查,再压缩和修正。

文档与结构

  • README 改为中文项目首页,补充适用场景、核心问题、安装方式、使用示例、评估结果和设计思路。
  • test/README.md 改为中文评估说明,保留 runner 用法、断言规则和迭代流程。
  • skill 正文和 reference 文件仍保持英文,便于 agent 在运行时稳定理解和执行。
  • 将评估定义放在仓库根目录 test/,避免把测试资产混进可安装 skill 目录。