发布说明
v0.1 - 2026-05-21
首个公开版本。
新增
- 新增 MIMO 兼容的自动化评估 runner:支持质量评估、触发评估、baseline 对照、单 case 运行和迭代结果归档。
- 新增
test/评估资产:包含输出质量用例、触发用例和评估说明。 - 新增
uv项目配置,方便一条命令安装依赖并运行评估。
改进
- 强化默认交付模式:默认直接输出可部署 system prompt,避免额外设计说明混入最终提示词。
- 强化 prompt engineering 原则:更强调明确目标、正向指导、格式样例、判断标准和可执行替代行为。
- 强化运行时隔离:避免把 schema 字段、class 名、上下游管线词、业务代号直接写进目标 agent 的提示词。
- 强化角色命名规则:默认使用职责和专业领域定义角色,而不是项目名、品牌名或 pipeline step 名。
- 强化工具契约规则:只有真实 runtime spec 存在时才写具体工具名、参数和返回字段;只有语义能力时不虚构 API。
- 强化内部评估流程:写完初稿后先按
references/evaluation.md做质量检查,再压缩和修正。
文档与结构
- README 改为中文项目首页,补充适用场景、核心问题、安装方式、使用示例、评估结果和设计思路。
test/README.md改为中文评估说明,保留 runner 用法、断言规则和迭代流程。- skill 正文和 reference 文件仍保持英文,便于 agent 在运行时稳定理解和执行。
- 将评估定义放在仓库根目录
test/,避免把测试资产混进可安装 skill 目录。