一套严谨、证据驱动的自主智能体方法论。
观察 → 假设 → 实验 → 观测更新 → 知识更新
Observation → Hypothesis → Experiment → Observation Update → Knowledge Update
Agentic Method 是一组元提示词(meta-prompts)与子智能体协议,面向高风险的工程、研究与决策任务。它不是轻量级的聊天提示词库,而是一套工作流系统,强制智能体:
- 冻结上下文后再行动。
- 生成竞争性假设,而非单一答案。
- 在实验前做出可证伪的量化预测。
- 报告观测与裁决,而非仅有结论。
- 归档失败并诚实更新世界模型。
- 通过受控的并行评测进化自身提示词。
当前的中低端模型已经具备足够强的指令遵循能力,其真正落后于高端模型的地方是零样本推理能力。然而,即使是高端模型,在面对大型代码开发或复杂科研问题时,也难免产生逻辑谬误与模型幻觉。
Agentic Method 通过以下机制解决这一问题:
- 严格 DSL 锚定:用
(CTX)、(H)、(EXP)、(PREDICTION)、(OBSERVATION)、(VERDICT)等标签将模型的解码空间约束到特定任务区域,显著降低幻觉。 - 强制深层推理:每个关键结论必须附带置信度
(CONF)与证据等级,模型不能停留在表面回答。 - 子 Agent 交叉审查:通过
FORM_REVIEWER、HYPOTHESIS_VALIDATOR、COUNTEREXAMPLE_REVIEWER等角色识别循环论证、隐藏假设与事后合理化。 - 引入科研方法:反事实推理、二分实验、消融实验、对照实验、思想实验等方法被显式嵌入工作流,强制模型进行高阶思考。
本质上,我们不是让模型“更聪明”,而是让模型的思考过程更可观测、可证伪、可审计。
为完整运行本协议中的复杂任务(尤其是涉及多文件代码审查、架构决策、长链条因果推理),推荐使用:
- 参数量:200B+
- 上下文窗口:200K+
- 能力:强指令遵循、长上下文稳定、支持工具调用(用于子 Agent)
本协议会消耗大量 token 与上下文,但这种消耗对任务质量的提升是显著的。最佳实践是按需加载 + 模型路由:
- 主 Agent / 编排层:使用最强模型,负责任务分解、假设生成、最终裁决。
- 子 Agent / 审查层:使用更便宜的模型,负责格式审查、假设验证、反例构造等子任务。
- 按需加载:不要让 Agent 一次性加载全部 prompt。让它先读取
main.md,再根据当前任务类型加载对应的核心 prompt。 - 定时进化:在每天空闲时间运行
prompt-evolution-prompt.md对已有 prompt 进行 PEL 迭代。
在良好 prompt 的加持下,中等模型在特定子任务上可以接近甚至媲美更高级模型。
Step 1: Agent 读取 main.md,理解全局协议与可用 prompt 目录
↓
Step 2: 用户告诉 Agent 当前环境(项目类型、偏好、硬约束、目标)
↓
Step 3: Agent 自动选择并填充适配后的 prompt
↓
Step 4: 运行任务,必要时调用子 Agent
↓
Step 5: 任务结束后,Agent 整理资料、归纳经验、生成 MEM
↓
Step 6: 在空闲时间运行 PEL,迭代优化 prompt(建议至少 2 轮)
Agentic Method 最初为软件开发和科研推理场景设计,特别适用于:
- 代码审查与重构
- 复杂 Bug 排查
- 性能优化与实验设计
- 架构决策与技术调研
- 论文/研究报告的因果论证
对于其他领域,欢迎参考 ADAPTATION_GUIDE.md 进行适配,也欢迎贡献你的适配案例。
agentic-method/
├── core/ # 30 个通用协议提示词
│ ├── master-prompt.md # 总控协议
│ ├── meta-data-generation-prompt.md
│ ├── prompt-evolution-prompt.md
│ ├── experimental-design-prompt.md
│ ├── logical-inference-prompt.md
│ ├── subagent-protocol.md
│ ├── prompt-review-prompt.md
│ ├── reflection-prompt.md
│ ├── code-review-prompt.md
│ ├── cpp-code-review-prompt.md
│ ├── debug-prompt.md
│ ├── performance-optimization-prompt.md
│ ├── algorithm-correctness-prompt.md
│ ├── semantic-regression-test-prompt.md
│ ├── semantic-change-regression-prompt.md
│ ├── world-model-learning-prompt.md
│ └── ... 等 30 个核心 prompt
├── main.md # 自动生成的 prompt 目录索引
├── examples/ # 3 个适配示例
│ ├── software-engineering-review-example.md
│ ├── research-survey-example.md
│ └── large-model-inference-gap-example.md
├── reports/ # PEL 日报示例
│ └── example-pel-daily-report.md
├── .github/ # Issue / PR 模板
│ ├── ISSUE_TEMPLATE/
│ └── pull_request_template.md
├── ADAPTATION_GUIDE.md # 如何适配到你的项目
├── CONTRIBUTING.md # 贡献指南
├── .gitignore
└── LICENSE # MIT
完整 prompt 列表请见 main.md。
- 阅读
core/master-prompt.md,理解 DSL 标签与全局规则。 - 根据任务类型选择核心 prompt(例如
experimental-design-prompt.md)。 - 参考
ADAPTATION_GUIDE.md将其适配到你的项目。 - 跑一个小型试点任务,检查输出是否遵循 DSL。
- 使用
prompt-evolution-prompt.md持续变异和优化提示词。
prompt-evolution-prompt.md 不应该是手动运行的奢侈品。为了真正发挥 PEL 的价值,强烈建议将其自动化:
- GitHub Actions:通过
schedule事件每天/每周自动触发 PEL 工作流,自动评测变异、生成日报、提交 Draft PR。 - 自托管 cron:在本地服务器或工作站上设置定时任务,利用空闲 GPU/CPU 运行进化实验。
- 低代码平台:使用 n8n、Make、Zapier 等工具编排“读取 main.md → 选择种子 prompt → 调用 LLM 生成变异 → 并行评测 → 写入报告”的流程。
- Agent 框架:使用 LangChain、LangGraph、AutoGen 等框架实现可复用的 PEL Runner,支持多模型路由、结果持久化、人类审批节点。
自动化目标不是取代人类判断,而是把“哪些 prompt 变体值得看”的筛选工作交给机器,让人类把决策精力放在“是否集成到 core”这一最终环节。
本协议已在 TRAE CN 等集成开发环境中实测,效果良好。
项目处于起步阶段,prompt 类型和泛化能力仍有很大扩展空间。我们将持续提供更多领域的样例适配和社区 prompt,也欢迎你贡献自己的实践:
- 成功将
Agentic Method应用到新的领域(如硬件设计、生物医药、法律研究、游戏开发等); - 提交针对特定任务或领域的 adapter prompt;
- 分享使用 PEL 自动进化出的优质 prompt 变体;
- 提供真实任务的成功/失败案例;
- 有任何建议、批评或改进想法。
请在 Issue 中描述你的使用场景,或在 Pull Request 中提交新的 examples/<domain>-adapter.md 和 core/<task>-prompt.md。在社区的帮助下,我们可以积累越来越多、越来越丰富的 prompt 与最佳实践。
这是开源的力量,祝各位使用愉快!