-
Notifications
You must be signed in to change notification settings - Fork 7
Retrieval Benchmark zh CN
JanYork edited this page Sep 13, 2026
·
3 revisions
语言: English · 简体中文
这是未调优的检索基线,而不是 LWC 在持续使用中的效果上限。 实际使用时,模型可以主动评估证据,也可以响应用户纠正和相关性反馈,持续更新文档权重与查询反馈。因此,在反馈可靠、持续执行调优的情况下,实际检索效果有望优于这里的静态基线;本次未量化这部分增益。“被动调整”指响应反馈后由 Agent 执行更新,并非每次查询都会在后台自动学习。
2026 年 9 月 13 日,在 Apple M5 Pro Mac 上以 4 路并发完成两轮本地评测, 均处理 500/500 题,其中 470 题计入检索指标,使用固定版本 LongMemEval-S 数据集。第二轮复用第一轮保存的来源,500 题的检索排序全部一致。
| 指标 | 第一轮 | 第二轮 |
|---|---|---|
| 处理题数 | 500 / 500 | 500 / 500 |
| 检索计分题数 | 470 | 470 |
| 排除的拒答题 | 30 | 30 |
| Recall@1 | 83.83% (394/470) | 83.83% (394/470) |
| Recall@3 | 91.49% (430/470) | 91.49% (430/470) |
| Recall@5 | 95.11% (447/470) | 95.11% (447/470) |
| Recall@10 | 97.66% (459/470) | 97.66% (459/470) |
| Recall@30 | 99.15% (466/470) | 99.15% (466/470) |
| Recall@50 | 99.15% (466/470) | 99.15% (466/470) |
| MRR | 0.883668 | 0.883668 |
| 平均延迟 | 509.883 ms | 679.759 ms |
| P50 | 507.697 ms | 665.454 ms |
| P90 | 663.061 ms | 931.238 ms |
| P95 | 731.766 ms | 990.375 ms |
| P99 | 888.555 ms | 1094.886 ms |
以上结果没有进行主动调优。 基准仅检索原始会话来源,不包含模型整理知识、 相关性反馈或权重更新。在实际 Agent 工作流中,模型可主动核对证据、整理知识, 并显式调整文档权重或针对具体查询提供反馈,以改善后续检索。这是由 Agent 依据证据执行的优化流程,并非每次搜索都会自动改变权重;收益取决于反馈质量, 本次基准尚未测量该收益。调优效果应使用未参与调优的题目验证,不能将测试答案 回填后再对同一批题自测。
这是本地检索成绩,不是官方榜单成绩或答案准确率。延迟反映 4 路并发负载, 不能作为受控的版本提速对比。第一轮数据 · 第二轮数据 · 复现与评分口径。
LWC Wiki
- Architecture overview · 总体架构
- Storage and data model · 存储与数据模型
- Retrieval and indexing · 检索与索引设计
- Graph projection and performance · 图投影与性能设计
- MCP, Hooks, and AgentTarget design · MCP、Hook 与 AgentTarget 设计
- Safety and trust boundaries · 安全模型与信任边界
- Maintenance and diagnostics · 维护与诊断
- Troubleshooting and FAQ · 故障排查与常见问题
- Migration and compatibility · 迁移与版本兼容
- Support and issue reporting · 获取帮助与问题反馈
- Contributing and development · 贡献与开发指南
- Testing and release process · 测试与发布流程
- Wiki style guide · Wiki 编写规范