Skip to content

Retrieval Benchmark zh CN

JanYork edited this page Sep 13, 2026 · 3 revisions

LongMemEval-S 检索结果(v0.18.5)

语言: English · 简体中文

这是未调优的检索基线,而不是 LWC 在持续使用中的效果上限。 实际使用时,模型可以主动评估证据,也可以响应用户纠正和相关性反馈,持续更新文档权重与查询反馈。因此,在反馈可靠、持续执行调优的情况下,实际检索效果有望优于这里的静态基线;本次未量化这部分增益。“被动调整”指响应反馈后由 Agent 执行更新,并非每次查询都会在后台自动学习。

2026 年 9 月 13 日,在 Apple M5 Pro Mac 上以 4 路并发完成两轮本地评测, 均处理 500/500 题,其中 470 题计入检索指标,使用固定版本 LongMemEval-S 数据集。第二轮复用第一轮保存的来源,500 题的检索排序全部一致。

指标 第一轮 第二轮
处理题数 500 / 500 500 / 500
检索计分题数 470 470
排除的拒答题 30 30
Recall@1 83.83% (394/470) 83.83% (394/470)
Recall@3 91.49% (430/470) 91.49% (430/470)
Recall@5 95.11% (447/470) 95.11% (447/470)
Recall@10 97.66% (459/470) 97.66% (459/470)
Recall@30 99.15% (466/470) 99.15% (466/470)
Recall@50 99.15% (466/470) 99.15% (466/470)
MRR 0.883668 0.883668
平均延迟 509.883 ms 679.759 ms
P50 507.697 ms 665.454 ms
P90 663.061 ms 931.238 ms
P95 731.766 ms 990.375 ms
P99 888.555 ms 1094.886 ms

以上结果没有进行主动调优。 基准仅检索原始会话来源,不包含模型整理知识、 相关性反馈或权重更新。在实际 Agent 工作流中,模型可主动核对证据、整理知识, 并显式调整文档权重或针对具体查询提供反馈,以改善后续检索。这是由 Agent 依据证据执行的优化流程,并非每次搜索都会自动改变权重;收益取决于反馈质量, 本次基准尚未测量该收益。调优效果应使用未参与调优的题目验证,不能将测试答案 回填后再对同一批题自测。

这是本地检索成绩,不是官方榜单成绩或答案准确率。延迟反映 4 路并发负载, 不能作为受控的版本提速对比。第一轮数据 · 第二轮数据 · 复现与评分口径。

LWC Wiki

English · 简体中文


Start here · 开始使用

Core capabilities · 核心能力

Practical guides · 实战指南

Capability configuration · 能力配置

Technical design · 技术设计

Operations · 运行与维护

Reference · 参考资料

Contributing · 参与贡献


Repository · Releases

Clone this wiki locally