减少token消耗神器实测效果:修复 session-query 中文检索(unicode61 缺陷)+ 记忆优化插件集(Phase 0/1/2,已真机验证) #3206
QIANLING-0831
started this conversation in
Show Your Plugins!
Replies: 1 comment
|
独立实测确认(node v24.19.0 + 内置
与你帖子表格完全一致—— 一个补充边界(README 的已知限制我在实测里也钉住了):2 字 CJK 查询在两条词法臂上都拿不到结果——
原因是 trigram 索引至少需要 3 个连续字符(FTS5 固有限制),而 另外确认 |
0 replies
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
Uh oh!
There was an error while loading. Please reload this page.
unicode61tokenizer 对中文基本不可用dsh-session-query-sqlite使用 FTS5unicode61tokenizer,对 CJK 文本不切词:连续汉字被索引为单个 token,中文全文检索实际不可用。实测(node:sqlite + FTS5):
索引优化减少Token消耗的句子,查询Token消耗"索引优化"(整句短语)dsh-plugin话题,47 个单测)仓库:https://github.com/QIANLING-0831/dsh-memory
dsh-session-query-sqlite-cjkdsh-tool-result-dedupdsh-memory-indexctx.memorySearch:sqlite-vec 向量臂 + FTS5 词法臂 → RRF 融合;事件级增量嵌入;file 词条标签 + 过滤dsh-memory-toolmemory_search工具:会话旧内容混合召回,输出严格有界(limit × maxChars)dsh-compaction-locatorBasicCompactionEngine的summarize()钩子,每个<compacted-summary>追加 Exact Sources 定位符(spill 路径/文件/seq 区间)dsh-memory-corememory_remember工具dsh-memory-bundledsh.bundle.patch),自动禁用 base 的 session-query/compaction 行设计文档:
docs/MEMORY-OPTIMIZATION-PROPOSAL.md(三层记忆数据库 + 词条索引 + 增量参数)dsh --profile headless,独立测试 profile)memory_remember写入:返回「已记住 (uuid)」;memory_search混合召回:中文查询命中 3 条真实会话记录(CJK provider + RRF 生效);All reactions