Skip to content

Word Graph zh CN

JanYork edited this page Aug 14, 2026 · 1 revision

词图

语言: English · 简体中文

词图用于展示一组有界 Wiki Page 与 Source 样本之间的共享词汇。如果页面 A 与页面 B 都出现了某个被选中的词,它们就会通过该词节点相连。

这是一种发现视图,不是全语料词频索引,也不是语义图。共享词只证明它在样本文本中出现,不能证明两个文档语义等价,更不能证明因果或依赖。

什么时候使用

一次聚焦搜索找到多份文档后,可以用词图观察:

  • 哪些词汇连接了当前结果集;
  • 哪些 Page 与 Source 共享某个产品名或技术词;
  • 下一步值得完整打开哪份文档;
  • 当前样本是否形成中英文混合词汇簇。

已知准确 Page 或 Source、需要全量词频分析,或者研究代码结构时都不应使用词图,应分别使用页面/来源读取、外部分析工具或 CodeGraph。

为什么绝不一次加载所有词

Token 密度的增长速度远快于文档数。在真实 Wiki 中把每个词都送进浏览器,会同时放大数据库计算、响应体积、布局成本和内存占用,最终只得到无法阅读的“毛线团”。

LWC 使用“先查询、再限量”的流水线:

聚焦查询
    -> FTS 选择候选文档
    -> 一页文档样本
    -> 有界元数据与段落取样
    -> 选择共享词
    -> 有界词-文档图

系统永远不会返回完整词表。翻页只会更换文档样本,不会让同一张图无限膨胀。

服务端硬预算

预算 最大值
可搜索查询词 8
每页文档样本 25
选中词数 30
每份文档的段落样本 4
整个样本检查的文本 4 MiB
节点 200
500
分页 offset 10,000
每份文档的元数据样本 16 KiB

请求的文档数、词数或 offset 超过上限时,服务端会钳制到支持范围,并通过 truncation_reasons 报告。空查询或超过八个可搜索词的查询会被拒绝。

这些上限是正确性契约,不是界面建议。客户端不能通过请求全语料来绕过它们。

样本怎样生成

  1. LWC 使用与 Wiki 搜索相同的确定性规则切分聚焦查询。
  2. 根据 FTS 排名选择 Page 与 Source 候选,同分时按文档类型和标识符稳定排序。
  3. 在请求的 offset 上最多保留 25 份文档。
  4. 每份文档只检查有界标题、摘要和路径元数据,以及最多四个当前段落片段。
  5. 样本中出现的查询词优先保留。
  6. 其他候选词必须至少出现在两份样本文档中,再按样本文档频次、样本出现次数和词法顺序排列。
  7. SAMPLE_CONTAINS 边连接选中的词与样本文档,并报告样本出现次数。

在规范 Wiki 状态、查询、限制和 offset 都相同时,该过程会得到确定性结果。

在 Viewer 中使用

启动本地只读 Viewer:

lwc --scope project view

不希望自动打开浏览器时使用:

lwc --scope project view --no-open --port 0

打开 词图,输入不超过八个可搜索词的聚焦查询并提交。在提交查询之前,界面不会加载图数据。

使用 上一页下一页 检查另一组有界的 25 文档样本。后续页面不是一张全局图的追加部分,每一页都是独立样本窗口。

如实读取响应

响应包含:

  • 规范化后的 query_terms
  • 文档节点与词节点;
  • 带样本出现次数的 SAMPLE_CONTAINS 边;
  • 表示还有下一页的 has_more
  • truncatedtruncation_reasons
  • 服务端实际执行的 limits
  • 已检查文档、段落、字节和 token 数量的 diagnostics

常见截断原因包括文档分页、请求上限钳制、元数据或字节预算、选词上限和边数上限。它们用于描述样本边界,不是应当被隐藏的错误。

只读 API

Viewer 使用一个有界 GET 接口:

/api/graphs/words?query=projection&limit=25&term_limit=30&offset=0

该接口只读,不会启用文档图、建立 CodeGraph 索引、刷新 Source 或修改 Wiki 内容。不支持的写方法会被拒绝。

解读规则

  • 把可见关系提升为持久声明前,必须打开完整 Page 或 Source 核对。
  • 较高样本出现次数不代表全语料词频较高。
  • 某个词没有出现,可能只是落在当前文档、段落、字节、选词或边预算之外。
  • CJK 与拉丁词项遵循 LWC 的确定性切分,不代表词典定义的概念。
  • 只有证据证明语义关系后,才写入显式文档图关系。

完成证据

一次词图调查只有满足以下条件才算完成:

  • 查询聚焦且不超过八个可搜索词;
  • 记录了实际执行的上限与 offset;
  • 使用分页,而不是请求全语料;
  • 已考虑 has_more、截断原因和诊断信息;
  • 重要连接已通过完整文档核对;
  • 没有把样本共现误报为语义事实。

下一篇:标签与强上下文

LWC Wiki

English · 简体中文


Start here · 开始使用

Core capabilities · 核心能力

Practical guides · 实战指南

Capability configuration · 能力配置

Technical design · 技术设计

Operations · 运行与维护

Reference · 参考资料

Contributing · 参与贡献


Repository · Releases

Clone this wiki locally