-
Notifications
You must be signed in to change notification settings - Fork 4
Word Graph zh CN
语言: English · 简体中文
词图用于展示一组有界 Wiki Page 与 Source 样本之间的共享词汇。如果页面 A 与页面 B 都出现了某个被选中的词,它们就会通过该词节点相连。
这是一种发现视图,不是全语料词频索引,也不是语义图。共享词只证明它在样本文本中出现,不能证明两个文档语义等价,更不能证明因果或依赖。
一次聚焦搜索找到多份文档后,可以用词图观察:
- 哪些词汇连接了当前结果集;
- 哪些 Page 与 Source 共享某个产品名或技术词;
- 下一步值得完整打开哪份文档;
- 当前样本是否形成中英文混合词汇簇。
已知准确 Page 或 Source、需要全量词频分析,或者研究代码结构时都不应使用词图,应分别使用页面/来源读取、外部分析工具或 CodeGraph。
Token 密度的增长速度远快于文档数。在真实 Wiki 中把每个词都送进浏览器,会同时放大数据库计算、响应体积、布局成本和内存占用,最终只得到无法阅读的“毛线团”。
LWC 使用“先查询、再限量”的流水线:
聚焦查询
-> FTS 选择候选文档
-> 一页文档样本
-> 有界元数据与段落取样
-> 选择共享词
-> 有界词-文档图
系统永远不会返回完整词表。翻页只会更换文档样本,不会让同一张图无限膨胀。
| 预算 | 最大值 |
|---|---|
| 可搜索查询词 | 8 |
| 每页文档样本 | 25 |
| 选中词数 | 30 |
| 每份文档的段落样本 | 4 |
| 整个样本检查的文本 | 4 MiB |
| 节点 | 200 |
| 边 | 500 |
| 分页 offset | 10,000 |
| 每份文档的元数据样本 | 16 KiB |
请求的文档数、词数或 offset 超过上限时,服务端会钳制到支持范围,并通过 truncation_reasons 报告。空查询或超过八个可搜索词的查询会被拒绝。
这些上限是正确性契约,不是界面建议。客户端不能通过请求全语料来绕过它们。
- LWC 使用与 Wiki 搜索相同的确定性规则切分聚焦查询。
- 根据 FTS 排名选择 Page 与 Source 候选,同分时按文档类型和标识符稳定排序。
- 在请求的 offset 上最多保留 25 份文档。
- 每份文档只检查有界标题、摘要和路径元数据,以及最多四个当前段落片段。
- 样本中出现的查询词优先保留。
- 其他候选词必须至少出现在两份样本文档中,再按样本文档频次、样本出现次数和词法顺序排列。
-
SAMPLE_CONTAINS边连接选中的词与样本文档,并报告样本出现次数。
在规范 Wiki 状态、查询、限制和 offset 都相同时,该过程会得到确定性结果。
启动本地只读 Viewer:
lwc --scope project view不希望自动打开浏览器时使用:
lwc --scope project view --no-open --port 0打开 词图,输入不超过八个可搜索词的聚焦查询并提交。在提交查询之前,界面不会加载图数据。
使用 上一页 和 下一页 检查另一组有界的 25 文档样本。后续页面不是一张全局图的追加部分,每一页都是独立样本窗口。
响应包含:
- 规范化后的
query_terms; - 文档节点与词节点;
- 带样本出现次数的
SAMPLE_CONTAINS边; - 表示还有下一页的
has_more; -
truncated与truncation_reasons; - 服务端实际执行的
limits; - 已检查文档、段落、字节和 token 数量的
diagnostics。
常见截断原因包括文档分页、请求上限钳制、元数据或字节预算、选词上限和边数上限。它们用于描述样本边界,不是应当被隐藏的错误。
Viewer 使用一个有界 GET 接口:
/api/graphs/words?query=projection&limit=25&term_limit=30&offset=0
该接口只读,不会启用文档图、建立 CodeGraph 索引、刷新 Source 或修改 Wiki 内容。不支持的写方法会被拒绝。
- 把可见关系提升为持久声明前,必须打开完整 Page 或 Source 核对。
- 较高样本出现次数不代表全语料词频较高。
- 某个词没有出现,可能只是落在当前文档、段落、字节、选词或边预算之外。
- CJK 与拉丁词项遵循 LWC 的确定性切分,不代表词典定义的概念。
- 只有证据证明语义关系后,才写入显式文档图关系。
一次词图调查只有满足以下条件才算完成:
- 查询聚焦且不超过八个可搜索词;
- 记录了实际执行的上限与 offset;
- 使用分页,而不是请求全语料;
- 已考虑
has_more、截断原因和诊断信息; - 重要连接已通过完整文档核对;
- 没有把样本共现误报为语义事实。
下一篇:标签与强上下文
LWC Wiki
- Home · 首页
- Project overview · 项目简介
- Basic concepts · 基本概念
- Use cases · 应用场景
- Installation and upgrades · 安装与升级
- Quick start · 快速开始
- Persistent memory · 持久记忆体系
- Agent workflow and memory policy · Agent 工作流与主动记忆策略
- Sources and ingestion · 来源与知识整合
- Wiki pages and provenance · Wiki 页面与来源证明
- Search and context · 搜索与上下文载入
- Document knowledge graph · 文档知识图(记忆图网)
- Code graph · 代码图
- Word graph · 词图
- Tags and strong context · 标签与强上下文
- Document conversion · 文档转换
-
MCP server and
lwc_explore· MCP 服务与lwc_explore - Skills, Hooks, and Instructions · Skills、Hooks 与 Instructions
- AgentTarget installation · AgentTarget 安装与集成
- Changesets · Changeset 原子变更
- Work system · Work 任务系统
- Checkpoints and rollback · Checkpoint、恢复与回滚
- Read-only Viewer · 只读可视化界面
- Architecture overview · 总体架构
- Storage and data model · 存储与数据模型
- Retrieval and indexing · 检索与索引设计
- Graph projection and performance · 图投影与性能设计
- MCP, Hooks, and AgentTarget design · MCP、Hook 与 AgentTarget 设计
- Safety and trust boundaries · 安全模型与信任边界
- Maintenance and diagnostics · 维护与诊断
- Troubleshooting and FAQ · 故障排查与常见问题
- Migration and compatibility · 迁移与版本兼容
- Support and issue reporting · 获取帮助与问题反馈
- CLI and configuration reference · CLI 与配置参考
- JSON output and error contract · JSON 输出与错误契约
- Limits and glossary · 系统限制与术语表
- Contributing and development · 贡献与开发指南
- Testing and release process · 测试与发布流程
- Wiki style guide · Wiki 编写规范