Cassotis Lexicon v1.5.0
主要更新
- 扩充日常理解、回应、操作和订购场景词汇,并继续按实际使用频率划分高频与低频补充层。
- 补充计算机界面用语,以及建筑设备和常用医学用品词汇。
- 重新平衡多组常见同音词,降低生僻词、窄领域词和弱证据补充词压过日常表达的概率。
- 改进低频补充词的构建规则:低频词保持精确输入可选,但不会反过来成为同音词组的高权重排序锚点。
- 扩充简体、繁体排序回归样本,持续检查常用词的精确可见性和候选顺序。
- 重新生成简繁体主词库、单字词库和查询路径先验,为 Cassotis IME v1.5.0 的长句与短词上下文排序提供更新后的数据基础。
本地排序模型数据与短词上下文支持
Cassotis Lexicon v1.5.0 继续发布供 IME 本地候选排序使用的查询路径先验、词路径转移关系和字符 n-gram 参数:
| Version | 查询路径先验(简体 / 繁体) | 词路径转移关系(简体 / 繁体) | 字符 n-gram 参数(简体 / 繁体) |
|---|---|---|---|
v1.5.0 |
23,550 / 22,702 | 152,729 / 145,284 | 698,695 / 698,778 |
v1.4.0 |
23,544 / 22,696 | 152,729 / 145,284 | 698,695 / 698,778 |
v1.3.0 |
23,541 / 22,676 | 152,729 / 145,284 | 698,695 / 698,778 |
v1.2.0 |
23,529 / 22,663 | 152,729 / 145,284 | 698,695 / 698,778 |
v1.1.0 |
23,521 / 22,655 | 152,729 / 145,284 | 558,645 / 559,128 |
v1.0.0 |
23,518 / 22,653 | - | - |
本版查询路径先验随新增词汇和权重调整小幅刷新;词路径转移关系与字符 n-gram 参数规模保持不变。
Cassotis IME v1.5.0 新增的长句残差复核和短词两阶段上下文重排器,由 IME 项目训练、导出和部署。Lexicon 提供词库约束、查询路径先验及统计语言模型信号,但神经模型本体不计入可输入词条数量,也不会在上表中形成新的模型数据类别。
运行时相关数据和模型均在本地使用,不需要联网、GPU 或外部推理服务。完整基准测试结果见 Cassotis IME 基准测试说明。
当前规模
| Version | 主词库(简体 / 繁体) | 单字词库(简体 / 繁体) |
|---|---|---|
v1.5.0 |
187,890 / 190,972 | 23,907 / 24,167 |
v1.4.0 |
187,797 / 190,885 | 23,907 / 24,167 |
v1.3.0 |
187,726 / 190,814 | 23,907 / 24,166 |
v1.2.0 |
187,602 / 190,691 | 23,907 / 24,166 |
v1.1.0 |
187,458 / 190,552 | 23,906 / 24,166 |
v1.0.0 |
187,357 / 190,441 | 23,906 / 24,166 |
语言模型和查询路径先验独立于主词库统计,因此不计入主词库词条数量。
相关说明
- 本版本推荐搭配 cassotis-ime v1.5.0 使用。