Skip to content

v1.5.0

Latest

Choose a tag to compare

@shenmin shenmin released this 23 Jul 10:19

Cassotis Lexicon v1.5.0

主要更新

  • 扩充日常理解、回应、操作和订购场景词汇,并继续按实际使用频率划分高频与低频补充层。
  • 补充计算机界面用语,以及建筑设备和常用医学用品词汇。
  • 重新平衡多组常见同音词,降低生僻词、窄领域词和弱证据补充词压过日常表达的概率。
  • 改进低频补充词的构建规则:低频词保持精确输入可选,但不会反过来成为同音词组的高权重排序锚点。
  • 扩充简体、繁体排序回归样本,持续检查常用词的精确可见性和候选顺序。
  • 重新生成简繁体主词库、单字词库和查询路径先验,为 Cassotis IME v1.5.0 的长句与短词上下文排序提供更新后的数据基础。

本地排序模型数据与短词上下文支持

Cassotis Lexicon v1.5.0 继续发布供 IME 本地候选排序使用的查询路径先验、词路径转移关系和字符 n-gram 参数:

Version 查询路径先验(简体 / 繁体) 词路径转移关系(简体 / 繁体) 字符 n-gram 参数(简体 / 繁体)
v1.5.0 23,550 / 22,702 152,729 / 145,284 698,695 / 698,778
v1.4.0 23,544 / 22,696 152,729 / 145,284 698,695 / 698,778
v1.3.0 23,541 / 22,676 152,729 / 145,284 698,695 / 698,778
v1.2.0 23,529 / 22,663 152,729 / 145,284 698,695 / 698,778
v1.1.0 23,521 / 22,655 152,729 / 145,284 558,645 / 559,128
v1.0.0 23,518 / 22,653 - -

本版查询路径先验随新增词汇和权重调整小幅刷新;词路径转移关系与字符 n-gram 参数规模保持不变。

Cassotis IME v1.5.0 新增的长句残差复核和短词两阶段上下文重排器,由 IME 项目训练、导出和部署。Lexicon 提供词库约束、查询路径先验及统计语言模型信号,但神经模型本体不计入可输入词条数量,也不会在上表中形成新的模型数据类别。

运行时相关数据和模型均在本地使用,不需要联网、GPU 或外部推理服务。完整基准测试结果见 Cassotis IME 基准测试说明

当前规模

Version 主词库(简体 / 繁体) 单字词库(简体 / 繁体)
v1.5.0 187,890 / 190,972 23,907 / 24,167
v1.4.0 187,797 / 190,885 23,907 / 24,167
v1.3.0 187,726 / 190,814 23,907 / 24,166
v1.2.0 187,602 / 190,691 23,907 / 24,166
v1.1.0 187,458 / 190,552 23,906 / 24,166
v1.0.0 187,357 / 190,441 23,906 / 24,166

语言模型和查询路径先验独立于主词库统计,因此不计入主词库词条数量。

相关说明

开源