Skip to content

v1.5.0

Latest

Choose a tag to compare

@shenmin shenmin released this 23 Jul 10:11

Cassotis IME v1.5.0

主要更新

  • 升级长句本地重排:新增独立的残差复核阶段,更稳健地修正完整长句候选。
  • 升级短词上下文排序:采用两阶段本地神经重排,在同音精确候选之间作出更符合前文的选择。
  • 改进组合用户词学习:通过全拼、简拼或混合输入分段选出的完整词组,可以被独立记住并在重启后继续使用。
  • 设置的“高级”页新增“清空用户词库”,确认后可一次清除本地用户词及相关学习记录,并立即生效。

本地候选重排

v1.5.0 继续沿用“词库约束生成候选、本地模型负责谨慎重排”的路线,并分别增强长句与短词排序。

长句路径新增独立训练的残差复核模型。它在原有统计语言模型和本地重排结果之上,对可能有益的局部修正再次评分;只有当新候选取得足够明确的分数优势时才会改变顺序,原始候选仍作为回退保留。

短词上下文排序升级为两阶段流程:第一阶段从同一拼音的竞争精确候选中选出更符合前文的结果,第二阶段再由独立的残差模型进行保守修正。没有可用前文时,这条上下文模型路径不会介入普通短词排序。

这些模型均在离线环境中训练,并导出为确定性的原生 Pascal 参数。运行时只执行本地、规模受控的计算,不需要联网、GPU、PyTorch、ONNX 或外部模型服务。

用户词学习与管理

  • 分段选择并上屏的完整组合词现在可以作为独立用户词保存,支持全拼、简拼以及两者混合输入后的再次匹配。
  • 组合用户词只记录最终词条及其拼音,不写入上下文、热度或路径学习,避免一次组合选择干扰其他候选排序。
  • 组合用户词可通过候选上的删除入口移除,也可以在设置中一次清空整个用户词库。
  • 清空操作会同步刷新正在运行的输入会话,无需手动删除数据库文件或重启 TSF。

Cassotis 长句语料基准测试-16300 测试结果

测试方法、语料来源和评分规则见:

语料:开发者自己的小说著作 《永恒的舞动》 中 16,300 条符合条件的中文句子。

Version Top1 Top2 Mean (ms) P95 (ms) Max (ms)
v1.5.0 7459/16300 (45.76%) 7966/16300 (48.87%) 63.42 203 2140
v1.4.0 7168/16300 (43.98%) 7617/16300 (46.73%) 66.23 218 2578
v1.3.0 7155/16300 (43.90%) 7601/16300 (46.63%) 64.54 203 2188

短词上下文基准测试-65000

该基准与长句基准使用同一篇小说《永恒的舞动》作为语料来源,包含 65,000 个二至四字短词的实际出现位置,并保留输入该词之前已经上屏的文本。

Contested 表示同一拼音在语料中对应至少两个目标词的歧义子集,主要衡量上下文消歧能力。

Version Top1 Top2 Contested Top1 Contested Top2 Mean (ms) P95 (ms) Max (ms)
v1.5.0 61045/65000 (93.92%) 63364/65000 (97.48%) 9159/11728 (78.10%) 10677/11728 (91.04%) 5.033 9.968 142.372
v1.4.0 60676/65000 (93.35%) 63251/65000 (97.31%) 8993/11728 (76.68%) 10602/11728 (90.40%) 5.573 11.157 158.687
v1.3.0 59078/65000 (90.89%) 62881/65000 (96.74%) 8326/11728 (70.99%) 10386/11728 (88.56%) 5.460 10.939 176.912

相关说明

开源