Cassotis IME v1.5.0
主要更新
- 升级长句本地重排:新增独立的残差复核阶段,更稳健地修正完整长句候选。
- 升级短词上下文排序:采用两阶段本地神经重排,在同音精确候选之间作出更符合前文的选择。
- 改进组合用户词学习:通过全拼、简拼或混合输入分段选出的完整词组,可以被独立记住并在重启后继续使用。
- 设置的“高级”页新增“清空用户词库”,确认后可一次清除本地用户词及相关学习记录,并立即生效。
本地候选重排
v1.5.0 继续沿用“词库约束生成候选、本地模型负责谨慎重排”的路线,并分别增强长句与短词排序。
长句路径新增独立训练的残差复核模型。它在原有统计语言模型和本地重排结果之上,对可能有益的局部修正再次评分;只有当新候选取得足够明确的分数优势时才会改变顺序,原始候选仍作为回退保留。
短词上下文排序升级为两阶段流程:第一阶段从同一拼音的竞争精确候选中选出更符合前文的结果,第二阶段再由独立的残差模型进行保守修正。没有可用前文时,这条上下文模型路径不会介入普通短词排序。
这些模型均在离线环境中训练,并导出为确定性的原生 Pascal 参数。运行时只执行本地、规模受控的计算,不需要联网、GPU、PyTorch、ONNX 或外部模型服务。
用户词学习与管理
- 分段选择并上屏的完整组合词现在可以作为独立用户词保存,支持全拼、简拼以及两者混合输入后的再次匹配。
- 组合用户词只记录最终词条及其拼音,不写入上下文、热度或路径学习,避免一次组合选择干扰其他候选排序。
- 组合用户词可通过候选上的删除入口移除,也可以在设置中一次清空整个用户词库。
- 清空操作会同步刷新正在运行的输入会话,无需手动删除数据库文件或重启 TSF。
Cassotis 长句语料基准测试-16300 测试结果
测试方法、语料来源和评分规则见:
语料:开发者自己的小说著作 《永恒的舞动》 中 16,300 条符合条件的中文句子。
| Version | Top1 | Top2 | Mean (ms) | P95 (ms) | Max (ms) |
|---|---|---|---|---|---|
v1.5.0 |
7459/16300 (45.76%) | 7966/16300 (48.87%) | 63.42 | 203 | 2140 |
v1.4.0 |
7168/16300 (43.98%) | 7617/16300 (46.73%) | 66.23 | 218 | 2578 |
v1.3.0 |
7155/16300 (43.90%) | 7601/16300 (46.63%) | 64.54 | 203 | 2188 |
短词上下文基准测试-65000
该基准与长句基准使用同一篇小说《永恒的舞动》作为语料来源,包含 65,000 个二至四字短词的实际出现位置,并保留输入该词之前已经上屏的文本。
Contested 表示同一拼音在语料中对应至少两个目标词的歧义子集,主要衡量上下文消歧能力。
| Version | Top1 | Top2 | Contested Top1 | Contested Top2 | Mean (ms) | P95 (ms) | Max (ms) |
|---|---|---|---|---|---|---|---|
v1.5.0 |
61045/65000 (93.92%) | 63364/65000 (97.48%) | 9159/11728 (78.10%) | 10677/11728 (91.04%) | 5.033 | 9.968 | 142.372 |
v1.4.0 |
60676/65000 (93.35%) | 63251/65000 (97.31%) | 8993/11728 (76.68%) | 10602/11728 (90.40%) | 5.573 | 11.157 | 158.687 |
v1.3.0 |
59078/65000 (90.89%) | 62881/65000 (96.74%) | 8326/11728 (70.99%) | 10386/11728 (88.56%) | 5.460 | 10.939 | 176.912 |
相关说明
- 推荐配合 cassotis-lexicon v1.5.0 使用。
开源
- Source: https://github.com/shenmin/cassotis-ime
- 词库: https://github.com/shenmin/cassotis-lexicon
- 官网: https://www.cassotis.org 或 https://www.yanquan.org
- Assets 中包含 Windows 安装包