当前维护重点 #1055
amzxyz
announced in
Announcements
当前维护重点
#1055
Replies: 1 comment
|
其实我一直在做的工作是通过模型的泛化,把日常那些最占地方的弯弯绕的语句剥离出来,进入模型,让词库减负 这两个词条是特定学科词汇,但区分这些又非常难,而且它主要是长度短,藏在词库中不显得突兀。有一种不使用,也不知道的感觉。而医学化学这些词条特征性非常强,使用者就会思考是不是我需要的,因此把他分开了,确实不想启用的可以不启用,以达到内心的“纯净” 由于模型的存在众多的2+2组合被我们放进了模型,腾出更大的篇幅服务于千行百业、基础学科,因此在视觉比重上可能相比别的词库感觉到生僻一些,这个可以理解为重心转移,但绝不是丢失 |
0 replies
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
Uh oh!
There was an error while loading. Please reload this page.
Uh oh!
There was an error while loading. Please reload this page.
✔配置与数据架构趋于稳定
✔lua插件基本稳定流畅,无必要不再新增
✔维护版本: 基础版,增强版,Pure版
✔模型400M泛化版,趋于稳定
进行中: 词库典型类型归类化,主要原因不是用户侧,而是很容易造成我们不认识的优质词条丢失,所以归类化后,进行一些批量数据操作的时候就轻松一些。主要目标是清理词库使各类学科维持最优分词结构,避免长词低频占地,当小结构纳入词库后长结构将交给模型参与,最终形成优质化广泛化的词库数据维护目标进一步缩减
All reactions