Replies: 2 comments
|
遇到和你同样的问题。 请问你最后怎么解决的? |
0 replies
|
目前没解决,按官方的教程训练loss完全不收敛。文本准备的格式与Qwen-ASR预测的输出格式一致。太奇怪了。
|
0 replies
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
Uh oh!
There was an error while loading. Please reload this page.
#1 数据集文本准备:
方法1:例如标注格式为"language Thai<asr_text>ในเชียงใหม่นะครับเพราะว่าเชียงใหม่ก็มีตลาดเยอะ",如果这样去lora训练,推理时会在文本结果中高频插入"<asr_text>",例如"language Thai<asr_text>ในเชีย<asr_text>งใหม่นะค<asr_text>รับ<asr_text><asr_text>เพราะว่าเชียงใหม่ก็มีตล<asr_text>าดเยอะ<asr_text>";且loss收敛在80左右,不再下降。
方法2:例如标注格式为"language Thai<asr_text>ในเชี ยงใหม่นะค รับเพร าะว่าเชีย งใหม่ก็ มีตลาดเยอะ",采用分词的方式去准备数据集,训练的loss收敛在40左右,推理结果依然会高频插入"<asr_text>"。
方法3:例如标注格式为"ในเชี ยงใหม่นะค รับเพร าะว่าเชีย งใหม่ก็ มีตลาดเยอะ",把""language Thai<asr_text>"在文本中删除,loss收敛在8左右,且推理正常,不会乱码。但wer很高,远高于开源模型的wer;
问题是:使用原生开源模型进行推理,推理结果是正常的,例如"language Thai<asr_text>ในเชียง ใหม่นะครับเพราะว่ าเชียงใหม่ก็มีตลาดเยอะ",且_泰语文本中间偶尔有空格_。如果我微调的时候采用与开源模型推理结果一样的文本格式,模型不收敛,训练会失败。
请问泰语文本该如何去正确准备,比如分词?不分词?或者qwen-asr原始训练的怎么处理的?又或者泰语不能单独训练,比如与其他语种一起?
All reactions