首先要模型的tokenizer.ggml.model初始化模型的一些字段。 第一次初始化
读取模型的词汇表和相关属性,构建词汇表和bpe_ranks。加载词汇表
通过词汇表自动纠正错误的特殊词汇 矫正特殊词汇的id
构建终止字符的id列表special_eog_ids
收集特殊字符的id列表special_tokens
| Name | Name | Last commit date | ||
|---|---|---|---|---|
首先要模型的tokenizer.ggml.model初始化模型的一些字段。 第一次初始化
读取模型的词汇表和相关属性,构建词汇表和bpe_ranks。加载词汇表
通过词汇表自动纠正错误的特殊词汇 矫正特殊词汇的id
构建终止字符的id列表special_eog_ids
收集特殊字符的id列表special_tokens