本项目是我硕士毕业设计的部分,其最终效果是通过自我批评训练大语言,在完全使用开源数据的情况下,通过对InternLM2-7B-Base的训练,使得其zero-shot的GSM8K成绩达到了80.6%
其完整的训练过程包括两个阶段:
从开源数据集中收集到的部分包括:APE-210K,Blossom_math,CMATH,GSM8K,MetaMath,Math23K,BC8K。
BC8K是由代码生成的数据集,其包含基础的一元一次方程求解和基础的数学计算,对计算内容的范围进行了限制。
使用大语言模型在收集到的数据集中进行答案采样,对采样到的答案判断正确错误,然后组建偏好数据集。
使用更改后的DPO算法训练模型。
模型 Comming Soon 代码 Comming Soon