Skip to content

Latest commit

 

History

2 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 

Repository files navigation

SCPO

本项目是我硕士毕业设计的部分,其最终效果是通过自我批评训练大语言,在完全使用开源数据的情况下,通过对InternLM2-7B-Base的训练,使得其zero-shot的GSM8K成绩达到了80.6%

其完整的训练过程包括两个阶段:

数据集的组建

从开源数据集中收集到的部分包括:APE-210K,Blossom_math,CMATH,GSM8K,MetaMath,Math23K,BC8K。

BC8K是由代码生成的数据集,其包含基础的一元一次方程求解和基础的数学计算,对计算内容的范围进行了限制。

偏好数据集采集

使用大语言模型在收集到的数据集中进行答案采样,对采样到的答案判断正确错误,然后组建偏好数据集。

自我批评训练

使用更改后的DPO算法训练模型。

模型 Comming Soon 代码 Comming Soon

About

SCPO make your model more relable.

Resources

Stars

0 stars

Watchers

1 watching

Forks

Releases

Packages

Contributors