Verl训练SFT和RL小结

☀️天气
🤩
(有点好)

SFT&RL训练小结

SFT和RL训练数据

能相同吗?

不行。一般是先让模型SFT一批数据得到中间模型,然后利用这个模型再RL再新用一批数据。这是因为SFT已经在这些数据集上训练过,RL再训练的话实际上增加的是记忆,而不是真正的学习。这个概念很通俗易懂,一开始真没想到,想着省事直接训就完了。

数据规模

一般而言,SFT的数据量要非常多,RL为SFT的30%左右,因为SFT需要大量数据学习在这个领域的基础能力,RL是精调,而且受限于资源,一般RL的数据质量要高一点。