每日小记

记录生活中的点点滴滴

2026/08/06 (1 条小记)

Verl代码阅读:PPO与GRPO的差异

🌤️ 天气
😊
(一般)

# Verl代码阅读:PPO与GRPO的差异


PPO和GRPO都是在SFT微调后让模型能够有更好回答的方式,差异在于“如何计算这次回答好不好”,GRPO其实是一种变种的PPO算法,去掉了PPO的critic模型,让训练更稳定和资源消耗更少。


clip:限制模型单步别跑太远


KL:限制被训练模型与参考模型别太远 太远就惩罚


SFT的交叉熵:有正确答案 模型调整输出分布到正确答案即可


PPO、GRPO的clip损失:没有正确答案 在探索中小心翼翼地探索


## SFT交叉熵的工作机制


SFT中有标准答案,模型只会预测在这个位置上出现这个token的概率,没出现tokenB,那就狠狠地惩罚你,就算tokenB在语义上是对的。一句话SFT就是给答案,背答案,模型输出与结果越接近越好。但是在通常训练中,我们一般不会去过于要求与答案的相似度,这会导致过拟合。


## PPO clip loss的工作机制


PPO中引入了一个比率$r=\frac{\pi_{new}}{\pi{old}}$,用于衡量每一次新策略相对于旧策略的变化。如果$r>1$说明策略好,希望提升这个动作的概率,但是不能提升太多。因为强化学习中认为就算某一个策略得到的奖励低,但是它还是有价值的,不能一次性变化太快。

2025-11-03 (1 条小记)

不知道说什么

☁️ 天气
🙁
(有点差)

论文焦头烂额,周末又熬了两天夜,啥也没干。。


有点烦躁是真的,我还是需要一个健康的作息来保证脑力的在线,长时间的工作感觉不太适合我。。


刚洗完澡,想了很多心情有点糟,早点睡觉吧,睡一觉起来也许会有一个好心情。


感觉研究生就是半个社会人的这句话含金量还在上升,可能工作以后就是这么忙吧,心情没时间收拾下一个任务就来了,上一个任务可能做的还不够好。


好怀念本科时候的无忧无虑,怀念和吊毛他们一块玩抽象,可能人越长大越会烦躁吧。。

2025-11-02 (3 条小记)

又来实验室加班了

☁️ 天气
😊
(一般)

又来实验室加班了,继续搞论文今天把第二章搞完就回去

又熬夜了,下次不能这么整了。。

☁️ 天气
😕
(一般)

又熬夜了,下次不能这么整了。。

论文v1被喷

🌧️ 天气
😭
(一般)

做的第一篇论文被喷了。。。还是得用心一点啊 图画的也不好 架构也不对 不能什么事情都依赖学长。