Back
从策略梯度、轨迹级 KL 正则化和状态级局部策略改进入手,推导 RL 中 reward-tilted Gibbs 分布与 Boltzmann teacher。
rl
kl
强化学习
llm
策略梯度
ppo
grpo
把自回归语言模型写成有限时域决策过程,并推导 SFT 目标在外部数据分布上的前向 KL 分解、最优解和 logits 梯度。
sft
形式化建模