首页 > 3D标签腾讯混元把经典临界批大小理论搬进大模型强化学习,PPO生成吞吐最高拉到2.29倍、GRPO省下29%训练时间 相关文章
腾讯混元把经典临界批大小理论搬进大模型强化学习,PPO生成吞吐最高拉到2.29倍、GRPO省下29%训练时间

腾讯混元把经典临界批大小理论搬进大模型强化学习,PPO生成吞吐最高拉到2.29倍、GRPO省下29%训练时间

腾讯混元新研究聚焦在线大模型强化学习的批大小设置:当模型自生成训练数据、rollout生成与训练缩放节奏不一致时,经典临界批大小理论需在新场景重推。研究覆盖GRPO与PPO等主流算法并给出务实结论,为大规模GPU集群下提升训练效率提供参考。