腾讯混元新研究聚焦在线大模型强化学习的批大小设置:当模型自生成训练数据、rollout生成与训练缩放节奏不一致时,经典临界批大小理论需在新场景重推。研究覆盖GRPO与PPO等主流算法并给出务实结论,为大规模GPU集群下提升训练效率提供参考。