研究人员提出了一种名为 LEEPS 的提示采样方法,目标是降低大语言模型在强化学习训练中的无效计算。该方法主要用于带可验证奖励的强化学习流程,重点解决提示采样阶段的效率问题。基准测试显示,它在不明显拖慢训练的情况下,提高了模型在数学和通用推理任务上的表现。
无效 rollout 会消耗算力
在这类训练中,模型通常会针对同一提示生成多次 rollout,再根据奖励结果更新参数。如果这些 rollout 最终得到完全相同的奖励,这一轮训练就几乎无法提供有效学习信号,但仍会消耗算力和生成预算。
为减少这类浪费,研究人员通常会在 rollout 生成前先筛选提示。但现有方法往往面临取舍:如果过度依赖过去已经证明有效的提示,训练覆盖面会变窄;如果过度探索不确定提示,又会降低有效样本占比。
LEEPS动态分配提示预算

LEEPS 的设计思路,是在“复用已知有效提示”和“继续探索未知提示”之间动态分配资源,而不是固定采用某一种比例。它会把候选提示分成两组:一组是历史上更容易产生有效学习信号的提示,另一组是价值仍不明确的提示。
随后,系统会根据两组提示近期产生“非平凡奖励”的情况,动态调整 rollout 预算。这里的“非平凡奖励”,指的是同一提示下不同 rollout 之间存在有意义的奖励差异,这类样本更有助于训练继续学习。
两种模型规模均优于基线
在探索部分,LEEPS 还会利用潜在表示空间中的相邻提示,以及历史 rollout 结果,优先挑选更可能产生有效奖励差异的未知提示。也就是说,它不是随机探索,而是更有针对性地把算力投向更可能带来学习信号的样本。
- 1.5B 模型相对最强基线提升 2.6%
- 7B 模型相对最强基线提升 3.7%
- 3 项分布外推理基准也取得最高均分
研究结果显示,LEEPS 在两种模型规模和 9 项基准测试中都优于最强基线。在 6 项数学推理基准上,Qwen2.5-Math-1.5B 和 Qwen2.5-Math-7B 都取得了最高平均分,说明这一方法的收益并不只局限于单一任务。
每步额外增加约 2 秒
从效率看,LEEPS 每个训练步骤只增加约 2 秒在线采样开销。研究还提到,采用这一方法的模型在训练过程中通常能更快达到更强表现,而不只是最终分数更高。
对于需要大规模强化学习训练的团队来说,这类改进意味着可以用较小的额外采样成本,换取更少的无效生成和更快的性能提升。在算力资源持续紧张的背景下,这类训练效率优化仍是大模型研发的重要方向。










