新方法LEEPS提升大模型强化学习效率
The Cryptonomist
Ai 注目
LEEPS通过改进提示采样,降低大模型强化学习中的无效计算,并在多项推理基准上取得更高成绩。
役立つ
No.ヘルプ

研究人员提出了一种名为 LEEPS 的提示采样方法,目标是降低大语言模型在强化学习训练中的无效计算。该方法主要用于带可验证奖励的强化学习流程,重点解决提示采样阶段的效率问题。基准测试显示,它在不明显拖慢训练的情况下,提高了模型在数学和通用推理任务上的表现。

无效 rollout 会消耗算力

在这类训练中,模型通常会针对同一提示生成多次 rollout,再根据奖励结果更新参数。如果这些 rollout 最终得到完全相同的奖励,这一轮训练就几乎无法提供有效学习信号,但仍会消耗算力和生成预算。

为减少这类浪费,研究人员通常会在 rollout 生成前先筛选提示。但现有方法往往面临取舍:如果过度依赖过去已经证明有效的提示,训练覆盖面会变窄;如果过度探索不确定提示,又会降低有效样本占比。

LEEPS动态分配提示预算

LEEPS 的设计思路,是在“复用已知有效提示”和“继续探索未知提示”之间动态分配资源,而不是固定采用某一种比例。它会把候选提示分成两组:一组是历史上更容易产生有效学习信号的提示,另一组是价值仍不明确的提示。

随后,系统会根据两组提示近期产生“非平凡奖励”的情况,动态调整 rollout 预算。这里的“非平凡奖励”,指的是同一提示下不同 rollout 之间存在有意义的奖励差异,这类样本更有助于训练继续学习。

两种模型规模均优于基线

在探索部分,LEEPS 还会利用潜在表示空间中的相邻提示,以及历史 rollout 结果,优先挑选更可能产生有效奖励差异的未知提示。也就是说,它不是随机探索,而是更有针对性地把算力投向更可能带来学习信号的样本。

  • 1.5B 模型相对最强基线提升 2.6%
  • 7B 模型相对最强基线提升 3.7%
  • 3 项分布外推理基准也取得最高均分

研究结果显示,LEEPS 在两种模型规模和 9 项基准测试中都优于最强基线。在 6 项数学推理基准上,Qwen2.5-Math-1.5B 和 Qwen2.5-Math-7B 都取得了最高平均分,说明这一方法的收益并不只局限于单一任务。

每步额外增加约 2 秒

从效率看,LEEPS 每个训练步骤只增加约 2 秒在线采样开销。研究还提到,采用这一方法的模型在训练过程中通常能更快达到更强表现,而不只是最终分数更高。

对于需要大规模强化学习训练的团队来说,这类改进意味着可以用较小的额外采样成本,换取更少的无效生成和更快的性能提升。在算力资源持续紧张的背景下,这类训练效率优化仍是大模型研发的重要方向。

チップ
$0
いいね
0
保存
0
閲覧数 5
CoinWorldは、読者の皆様にブロックチェーンを理性的に捉え、リスク意識を高め、各種仮想トークンの発行と投機に注意を払うようお願いします。サイト内のすべてのコンテンツは市場情報または関連する見解のみであり、いかなる形式の投資アドバイスも構成しません。機密情報を含むコンテンツを発見した場合は、“報告”,をクリックしてください。すぐに対処します。
送信
コメント 0
人気
最新
まだコメントがありません。最初のコメントを投稿しましょう!
関連
Mazama Energy融资1.35亿美元推进超热岩地热项目
Mazama Energy 完成 1.35 亿美元融资,推进超热岩地热开发,首个俄勒冈项目目标在 2030 年达到 200 兆瓦发电能力。
TechCrunch
·2026-09-18 08:15:05
3
Google DeepMind成立研究机构推动AGI讨论
Google DeepMind 推出新机构,围绕 AGI 安全、模型透明度和前沿评估机制发布首批文章。
TechCrunch
·2026-09-18 07:45:27
5
Crusoe融资39亿美元扩建AI数据中心
Crusoe完成39亿美元融资,估值升至309亿美元,将扩建数据中心并推进模块化AI算力设施。
TechCrunch
·2026-09-18 07:36:33
6
PrismML押注小型推理模型落地手机与PC
PrismML推进小型推理模型,称压缩后可在手机和 PC 端运行,并已完成 2225 万美元种子轮融资。
TechCrunch
·2026-09-18 06:45:17
14
もっと見る