强化学习越练答案越单一?Meta新研究尝试让模型“按目标比例”保留多样性
CoinMeta
Ai 注目
Meta AI在9月24日发布论文MaD-RL,关注大模型强化学习中的一个不太显眼却很实际的问题:训练通常只奖励单次输出是否得高分,模型可能逐渐把概率集中到一种解法或一种表达上。对于数学题,收敛到高成功率答案或许有利;但在合成数据、策略探索和需要满足群体分布约束的任务里,输出过度单一会丢掉可用选项。
役立つ
No.ヘルプ

Meta AI在9月24日发布论文MaD-RL,关注大模型强化学习中的一个不太显眼却很实际的问题:训练通常只奖励单次输出是否得高分,模型可能逐渐把概率集中到一种解法或一种表达上。对于数学题,收敛到高成功率答案或许有利;但在合成数据、策略探索和需要满足群体分布约束的任务里,输出过度单一会丢掉可用选项。

研究团队提出Distribution Matching框架,不只最大化平均奖励,而是让模型输出中某个潜在类别属性的分布接近预先设定的目标。所谓“目标分布”可以是不同解题策略、代码结构或其他可判定类别的比例。论文在数学推理和编程实验中展示方法效果,但这仍是研究结果,不代表所有通用模型已经自动解决模式坍缩,也不等于可以用一套比例控制所有开放式文本。

GRPO可能把概率推向单一模式,调温度并不总能解决

大模型后训练常用可验证奖励:答案正确得分,错误不得分,再用强化学习提高高分输出的概率。GRPO等方法会比较同一问题的一组候选输出,然后强化相对表现更好的样本。机制简单有效,但当多种答案同样正确时,训练可能偏爱最先占优的一种模式,逐步削弱其他可行路径。

论文把这种现象描述为输出分布的集中。提高采样温度能够增加Token层面的随机性,熵正则也能阻止概率过快变尖,却不保证模型在语义类别上达到需要的比例。文字表面变化很多,底层策略仍可能相同;反过来,强行追求均匀也未必符合业务目标。某些任务需要70%的保守策略和30%的探索策略,而不是每类都一样多。

MaD-RL把目标转成分布距离问题。研究者先定义一个能给输出分类的潜在属性,再比较模型当前分布与目标分布,利用差异构造奖励。论文讨论L2、KL和Jensen-Shannon等不同散度,每种度量对稀有类别、零概率和偏离程度的敏感性不同。方法的价值不在某个公式本身,而在于训练目标从“这一次答得好不好”扩展为“许多次回答组合起来是否符合要求”。

这也带来新的依赖:类别必须能被可靠识别。若分类器把不同策略误判为同一类,或目标属性本身带有偏见,分布匹配只会把错误规范得更稳定。数学和编程任务容易借助验证器与结构规则;开放对话、创意写作和社会属性则更难获得清晰、无争议的标签。

分布可控不等于内容公平,目标由谁设定仍是核心问题

论文提到合成数据和公平约束等应用。模型为下游训练生成数据时,如果大量样本重复同一模板,数据规模再大也难覆盖真实变化;分布匹配可以强制保留多种类型。但“多样”只是统计属性,不自动保证事实正确、代表性充分或没有有害内容。质量门槛与分布门槛必须同时存在。

在公平相关场景中,风险更高。设定不同群体的输出比例可能有助于纠正明显失衡,也可能把复杂社会问题简化成僵硬配额。目标比例应来自具体政策、数据和利益相关者讨论,而不是由训练工程师随手指定。模型还可能学会迎合分类器,在表面上满足比例、实质上继续复制偏见。

对开发者而言,MaD-RL更适合被看作一种训练工具,而非即插即用的产品功能。使用前需要明确属性、目标分布、分类准确率和失败成本;训练后还要在未见任务上验证,确认模型没有以降低正确率换取比例。论文展示的数学与编程实验提供了可行性证据,跨领域泛化仍需更多独立复现。

这项研究也提醒行业重新审视“最佳答案”的定义。许多评测只算最高分或平均正确率,无法发现模型是否只会一种套路。当AI用于方案生成、科研假设和代码候选时,用户真正需要的可能是一组彼此不同、都达到质量标准的选择。评测因此应同时记录成功率、分布覆盖、重复度与校准误差。

强化学习后训练正在从单一奖励走向多目标约束。正确、安全、成本和多样性可能互相拉扯,任何一个指标被极端优化都可能伤害其他方面。MaD-RL给出的贡献,是把语义层面的分布明确写入优化目标,并比较不同距离度量的效果。它没有消除“谁来定义理想分布”的治理问题,却让这个问题从训练后的抱怨变成训练前必须写清楚的参数。

现阶段最谨慎的判断是:Meta研究团队证明了在若干可验证任务中,强化学习可以直接匹配目标输出分布,并指出常见GRPO训练可能压缩多样性。方法是否能在更大模型、复杂开放任务和长期训练中稳定工作,还需要后续实验;但它已经为“模型不仅要答对,还要保留合理选择空间”提供了一条可测试的技术路径。

チップ
$0
いいね
0
保存
0
閲覧数 22
CoinWorldは、読者の皆様にブロックチェーンを理性的に捉え、リスク意識を高め、各種仮想トークンの発行と投機に注意を払うようお願いします。サイト内のすべてのコンテンツは市場情報または関連する見解のみであり、いかなる形式の投資アドバイスも構成しません。機密情報を含むコンテンツを発見した場合は、“報告”,をクリックしてください。すぐに対処します。
送信
コメント 0
人気
最新
まだコメントがありません。最初のコメントを投稿しましょう!
関連
比特币徘徊8.4万美元,ETF流入未改震荡
比特币在 8.4 万美元附近整理,ETF 连续净流入、巨鲸增持和交易所流出同步出现,但买盘强度仍待进一步确认。
crypto.news
·2026-09-25 15:15:24
1
Animoca总裁谈港元稳定币:先做合规链上通道
Animoca 高管称,港元稳定币目标是成为受监管的链上通道,而非复制美元稳定币模式。
Fortune
·2026-09-25 15:15:24
1
Quant获美国清算机构合作后QNT升破90美元
The Clearing House 选择 Quant 参与美国代币化存款网络后,QNT 一度上涨近 30%,升破 90 美元。
Coinpedia
·2026-09-25 15:15:24
1
KelpDAO就rsETH被盗起诉LayerZero及其CEO
KelpDAO 关联方就 2.92 亿美元 rsETH 跨链桥被盗事件起诉 LayerZero 及其 CEO。
Coinpedia
·2026-09-25 14:55:13
5
外媒:Cardano反弹后能否重返前十
外媒称,ADA近期随市场回升,文章关注其能否在年内重返加密市值前十。
Watcher.Guru
·2026-09-25 14:55:13
5
もっと見る