Meta AI在9月24日发布论文MaD-RL,关注大模型强化学习中的一个不太显眼却很实际的问题:训练通常只奖励单次输出是否得高分,模型可能逐渐把概率集中到一种解法或一种表达上。对于数学题,收敛到高成功率答案或许有利;但在合成数据、策略探索和需要满足群体分布约束的任务里,输出过度单一会丢掉可用选项。
研究团队提出Distribution Matching框架,不只最大化平均奖励,而是让模型输出中某个潜在类别属性的分布接近预先设定的目标。所谓“目标分布”可以是不同解题策略、代码结构或其他可判定类别的比例。论文在数学推理和编程实验中展示方法效果,但这仍是研究结果,不代表所有通用模型已经自动解决模式坍缩,也不等于可以用一套比例控制所有开放式文本。
GRPO可能把概率推向单一模式,调温度并不总能解决
大模型后训练常用可验证奖励:答案正确得分,错误不得分,再用强化学习提高高分输出的概率。GRPO等方法会比较同一问题的一组候选输出,然后强化相对表现更好的样本。机制简单有效,但当多种答案同样正确时,训练可能偏爱最先占优的一种模式,逐步削弱其他可行路径。
论文把这种现象描述为输出分布的集中。提高采样温度能够增加Token层面的随机性,熵正则也能阻止概率过快变尖,却不保证模型在语义类别上达到需要的比例。文字表面变化很多,底层策略仍可能相同;反过来,强行追求均匀也未必符合业务目标。某些任务需要70%的保守策略和30%的探索策略,而不是每类都一样多。
MaD-RL把目标转成分布距离问题。研究者先定义一个能给输出分类的潜在属性,再比较模型当前分布与目标分布,利用差异构造奖励。论文讨论L2、KL和Jensen-Shannon等不同散度,每种度量对稀有类别、零概率和偏离程度的敏感性不同。方法的价值不在某个公式本身,而在于训练目标从“这一次答得好不好”扩展为“许多次回答组合起来是否符合要求”。
这也带来新的依赖:类别必须能被可靠识别。若分类器把不同策略误判为同一类,或目标属性本身带有偏见,分布匹配只会把错误规范得更稳定。数学和编程任务容易借助验证器与结构规则;开放对话、创意写作和社会属性则更难获得清晰、无争议的标签。
分布可控不等于内容公平,目标由谁设定仍是核心问题
论文提到合成数据和公平约束等应用。模型为下游训练生成数据时,如果大量样本重复同一模板,数据规模再大也难覆盖真实变化;分布匹配可以强制保留多种类型。但“多样”只是统计属性,不自动保证事实正确、代表性充分或没有有害内容。质量门槛与分布门槛必须同时存在。
在公平相关场景中,风险更高。设定不同群体的输出比例可能有助于纠正明显失衡,也可能把复杂社会问题简化成僵硬配额。目标比例应来自具体政策、数据和利益相关者讨论,而不是由训练工程师随手指定。模型还可能学会迎合分类器,在表面上满足比例、实质上继续复制偏见。
对开发者而言,MaD-RL更适合被看作一种训练工具,而非即插即用的产品功能。使用前需要明确属性、目标分布、分类准确率和失败成本;训练后还要在未见任务上验证,确认模型没有以降低正确率换取比例。论文展示的数学与编程实验提供了可行性证据,跨领域泛化仍需更多独立复现。
这项研究也提醒行业重新审视“最佳答案”的定义。许多评测只算最高分或平均正确率,无法发现模型是否只会一种套路。当AI用于方案生成、科研假设和代码候选时,用户真正需要的可能是一组彼此不同、都达到质量标准的选择。评测因此应同时记录成功率、分布覆盖、重复度与校准误差。
强化学习后训练正在从单一奖励走向多目标约束。正确、安全、成本和多样性可能互相拉扯,任何一个指标被极端优化都可能伤害其他方面。MaD-RL给出的贡献,是把语义层面的分布明确写入优化目标,并比较不同距离度量的效果。它没有消除“谁来定义理想分布”的治理问题,却让这个问题从训练后的抱怨变成训练前必须写清楚的参数。
现阶段最谨慎的判断是:Meta研究团队证明了在若干可验证任务中,强化学习可以直接匹配目标输出分布,并指出常见GRPO训练可能压缩多样性。方法是否能在更大模型、复杂开放任务和长期训练中稳定工作,还需要后续实验;但它已经为“模型不仅要答对,还要保留合理选择空间”提供了一条可测试的技术路径。












