罗福莉:MiMo-V2.6的研发挑战已超过我参与过的DeepSeek R1
2026-09-22 11:57:44
币界网消息,链上分析师罗福莉表示,MiMo-V2.6的研发挑战已超过她参与过的DeepSeek R1。在MiMo-V2.6发布后,她进一步解释了这轮强化学习的创新和工程挑战。罗福莉提到,MiMo同时使用mixrl和mopd,mixrl将代码、通用agent、视觉和网络安全等可验证任务混合在同一轮强化学习中训练,而mopd则处理超长、难验证或奖励较主观的任务,先单独训练,再整合回主模型。她指出,游戏和3D任务的运行时间较长,且难以自动判断对错,因此MiMo将这类任务单独训练,再通过mopd整合能力。
来源:互联网
本内容只为提供市场信息,不构成投资建议。
关注HKWDB官方账号,及时关注最新动态









