羅福莉:MiMo-V2.6的研發挑戰已經超過了我參與過的DeepSeek R1
2026-09-22 11:57:44
幣界網消息,鏈上分析師羅福莉表示,MiMo-V2.6的研發挑戰已經超過了她曾參與的DeepSeek R1。在MiMo-V2.6發布後,她進一步解釋了這輪強化學習的创新和工程挑戰。羅福莉提到,MiMo同時使用mixrl和mopd,mixrl將代碼、通用agent、視覺和網絡安全等可驗證任務混合在同一輪強化學習中訓練,而mopd則處理超長、難驗證或獎勵較主觀的任務,先單獨訓練,再整合回主模型。她指出,遊戲和3D任務的運行時間較長,且難以自動判斷對錯,因此MiMo將這類任務單獨訓練,再通過mopd整合能力。
利好 0
利空 0
來源:互聯網
本內容只為提供市場資訊,不構成投資建議。