小米周三(30日)宣布開源其首個專為推理而生的大模型「XiaomiMiMo」。此模型透過連動預訓練和後訓練,全面提升了推理能力。根據「小米大模型」公眾號訊息,MiMo在數學推理(AIME24-25)和程式碼競賽(LiveCodeBenchv5)公開測評集上,憑藉僅7B的參數規模,超越了OpenAI的閉源推理模型o1-mini以及阿里Qwen更大規模的開源推理模型QwQ-32B-Preview。在強化學習(RL)方面,MiMo-7B的潛力也顯著超越了經典的開源32B模型。隨著DeepSeek-R1的推出,業界掀起了強化學習的共創潮流,DeepSeek-R1-Distill-7B和Qwen2.5-32B成為廣泛使用的起步模式。在相同的RL訓練資料條件下,MiMo-7B在數學和程式碼領域的強化學習能力表現特別突出。MiMo的推理能力提升得益於預訓練和後訓練階段的多層面創新。在預訓練階段,模型透過挖掘豐富的推理語料,合成了約200Btokens的推理數據,並進行了三階段訓練,以逐步提升訓練難度,總訓練量達到25Ttokens。在後訓練階段,MiMo採用了高效穩定的強化學習演算法和框架,提出了「TestDifficultyDrivenReward」來緩解獎勵稀疏的問題,並引入「EasyDataRe-Sampling」策略以穩定RL訓練。同時,設計了SeamlessRollout系統,讓RL訓練加速2.29倍,驗證加速1.96倍。所有技術細節已在技術報告中公開,用戶可以透過以下連結獲取更多資訊:MiMo-7B技術報告。此外,MiMo-7B全系列模型已開源至HuggingFace平台,用戶可存取:HuggingFace-小米MiMo進行下載。小米表示,MiMo計畫是由新成立的「小米大模型Core團隊」進行的初步嘗試。儘管2025年似乎是大模型發展的後半程,但小米相信AGI的旅程依然漫長,團隊將繼續從務實創新出發,勇敢探索未知,致力於突破智慧的邊界,回應每一次好奇。