在12 月 17 日開幕的2025小米人車家全生態合作夥伴大會上,備受矚目的小米大模型團隊迎來了新任掌門人的首次公開亮相。作為xiaomi mimo大模型負責人,羅福莉並沒有選擇常規的客套寒暄,而是直接拋出了一枚技術重磅炸彈——正式發布最新一代moe(混合專家)大模型mimo-v2-flash。對於這一里程碑式的發布,相關負責人將其定義為小米在通往人工通用智能(agi)宏偉藍圖中的關鍵第二步,標誌著小米在頂級模型研發領域已從跟隨邁向了引領。

在隨後的技術深度解析環節,有關方面披露了mimo-v2-flash背後的硬核架構細節,展現了小米團隊在平衡模型性能與算力效率上的獨特思考。據悉,該模型並未盲目堆砌參數,而是採用了一種名為hybrid swa的混合架構。這種設計被業內評價為極具極簡主義美學,既摒棄了繁複的冗餘結構,又在長文本推理能力上實現了對傳統線性注意力變體的顯著超越。

特別值得關注的是,技術團隊在研發過程中發現了一個頗為反直覺的現象:窗口大小並非越大越好。經過反覆驗證,128被確定為最佳的窗口大小設定,一旦超過這個閾值,模型的綜合性能反而會出現下滑。這一發現不僅為行業提供了新的調優思路,配合固定的kv緩存設計,更是極大地提升了新模型與現有計算基礎設施的兼容性,為大規模快速部署掃清了障礙。
除了架構層面的革新,羅福莉還著重介紹了多標記預測(mtp)技術的應用。這項技術被視為此次性能飛躍的另一大引擎,特別是在強化學習(rl)的高效化方面效果卓著。有別於傳統模型逐個預測下一個token的低效模式,mtp技術允許模型在預測時看得更遠。數據表明,即便僅在第一層之外進行少量的微調,mtp也能幫助模型獲得極高的接受長度。

在具體的編程任務測試中,三層mtp架構的表現尤為搶眼,不僅實現了大於3的接受長度,更將推理速度提升了約2.5倍。這一改進直擊當前ai訓練的痛點,有效解決了在小批量on-policy強化學習過程中常見的gpu空轉問題,讓昂貴的算力資源得到了最大化利用。
在後訓練階段,小米團隊展現了極強的技術整合能力。據透露,團隊採納了thinking machine提出的on-policy distillation(在線策略蒸餾)方案,旨在將多個強化學習模型的優勢進行深度融合。這一策略的效果立竿見影:小米成功在傳統的監督微調(sft)和強化學習流程中,以僅僅相當於教師模型五十分之一的計算量,達到了同等水平的性能表現。這種四兩撥千斤的方法,展示了學生模型在不斷迭代中具備的驚人進化潛力,最終形成了一個自我增強、自我完善的良性閉環。

回顧整個研發歷程,相關負責人感慨團隊展現出的非凡戰力。從理論構想到轉化為可上線運行的生產級系統,小米ai團隊僅用了短短几個月時間。這種高效與創造力,不僅是小米技術實力的體現,更為其在激烈的人車家全生態競爭中構築了堅實的護城河。