小米開源機器人AI模型,以10萬小時真實世界數據訓練

台灣產經新聞網/台灣產經新聞網 新聞中心
8 分鐘前

【新聞中心/綜合外電】小米 於8月5日正式發布 Xiaomi-Robotics-1 的完整開源套件。這是一個視覺、語言、動作基礎模型,以超過10萬小時的真實世界操作數據訓練而成,是目前規模最大的機器人AI系統之一,現已向研究人員及開發者免費開放。

從研究論文走向開放生態,具身AI競爭進入資料規模化階段

完整開放訓練與部署流程

小米正式將具身人工智慧基座模型 Xiaomi-Robotics-1(XR-1)開源,釋出內容不僅包括模型權重與程式碼,也涵蓋真實機器人後訓練、模型部署及相關Benchmark評測程式。小米技術官方表示,此次開源希望讓研究機構與開發者能夠「從真機後訓練到模型部署」完整使用這套流程,降低具身AI研究對大型硬體與資料基礎設施的依賴。

小米在7月發表的研究論文中指出,XR-1是一款視覺—語言—動作(Vision-Language-Action,VLA)模型,目標是讓機器人理解自然語言指令,並在陌生環境與未見過的物體條件下,直接執行移動與操作任務。論文團隊表示,模型的核心價值不只在於完成既定工作,更在於透過少量示範資料,快速適應新的機器人任務。

超過10萬小時真實資料

XR-1的訓練採取「大規模預訓練、跨本體後訓練」兩階段架構。小米先利用Universal Manipulation Interface(UMI)裝置蒐集超過10萬小時的真實世界操作軌跡,資料涵蓋家庭、商業空間、工業場域及戶外環境,涉及超過1,700種情境。相較於只使用特定機器人蒐集資料,UMI可讓模型從不同物體、環境及人類操作方式中學習,提升資料的廣度與可轉移性。

由於人工標註10萬小時影像成本極高,小米建立視覺語言模型自動標註流程,將長時間操作軌跡切分成短片段,再以語言描述場景、物體及夾爪狀態的變化,藉此把原始操作資料轉化為「視覺、語言目標與動作」相互對應的訓練樣本。研究團隊表示,實驗顯示預訓練資料量與模型規模增加時,動作預測誤差持續下降,尚未出現明顯的效能飽和。

跨機器人訓練提升泛化能力

完成預訓練後,XR-1再使用超過1萬小時的跨本體機器人資料進行後訓練,其中包括超過7,200小時、在真實家庭環境蒐集的自有機器人資料,讓模型學習如何將抽象的操作能力轉換至不同機器人本體,並理解人類慣用的命令方式。

在真實機器人測試中,XR-1針對手機收納、印表機補充、衣物裝載及箱子整理等任務進行微調。當每項任務使用不到10小時的示範資料時,整體成功率達75%,高於基準模型π0.5的40%;當示範資料增加至不到40小時,成功率進一步升至85%。這意味著大規模預訓練可能降低機器人學習新技能所需的資料成本。

改變具身AI開發模式

在模擬測試方面,XR-1在RoboCasa、RoboCasa365、VLABench及RoboDojo四項基準評測中均取得領先成績。其中,RoboCasa365平均成功率達57.4%,RoboDojo平均分數為20.07、平均成功率為13.93%,均優於先前最佳方法。研究團隊據此主張,無需依賴單一機器人本體的大規模操作資料,也能建立可跨任務、跨環境及跨機器人轉移的基礎能力。

對產業而言,XR-1開源的意義在於競爭焦點可能從單一機器人產品,逐步轉向資料規模、模型泛化能力及開發工具鏈。小米此次同步釋出GitHub程式庫與Hugging Face模型資源,若能吸引研究機構共同改進,將有機會加快具身AI從論文驗證走向實體部署。不過,模型在不同機器人硬體、感測器配置及安全規範下的穩定性,仍須透過更多公開測試確認。


*圖片為 AI生成示意圖。圖文歡迎轉載引用,請標註來源