it之家 7 月 13 日消息,麻省理工學院(mit)團隊提出一種基於視覺的深度學習方法,僅需單個攝像頭即可讓軟體機械人和仿生機械人學習運動與控制。
該技術突破有望大幅降低機械人開發成本,相關成果已於 6 月 25 日發表於《自然》主刊(it之家附 doi: 10.1038/s41586-025-09170-0)。
傳統工業機械人雖易於建模控制,但剛性結構難以適應狹小或不平坦地形。軟體及仿生機械人雖具備環境適應優勢,卻通常依賴大量傳感器和定製化空間模型。
現在,mit 團隊通過深度學習技術解決了這一矛盾。新系統僅需通過單個攝像頭捕捉機械人運動畫面,結合名為「神經雅可比場(njf)」的技術,使機械人通過視覺反饋建立對自身形態與運動能力的認知。
研究團隊對多種機械人進行了 2-3 小時多視角隨機運動視頻訓練,成功讓神經網絡通過單幀圖像重建機械人三維形態與運動範圍。
在氣動軟體機械手、奧利格羅機械手(16 自由度)、3d 打印機械臂及低成本 poppy 機械臂等測試中,系統實現:
- 關節運動誤差小於 3 度
- 指尖控制誤差小於 4 毫米
- 可自適應環境動態變化
mit 助理教授文森特・西茨曼(vincent sitzmann)表示:「視覺作為彈性傳感器,為農場、工地等非結構化環境中的機械人應用開啟新可能。」
csail 主任丹妮拉・羅斯(daniela rus)補充道:「視覺反饋使系統建立自身運動動力學內部模型,在傳統定位方法失效處實現自監督操作。」