知情人士透露,特斯拉已經改變了其擎天柱人形機器人的訓練策略,未來或將主要依靠視頻訓練,而不是僅依靠動作捕捉和遙控操作。這一人事變動發生在擎天柱項目主管米蘭·科瓦奇卸任後不久。知情人士透露,人工智慧主管阿肖克·埃盧斯瓦米已接任該項目負責人。特斯拉長期以來一直使用類似的方法來訓練其自動駕駛軟體,這一技術路線轉變體現了埃隆·馬斯克使用機器視覺+人工智慧路線的堅持,也反映了該公司對自動駕駛技術的態度。
該汽車製造商的內部人士在6月底告訴員工,將更加註重optimus項目的願景導向,但此前特斯拉正在利用一份陳舊的技術藍圖來訓練其人形機器人,例如特斯拉此前曾使用動作捕捉服和虛擬現實設備來記錄人類操作員的數據並遠程操作機器人,這引發外界對於其技術前沿性的質疑。如今,這家汽車製造商計劃專註於錄製工人執行任務的視頻,並以此教會機器人如何快速執行諸如拾取物體或摺疊t恤之類的操作。據內部人士透露,該公司表示,放棄動作捕捉服和遠程操作將使團隊能夠更快地擴大數據收集規模。

▍新技術路線的可能性
目前消息人士稱,尚不清楚特斯拉未來是否會再次優先考慮動作捕捉服和遠程操作,或者是否會利用視頻數據來鞏固之前收集的信息。因為遠程操作和動作捕捉是行業內訓練機器人的標準做法。例如,領先的機器人公司波士頓動力公司就已利用遠程操作技術訓練其atlas機器人。在訓練過程中,執行各種任務的工人會穿著動作捕捉服;然後將數據輸入機器人。此外,還可以穿著動作捕捉服來遠程控制機器人。有業內人士表示,大量的遠程操作數據可以讓機器人通過與環境進行物理交互來學習,但教會機器人將視頻數據轉化為現實世界的內容可能很困難。
今年5月,特斯拉發布了一段視頻,optimus硬體部門主管konstantinos laskaris在linkedin帖子中已經承認了這一新策略的應用潛力。「這聽起來難以置信,但我們的機器人確實直接從人類視頻中學習新任務!」laskaris當時寫道。馬斯克還在五月份表示,該機器人最終將能夠通過觀看youtube視頻來學習如何執行任務。
據知情人士透露,在過渡期間,特斯拉曾短暫暫停了optimus團隊的招聘,過去一年中,有超過50人在不同時期擔任過該職位。截至8月底,特斯拉的招聘頁面上列出了最新50多個與optimus相關的職位,但排除了動作捕捉數據收集員的招聘項目。去年,該公司招聘「數據收集員」。這些職位負責執行和記錄基本的家務,招聘信息顯示,這些人員需要長時間穿著動作捕捉服和佩戴虛擬現實耳機,這項工作可能需要通過穿著動作捕捉服執行簡單任務來收集數據,這些數據可以被記錄下來並由數據注釋者進行分析,以訓練人工智慧系統,以及直接遠程操作人形機器人。視頻片段顯示,一名操作員身穿動作捕捉服,戴著觸覺手套和 vr 耳機拾取物體,而模擬環境下的特斯拉擎天柱機器人則執行相同的動作。

截至6月底,該項目仍在進行遠程操作optimus,並通過動作捕捉服對其進行訓練。內部人士表示,自培訓輪班以來,工人們一直專註於使用內部製造的五台攝像頭記錄自己的動作。這些攝像頭安裝在工人佩戴的頭盔和沉重的背包上,攝像頭指向各個方向,為人工智慧模型提供數據,使其能夠精確地適應周圍環境。有專家介紹,不同的攝像角度可能讓特斯拉的工程師藉此能夠收集更多細微的細節,「比如關節和手指的位置」,並將機器人正確地放置在空間中。
消息人士稱,工作人員花費了大量時間排除動作捕捉服和optimus的問題,這限制了團隊能夠收集的數據量,例如工廠動作的訓練,可能需要數十萬小時到數百萬小時的數據才能基本實現,這意味著需要收集的數據量成本達到五億美元,而且不確定能否成功。因此他們正在試圖尋找新的方法,目前使用的視頻,可能是他們之前通過遠程操作收集的數據的一種補充和擴列的舉措,也可能成為未來optimus人形機器人訓練的常態。
▍合成數據或成為新方法
謝菲爾德大學機器人專家喬納森·艾特肯(jonathan aitken)接受外媒採訪時表示,特斯拉可能在尋找一個更加通用的方法,來訓練擎天柱以適用於各種任務動作。因為隨著數據規模和任務規模提升,動作所消耗的時長,將會成為大多人形機器人公司無法接受的問題。工人們會收到關於如何執行培訓任務的具體指導,尤其是在手部動作方面,並確保動作儘可能像人類一樣。一位知情人士表示,他們可能要花幾個月的時間來完成同一項簡單的任務。
他補充說,這也使得特斯拉或許未來會採用與physical intelligence類似的策略。該公司為機器人提供大量演示數據,以便它們能夠學習可轉移的技能並靈活應用,而不僅僅是記住如何執行單一任務。
馬斯克在一月份的財報電話會議上承認這一問題,「擎天柱人形機器人的訓練需求最終可能至少是汽車所需訓練需求的10倍。」這意味著對於特斯拉來說,訓練optimus將是一個比開發自動駕駛汽車更艱巨的項目。
新方法與特斯拉自動駕駛軟體的訓練流程相一致。雖然其他自動駕駛汽車公司大多使用激光雷達和雷達感測器來訓練他們的自動駕駛軟體,但特斯拉主要依靠機器視覺從數百萬車主收集的數據中快速訓練。此前特斯拉就展示了他們利用亞洲公開的街道視頻訓練了其人工智慧系統。

但也有專家指出,因為人形機器人的訓練難度無疑更大,因為行走只是其中一項任務,人形機器人還需要通過視頻學習理解這些事情,然後掌握完成任務的技能,有些東西可以通過觀看來學習,而有些東西則需要通過實際練習,無論是在模擬器中還是在現實世界中。
如果特斯拉只是使用視頻數據,而捨棄直接獲得真實數據,很難彌補虛擬到現實的鴻溝。雖然摺疊t恤和撿拾物品這類交互成本低的任務或許能通過視頻學習完成,但是更多真實任務卻很難完美達成。這使得波士頓動力以及部分中國公司採用的視頻數據與真實數據的混合應用策略或許依然是更遠的未來。