練武術、跑馬拉松……目前,人形機器人的進化速度讓人驚嘆。大家不禁好奇,人形機器人技術發展的進度條究竟跑到了什麼階段?什麼時候能夠走進家門,真正幫我們幹活呢?近日,宇樹科技的一份上市招股書,從一個側面折射出行業的發展現狀:技術路線尚未突破;除特定場景外,通用機器人的消費級市場尚未形成剛需。那麼,為什麼一談到場景落地,便挑戰重重呢?
機器人是如何學會各種本領的?在機器人訓練學校,會進行各類任務的數據採集,就像是給機器人寫一本教科書,教會它們去行為和決策。

穿上機器人的模仿學習設備,控制這個機器人手部一模一樣的夾爪,我們就可以完成整套涮火鍋的人類示範教學。看起來簡單的動作,但其實位置、角度、力度甚至彎腰屈膝的弧度都得精準拿捏。而訓練有素的數采員,順利完成了一系列涮火鍋的採集動作。一條條反反覆復模擬涮火鍋過程的視頻被錄製出來,一共匯總了共計八個小時的有效數據。工程師將採集過來的真機數據投餵給機器人基座大模型後,機器人就初步具備了行為的執行能力,通過這些精準的數據訓練,很快機器人就上手了。

經過了一個禮拜的數據的訓練,機器人開始展示涮火鍋的技能。前兩次抓取沒有抓上,終於在第三次嘗試成功。
整個過程可以看到,機器人在操作的過程當中不斷地試錯、調整策略,並進行優化,這就是業內叫作「VLA」的一種多模態具身智能模型。它以視覺觀測和自然語言指令為輸入,融合感知信息,直接生成控制機器人的動作,通俗地說,就是機器人的「大腦模型」。但機器人走向真實世界的道路上,失敗和不完美其實是常態。
機器人走向真實世界
面臨「數據匱乏」
在人工智慧領域,有一個被自動駕駛和大模型反覆驗證的規律,叫作Scaling Law,也就是規模法則。它說的是,當模型的規模、算力和數據量在持續增長時,系統能力往往也會隨之提升。因此,行業普遍認為,對於尚處萌芽階段的具身智能技術來說,稀缺的是真實世界的操作數據。機器人想要走入真實世界完成任務,如何突破數據的「規模法則」?
記者在調研中發現,「百萬小時」這個數字被從業者反覆提及。大家普遍認為,具身智能行業的「ChatGPT時刻」,至少需要百萬小時的數據積累才能誕生。但現實是,即便目前行業內的頭部玩家,他們手裡真正有價值的數據量,也還差著一個數量級。
記者來到深圳南山區的一個機器人數據學習研發團隊,他們正在用視頻數據進行機器人的訓練。

能夠將視頻數據精準地轉換成為機器人的訓練數據,依靠的是一套智能演算法。它可以讓我們脫掉以往的動捕服,僅靠一個視頻,就能將人類動作映射到機器人或者機械臂上,將二維的視頻演算法升維轉化為包含了機器臂、末端軌跡、物體軌跡、物體的幾何模型等十幾種模態的數據集,用於機器人的訓練。團隊還開發出了頭戴式的攝像頭,可以在人們幹活的同時,為機器人錄製訓練數據。

樞途科技創始人 卓羽:目前我們已經採集了過萬小時的視頻,我們能夠加工上百萬條的數據,同時我們的場景其實也非常多樣,能讓這些原本一個人工作的視頻,似乎沒有什麼價值的視頻,變成真正有價值的、能夠為機器人訓練去提供認知的具身數據。

為了讓這個世界更加可感可知,全行業的數據採集技術也在加速迭代。比如我旁邊這個看起來像爪子的設備,它有一個英文名字叫UMI,是一種攜帶型、可移動的數據採集裝備,可以讓數據採集輕鬆地走出實驗室,走進真實的物理世界。
你可以把UMI簡單理解為一套由手持夾爪和攝像頭組成的數據採集方案。有了它,你不需要再費勁地控制機器人了,而是可以在真實的環境里幫助機器人去學會各種動作。

上海交通大學人工智慧學院副院長 穹徹智能創始人 盧策吾:任何人工智慧,通用人工智慧都是群眾采數據,不是少數人采。比如說多模態大模型,是互聯網上群眾幫忙生成數據。無人車,大家開車就幫你記錄數據。群眾來幫你采數據的根本核心,是不能影響群眾的生活,這樣才能可能規模化。
我們所處的真實世界千變萬化,環境和任務也千差萬別。目前具身智能數據的積累僅僅只有兩三年的時間,遠遠無法讓行業實現真正的質變。在調研中我們看到,行業正在加速構建機器人數據的金字塔。在數據維度不斷拓展、採集方式持續迭代、成本逐步降低,甚至走向大眾化採集的過程中,機器人正在一步步為實現自己的「ChatGPT時刻」做著準備。
機器人在特定場景積累幹活經驗
數據匱乏是機器人走向通用場景的一大制約,而在某個領域勤學苦練,成為專業選手,則是大多數機器人團隊目前重點的努力方向。在一些真實的場景中,我們可以看到,機器人邊學邊干,已經開始上崗了。它們已經在哪些場景落地?又是怎麼邊學邊乾的?
在深圳,近期,機器人已經開始與保潔阿姨一起走進家庭,進行清潔服務。它們的主要訓練任務是在客廳和餐廳內,配合阿姨進行雜物整理和垃圾收集。
自變數機器人科技(深圳)有限公司工程師 胡博文:比如瓶瓶罐罐、紙團,它會清理到垃圾桶裡面。機器人在家庭裡面不斷地去做任務,它也會通過這些任務來訓練自己,通過實踐,使它的模型更加優化,演算法也會更加的強大,就會把任務做得越來越好。
而超市分揀機器人則需要熟悉超市的物品擺放位置,錄入產品信息,同時還要不斷訓練抓取技巧。

零次方機器人演算法負責人 盤國萍:我們首先有一個預訓練模型,這個模型,在對應的一些貨物上所需要的時間,可能就只需要半個小時去采二十來條數據。
記者:經常說具身智能真正落地還有5到10年,你們怎麼看?

零次方機器人品牌負責人 楊威:我們說通用智能,希望一個機器人跟我們人一樣,有多維的表現能力,可能需要5到10年。但是對於蓬勃發展,尤其是商業落地場景有更多突破,能夠實現商業化落地的閉環,我們預判就是在未來1年到2年,會有一些非常先鋒的落地案例。
技術路線多樣
具身智能行業標準尚未統一
記者在調研中發現,儘管具身智能行業正在飛速發展,但依然需要不斷的技術沉澱。從研發側來說,技術路線尚未統一;從應用端來說,應用場景剛需仍在摸索。那麼,專家們如何看待目前具身智能的發展階段?具身智能機器人又該如何更好地沉澱,行穩致遠呢?
記者來到北京智源研究院,在這裡,能看到十多種由不同團隊研發的各類機器人數據採集設備。為什麼把它們都集中到這裡呢?
北京智源人工智慧研究院院長 王仲遠:具身智能的數據集格式不統一、不標準化,於是大家各搞各的。那麼在這個過程中,其實就很難實現真正有效的高質量數據集的累積。高質量的數據不夠,又會導致模型的能力沒辦法實現真正意義上的躍升。所以只有當數據集標準化了,那麼這種高質量的數據集才能真正地去為行業里所有的構型的機器人的具身智能模型來提升它的能力。

專家介紹,目前,機器人本體形態各異,就連靈巧手也有兩指、三指、五指的不同。這就導致了不同本體採集的數據,無法共享互通。即便很多廠家選擇將自己的數據集開源,也很難做到在其他機器人本體上復現。同時機器人「大腦」技術方案尚未定型,解決方案仍在不斷迭代。我們可以看到,一些團隊機器人的動作在強化學習演算法和本體能力的加持下,已經非常可靠,但是依然無法在實際場景落地幹活和穩定應用。

復旦大學未來信息創新學院教授 陳濤:目前我認為還處在GPT1第一代爆發前的時刻。因為現在具身智能的路線還沒有完全收斂。每一個教授他都有自己的技術信仰,但是也正是因為這種發散,所以這個領域才讓我們更值得去投入,才更有它的魅力所在。
挑戰雖然存在,但行業也在匯聚越來越多的從業者和開發者。在行業發展方面,相關部委牽頭,我國已陸續開始推出人形機器人與具身智能標準體系。在具身智能技術路線尚未成熟的當下,為我們的發展指明了一條逐漸清晰的發展道路。

工信部人形機器人與具身智能標委會副主任委員 江磊:我覺得我們今年發的52項標準,我給它比喻,只能發一個茅草棚,也許到明年有幾百項標準,慢慢地把這個茅草棚變成一個房子,未來變成一個別墅,那這個行業就健壯了。

經過調研我們發現,2026年,機器人將會越來越多地走上場景落地之路。儘管今天我們看到了很多炫酷的展示,但實際的應用,依然是一個充滿困難與挑戰的過程。問題邊出現邊解決,技術邊研發、邊迭代、邊測試、邊應用。我們依然無法準確預判具身機器人技術爆發的奇點在哪裡,但是在全行業的共同努力探索下,走著走著,也許答案自然就會浮現。
來源:央視新聞客戶端