「AI的下一個競爭維度:從模型比拼,轉向世界理解能力建設。
我們正站在AI發展的又一臨界點上。
從ChatGPT到DeepSeek,從Sora到Cursor,多模態與大模型一路狂飆,不斷刷新我們對「智能」的認知上限。但一個更現實的問題也日益顯現——當AI面對的不再只是「文字、圖像與代碼」,而是現實世界中柔軟的手指、易碎的玻璃杯、擁擠的十字路口,它是否依然能從容應對?
越來越多的技術先鋒意識到,人工智能若不能理解並適應真實物理世界,其潛力將永遠被鎖在「模擬宇宙」里。
於是,一個新的概念開始浮現:「物理AI(Physical AI)」——一種具身、可感知、能推理、會行動的智能體形態,它不再只是數據上的算力堆疊,而是能走入現實世界,與真實物理環境交互的智能生命。
這一次,NVIDIA再次站了出來。
在SIGGRAPH 2025上,加速計算領域的全球領導者沒有再談算力峰值,而是拋出了一個更宏大的願景:構建支撐物理AI的全棧平台,用Omniverse塑造可信的世界模型,用Cosmos賦予AI推理認知能力,用DGX Cloud和Blackwell GPU打通訓練到部署的鏈路。一套專為「AI+現實世界」設計的技術體系,正悄然成形。
物理AI的時代,正在拉開帷幕。而它的第一幕,始於一個問題:AI,能不能看懂這個世界?
現實之問:
AI很強,但離「現實」還很遠
當我們談論AI的突破時,往往沉醉於技術指標:更高的參數量、更低的Loss、更強的推理鏈路。生成式AI在文本、圖像、語音等領域早已大放異彩,從一張圖生成無限空間、從一段話編織完整敘事,彷彿無所不能。
但一旦AI走出「模型」的舒適區,面對物理世界的複雜性,則又產生了新的問題。
1、多模態AI狂飆,但仍困於「紙上談兵」
AI能寫會畫,卻抓不準一個杯子。
這是物理AI領域最常被引用的真實難題。一個帶有輕微裂紋、光線反射變化的玻璃杯,足以讓機械人「手足無措」。在自動駕駛中,即使模型已訓練上千萬小時,但當暴雨傾盆、強光干擾、孩子突然衝出馬路,AI的識別與反應依然不穩定。
為什麼?因為它們「看不懂」現實世界。
今天的AI依賴的是二維圖像、靜態標註和抽象語義,它理解的是「物」,而不是「物理」:它不知道一塊瓷磚在潮濕狀態下會滑,也不懂高舉手臂的人是在打招呼還是要揮拳。這種脫離物理常識的「智能」,本質上是一種「符號理解」,而非具身認知。
我們一度以為,算力提升和模型堆疊可以解決一切。但現實世界的複雜性遠超想像——它是連續的、多變的、不可預測的。如果AI無法理解這些物理規律與變化邏輯,就很難真正落地於「世界」本身。
2、智能體應用爆發,產業卻卡在三大瓶頸
2025年,被譽為「智能體元年」。無數新創業項目圍繞AI Agent展開:從智能助手、AI外呼系統,到大模型驅動的機械人、自動化工廠、AI倉儲系統。
但當這些智能體真正被拉入「現實場景」,問題接踵而至。
瓶頸一:訓練數據難拿→模型泛化能力差
AI要想具身,首先要「看」世界。但現實數據昂貴、採集難度大、質量不一致(尤其在物理交互場景下,如抓握、避障、操作等)。模型往往只在「數據里強」,一旦環境稍有變化就「不會做題」。
瓶頸二:虛擬仿真不真實→模型遷移性能差
雖然工業界普遍採用仿真系統訓練AI,但傳統仿真環境缺乏真實性,材質、光影、碰撞反饋等不夠真實,導致「Sim2Real」性能驟降。
瓶頸三:複雜任務推理弱→智能體「聽不懂,還不會做」
具身智能不僅要識別,還要規划動作、拆解任務、應對變化。在複雜任務(如搬運多件物體、應對突髮狀況)中,當前的AI Agent仍缺乏真正的推理與自適應能力。
從人形機械人到自動化工廠,從智慧城市到無人駕駛,真正的AI落地不再只是「模型能力」,還是「世界理解能力」——感知物理環境、理解語境變化、做出合適反應。
產業需要的不再只是一個更大的語言模型,還是一個具身、具感知、具推理能力的「物理智能體」。
而這,正是NVIDIA試圖解答的問題。
NVIDIA開了一味「葯」,
讓AI理解並重構真實世界
面對AI落地的「物理現實壁壘」,NVIDIA並沒有試圖用更大的模型去強攻短板,而是換了一種思路:
如果AI無法理解世界,不如先幫它建一個世界;
如果AI不會行動,不如先賦予它具身能力;
如果數據不夠,不如讓AI自己生成數據,再進行推理和決策。
這背後,是一套覆蓋從環境構建、認知生成、推理預測到訓練部署的完整技術體系。它不是單一產品的升級,而是一種底層邏輯的革新:AI不只是大腦,還需要身體、環境和世界模型。
而NVIDIA,正在用三個關鍵系統組件,回應這套邏輯:
1、 Omniverse:為AI搭建「可信的訓練世界」
AI要真正理解世界,首先要在可信的、近似真實的環境中進行訓練與測試。這正是NVIDIA Omniverse的使命——一個用於構建虛擬物理環境的工業級平台。
在最新版本中,Omniverse支持3D Gaussian Splatting技術,僅通過視頻就能實現高精度三維場景重建,從而大幅降低訓練數據採集與建模的門檻。
更重要的是,Omniverse不再是孤島式仿真工具,它打通了主流機械人訓練標準(如MJCF與OpenUSD),並與NVIDIA Isaac Sim和Isaac Lab實現深度聯動,使工業級仿真與強化學習成為一體化流程。
換句話說:Omniverse讓AI不只在紙面上「學技能」,而是在擬真的數字世界中完成全流程訓練。
目前,Amazon與Hexagon已率先在使用Omniverse流式化工業數字孿生與物理AI場景仿真,面向感知、機械人與自動系統的開發。
2、Cosmos:賦予AI「世界認知」與「推理思維」
如果說Omniverse是訓練場,那NVIDIA Cosmos就是AI的「大腦結構」。
Cosmos是一個多模態世界模型系統,由NVIDIA新發佈的三大模塊組成:
·Cosmos Transfer:自動生成覆蓋多場景、多模態的合成數據,讓AI不再依賴昂貴的「實拍數據」,實現訓練數據「自給自足」。
·Cosmos Reason:基於VLM(視覺語言模型)進化形態,具備更強的推理能力,能將複雜任務拆解為結構化步驟,並結合物理常識做判斷。
·Cosmos Predict:從靜態理解進化為動態預測,可推演未來狀態場景,適用於自動駕駛、城市安防等時空複雜領域。
目前,Uber等行業先驅正在使用Cosmos系列世界模型進行任務推理和合成數據生成,提升物理智能體系統在真實環境中的泛化能力。
通過Cosmos,AI不再只是「回答問題的語言專家」,還是一個能感知現實、理解目標、預測後果、規劃路徑的行動體。
3、DGX Cloud + Blackwell GPU:統一訓練、仿真與部署的AI基座
訓練再強,也要部署落地;仿真再真,也要上陣實戰。
這正是NVIDIA用於「打通閉環」的底座——NVIDIA DGX Cloud+新一代Blackwell GPU架構。它不僅是算力的升級,更是物理智能體訓練、推理、部署的一站式平台。該系統支持從雲端訓練到邊緣端部署全流程遷移,適配工業機械人、智能攝像頭、無人車等異構設備。
通過NVIDIA NIM,企業可一鍵部署模型,僅需幾個API調用就能接入自家業務系統,加速AI Agent落地。
這意味着企業不再需要搭建繁瑣的AI基礎設施,而是「開箱即用」,從仿真、訓練到部署,全流程由NVIDIA打包完成。
在生成式AI大潮中,安利中國算是比較早一批完成AI基礎設施從通用計算向智能計算躍遷的企業之一。其核心選型,正是依託於NVIDIA DGX Cloud與NIM框架構建的智能體服務平台。根據文章披露,安利中國通過NVIDIA NIM框架優化模型推理效率,配合混合雲資源調度,在內部辦公與Copilot應用中效率提升顯著,模型推理效率提升約40%,員工辦公效率提升達50%。
總體來看,Omniverse提供訓練環境,Cosmos提供世界理解能力,DGX Cloud和NIM提供部署鏈路——三者形成一個完整的物理AI全棧閉環。這不是某個單點技術突破,而是從感知→理解→推理→決策→執行的智能體能力建構路徑。
有了這些,AI才能開始「看得懂、學得會、做得准」。
物理AI,正在真實世界紮根
技術從不應止步於發佈,真正的價值,是在真實世界裏「跑得起來、接得住、用得起」。作為一套面向現實構建的AI系統,NVIDIA的物理AI架構早已不僅停留在實驗室里。
它已經,正在,並將持續滲透到機械人、城市治理、製造業等高價值場景中。
人形機械人,正接入NVIDIA技術棧
在人形機械人這條技術路線的風口之下,中國成為全球最活躍的市場之一。不同於以往「硬件先行、算法滯後」的路徑,越來越多機械人公司開始選擇NVIDIA的全棧機械人技術解決方案作為起點。
例如,北京人形機械人創新中心、智元機械人、銀河通用等企業,統一採用NVIDIA最新的Jetson AGX Thor作為人形機械人的終端部署,配合Isaac Sim/Isaac Lab開展工業級強化學習與任務推理訓練。
此外,國內雲服務平台也在探索與NVIDIA NIM框架的集成,為智能體提供雲端訓練與部署閉環能力。
這不僅降低了具身智能研發的門檻,也加速了機械人從原型走向場景落地的速度。
企業藉助NVIDIA提供的「具身AI開發基礎設施」,形成協同生態,複製出更多「可落地」的智能體。
從交通保障到城市治理,物理AI重塑智慧城市底座
不僅是機械人,整個城市的感知系統也正在被重新定義。
例如,在法國SNCF車站、意大利K2K西西里交通系統等項目中,NVIDIA的Metropolis平台正被用於處理數萬路攝像頭視頻流,結合Omniverse / Cosmos模型,實現城市級的物理AI感知推理。
通過統一平台調度,系統可以實現:交通狀態實時識別、危險行為預測、能耗數據建模、應急響應規劃等複雜功能,並做到分鐘級部署、模塊化集成。
相比傳統「攝像頭識別+異構算法」方式,物理AI平台更強調數據統一、語義標準、場景預測,在複雜城市系統中體現出更強的「可遷移性」與「前瞻性」。
想像一下:一座城市,不再只是被動「保障的對象」,而是一個具身的、智能的Agent,自主識別問題,自我調度資源。
當我們把人形機械人和城市治理放在同一個物理AI體系下,會發現:「具身智能」不再只是一個產品,而是一種能力結構。它可以部署在機械人上,也可以部署在城市的管理體系里,甚至未來可能進入無人機、工廠機械臂、智能終端。
而這場能力遷移與規模複製的起點,不僅僅靠某個超級大模型,還包括像NVIDIA這樣能提供端到端整體解決方案的公司。
AI的下一個競爭維度:
從模型比拼,轉向世界理解能力建設
過去十年,AI的競爭在「語義空間」——我們訓練語言模型去理解文本、生成內容、掌握對話的邏輯;我們用圖像模型去生成畫面、識別物體、還原視覺。
但所有這些能力,最終都要穿越屏幕、走向物理世界。
而當這一步發生,AI的競爭維度也將徹底改寫。從NVIDIA技術和產品的基礎上展望未來,我們能看到以下幾個發展方向
1、從「通用大模型」到「通用智能體」,世界模型成為新引擎
LLM(大語言模型)是認知的開端,但不是智能的終點。
未來的AI競爭,不再只是誰的模型更大、更快,還是誰能構建出更強大的「世界模型」——能感知空間、理解時間、預判動態變化,並做出合理反應的能力。
這背後,是對AI模型結構的新要求:
·從「死記硬背」轉向「推理+常識」:基於VLM/VLA架構,逐步取代傳統LLM的「符號堆疊」路徑;
·從「語言為王」轉向「多模態融合」:語言、圖像、視頻、3D、運動軌跡等多源信息統一建模;
·從「離身智能」轉向「具身智能」:智能體不再只在雲端運算,還要在機械人和邊緣端實時運行。
NVIDIA的Cosmos就是這種「新型世界模型」的代表,它不生成語句,而是模擬決策過程;不只識別圖像,而是能在物理場景中執行操作指令。
2、模擬先於現實:合成數據將取代90%的實景訓練
在深度學習的世界裏,數據是「燃料」。
但在現實世界裏,數據往往昂貴、有限且帶有倫理邊界——特別是在自動駕駛、醫療、工業安全等高風險場景中。
因此,未來的AI系統將轉向一種新範式:先在模擬中訓練,再推理到現實中部署。核心技術包括:
·3D Gaussian Splatting + Omniverse + OpenUSD:構建高真實感虛擬世界;
·Cosmos Transfer + Predict:自動生成覆蓋各類邊緣場景的數據;
·自監督、仿真反饋閉環:通過自我優化+交互反饋,實現數據自動再生產。
模擬不再是「輔助工具」,而將成為訓練AI的主場,現實數據只是「修正器」。
這正如遊戲引擎之於虛擬現實,而AI的「仿真引擎」將成為理解物理世界的基礎設施。
這一切——從環境仿真到世界模型,從訓練到部署——最終匯聚成NVIDIA正在打造的下一代底座。
如果說CUDA是AI計算的引擎,那Omniverse+Cosmos+DGX就是物理智能體的 「操作系統」:
·Omniverse=虛擬世界建構器
·Cosmos=世界認知與推理引擎
·DGX Cloud + NIM = AI部署與執行平台
一個更深遠的類比是:AI正如人類剛剛學會「語言與思考」,但還不會「勞動與交互」。NVIDIA試圖做的,是為AI賦能手腳、眼睛和環境——把AI從「頭腦」變成「生命體」。
AI不止於智能,更走向真實
人類的智能進化,從來不是線性的。我們學會了語言,不是為了炫耀知識,而是為了彼此理解;我們製造工具,不是為了重複勞動,而是為了改變世界。
而AI,正走在同一條路上。
從GPT掀起的語義革命,到如今物理AI重塑的現實感知,人工智能正在完成一次從「抽象思維」到「具身行動」的躍遷。
它不再困於數據的回聲室,不再滿足於語言的模仿遊戲,而開始追問:「世界是什麼?我在哪裡?我能做什麼?」
這是一次深刻的轉向。
AI不再只是一種「計算能力」,而是一種「現實存在」的新形式。
未來某一天,我們或許不再將AI稱為工具。它們會成為城市的神經、機器的意志、空間的靈魂。
它們不會只在雲端思考,而會在地面奔跑、在空氣中感知、在現實中生長。
那將是AI真正「落地」的時代,一個「可感、可知、可控」的現實世界,也終將被AI深刻地理解、重構與改變。