如何構建物理AI?NVIDIA給出了自己的答案

2025年09月19日21:00:30 財經 5266
如何構建物理AI?NVIDIA給出了自己的答案 - 天天要聞

AI的下一個競爭維度:從模型比拼,轉向世界理解能力建設。

我們正站在AI發展的又一臨界點上。

從ChatGPT到DeepSeek,從Sora到Cursor,多模態與大模型一路狂飆,不斷刷新我們對「智能」的認知上限。但一個更現實的問題也日益顯現——當AI面對的不再只是「文字、圖像與代碼」,而是現實世界中柔軟的手指、易碎的玻璃杯、擁擠的十字路口,它是否依然能從容應對?

越來越多的技術先鋒意識到,人工智能若不能理解並適應真實物理世界,其潛力將永遠被鎖在「模擬宇宙」里。

於是,一個新的概念開始浮現:「物理AI(Physical AI)」——一種具身、可感知、能推理、會行動的智能體形態,它不再只是數據上的算力堆疊,而是能走入現實世界,與真實物理環境交互的智能生命。

這一次,NVIDIA再次站了出來。

在SIGGRAPH 2025上,加速計算領域的全球領導者沒有再談算力峰值,而是拋出了一個更宏大的願景:構建支撐物理AI的全棧平台,用Omniverse塑造可信的世界模型,用Cosmos賦予AI推理認知能力,用DGX Cloud和Blackwell GPU打通訓練到部署的鏈路。一套專為「AI+現實世界」設計的技術體系,正悄然成形。

物理AI的時代,正在拉開帷幕。而它的第一幕,始於一個問題:AI,能不能看懂這個世界?

如何構建物理AI?NVIDIA給出了自己的答案 - 天天要聞

現實之問:

AI很強,但離「現實」還很遠

當我們談論AI的突破時,往往沉醉於技術指標:更高的參數量、更低的Loss、更強的推理鏈路。生成式AI在文本、圖像、語音等領域早已大放異彩,從一張圖生成無限空間、從一段話編織完整敘事,彷彿無所不能。

但一旦AI走出「模型」的舒適區,面對物理世界的複雜性,則又產生了新的問題。

1、多模態AI狂飆,但仍困於「紙上談兵」

AI能寫會畫,卻抓不準一個杯子。

這是物理AI領域最常被引用的真實難題。一個帶有輕微裂紋、光線反射變化的玻璃杯,足以讓機械人「手足無措」。在自動駕駛中,即使模型已訓練上千萬小時,但當暴雨傾盆、強光干擾、孩子突然衝出馬路,AI的識別與反應依然不穩定。

為什麼?因為它們「看不懂」現實世界。

今天的AI依賴的是二維圖像、靜態標註和抽象語義,它理解的是「物」,而不是「物理」:它不知道一塊瓷磚在潮濕狀態下會滑,也不懂高舉手臂的人是在打招呼還是要揮拳。這種脫離物理常識的「智能」,本質上是一種「符號理解」,而非具身認知。

我們一度以為,算力提升和模型堆疊可以解決一切。但現實世界的複雜性遠超想像——它是連續的、多變的、不可預測的。如果AI無法理解這些物理規律與變化邏輯,就很難真正落地於「世界」本身。

2、智能體應用爆發,產業卻卡在三大瓶頸

2025年,被譽為「智能體元年」。無數新創業項目圍繞AI Agent展開:從智能助手、AI外呼系統,到大模型驅動的機械人、自動化工廠、AI倉儲系統。

但當這些智能體真正被拉入「現實場景」,問題接踵而至。

瓶頸一:訓練數據難拿→模型泛化能力差

AI要想具身,首先要「看」世界。但現實數據昂貴、採集難度大、質量不一致(尤其在物理交互場景下,如抓握、避障、操作等)。模型往往只在「數據里強」,一旦環境稍有變化就「不會做題」。

瓶頸二:虛擬仿真不真實→模型遷移性能差

雖然工業界普遍採用仿真系統訓練AI,但傳統仿真環境缺乏真實性,材質、光影、碰撞反饋等不夠真實,導致「Sim2Real」性能驟降。

瓶頸三:複雜任務推理弱→智能體「聽不懂,還不會做」

具身智能不僅要識別,還要規划動作、拆解任務、應對變化。在複雜任務(如搬運多件物體、應對突髮狀況)中,當前的AI Agent仍缺乏真正的推理與自適應能力。

從人形機械人到自動化工廠,從智慧城市到無人駕駛,真正的AI落地不再只是「模型能力」,還是「世界理解能力」——感知物理環境、理解語境變化、做出合適反應。

產業需要的不再只是一個更大的語言模型,還是一個具身、具感知、具推理能力的「物理智能體」。

而這,正是NVIDIA試圖解答的問題。

NVIDIA開了一味「葯」,

讓AI理解並重構真實世界

面對AI落地的「物理現實壁壘」,NVIDIA並沒有試圖用更大的模型去強攻短板,而是換了一種思路:

如果AI無法理解世界,不如先幫它建一個世界;

如果AI不會行動,不如先賦予它具身能力;

如果數據不夠,不如讓AI自己生成數據,再進行推理和決策。

這背後,是一套覆蓋從環境構建、認知生成、推理預測到訓練部署的完整技術體系。它不是單一產品的升級,而是一種底層邏輯的革新:AI不只是大腦,還需要身體、環境和世界模型。

而NVIDIA,正在用三個關鍵系統組件,回應這套邏輯:

1、 Omniverse:為AI搭建「可信的訓練世界」

AI要真正理解世界,首先要在可信的、近似真實的環境中進行訓練與測試。這正是NVIDIA Omniverse的使命——一個用於構建虛擬物理環境的工業級平台。

在最新版本中,Omniverse支持3D Gaussian Splatting技術,僅通過視頻就能實現高精度三維場景重建,從而大幅降低訓練數據採集與建模的門檻。

更重要的是,Omniverse不再是孤島式仿真工具,它打通了主流機械人訓練標準(如MJCF與OpenUSD),並與NVIDIA Isaac Sim和Isaac Lab實現深度聯動,使工業級仿真與強化學習成為一體化流程。

換句話說:Omniverse讓AI不只在紙面上「學技能」,而是在擬真的數字世界中完成全流程訓練。

目前,Amazon與Hexagon已率先在使用Omniverse流式化工業數字孿生與物理AI場景仿真,面向感知、機械人與自動系統的開發。

2、Cosmos:賦予AI「世界認知」與「推理思維」

如果說Omniverse是訓練場,那NVIDIA Cosmos就是AI的「大腦結構」。

Cosmos是一個多模態世界模型系統,由NVIDIA新發佈的三大模塊組成:

·Cosmos Transfer:自動生成覆蓋多場景、多模態的合成數據,讓AI不再依賴昂貴的「實拍數據」,實現訓練數據「自給自足」。

·Cosmos Reason:基於VLM(視覺語言模型)進化形態,具備更強的推理能力,能將複雜任務拆解為結構化步驟,並結合物理常識做判斷。

·Cosmos Predict:從靜態理解進化為動態預測,可推演未來狀態場景,適用於自動駕駛、城市安防等時空複雜領域。

目前,Uber等行業先驅正在使用Cosmos系列世界模型進行任務推理和合成數據生成,提升物理智能體系統在真實環境中的泛化能力。

通過Cosmos,AI不再只是「回答問題的語言專家」,還是一個能感知現實、理解目標、預測後果、規劃路徑的行動體。

3、DGX Cloud + Blackwell GPU:統一訓練、仿真與部署的AI基座

訓練再強,也要部署落地;仿真再真,也要上陣實戰。

這正是NVIDIA用於「打通閉環」的底座——NVIDIA DGX Cloud+新一代Blackwell GPU架構。它不僅是算力的升級,更是物理智能體訓練、推理、部署的一站式平台。該系統支持從雲端訓練到邊緣端部署全流程遷移,適配工業機械人、智能攝像頭、無人車等異構設備。

通過NVIDIA NIM,企業可一鍵部署模型,僅需幾個API調用就能接入自家業務系統,加速AI Agent落地。

這意味着企業不再需要搭建繁瑣的AI基礎設施,而是「開箱即用」,從仿真、訓練到部署,全流程由NVIDIA打包完成。

在生成式AI大潮中,安利中國算是比較早一批完成AI基礎設施從通用計算向智能計算躍遷的企業之一。其核心選型,正是依託於NVIDIA DGX Cloud與NIM框架構建的智能體服務平台。根據文章披露,安利中國通過NVIDIA NIM框架優化模型推理效率,配合混合雲資源調度,在內部辦公與Copilot應用中效率提升顯著,模型推理效率提升約40%,員工辦公效率提升達50%。

總體來看,Omniverse提供訓練環境,Cosmos提供世界理解能力,DGX Cloud和NIM提供部署鏈路——三者形成一個完整的物理AI全棧閉環。這不是某個單點技術突破,而是從感知→理解→推理→決策→執行的智能體能力建構路徑。

有了這些,AI才能開始「看得懂、學得會、做得准」。

物理AI,正在真實世界紮根

技術從不應止步於發佈,真正的價值,是在真實世界裏「跑得起來、接得住、用得起」。作為一套面向現實構建的AI系統,NVIDIA的物理AI架構早已不僅停留在實驗室里。

它已經,正在,並將持續滲透到機械人、城市治理、製造業等高價值場景中。

如何構建物理AI?NVIDIA給出了自己的答案 - 天天要聞

人形機械人,正接入NVIDIA技術棧

在人形機械人這條技術路線的風口之下,中國成為全球最活躍的市場之一。不同於以往「硬件先行、算法滯後」的路徑,越來越多機械人公司開始選擇NVIDIA的全棧機械人技術解決方案作為起點。

例如,北京人形機械人創新中心、智元機械人、銀河通用等企業,統一採用NVIDIA最新的Jetson AGX Thor作為人形機械人的終端部署,配合Isaac Sim/Isaac Lab開展工業級強化學習與任務推理訓練。

此外,國內雲服務平台也在探索與NVIDIA NIM框架的集成,為智能體提供雲端訓練與部署閉環能力。

這不僅降低了具身智能研發的門檻,也加速了機械人從原型走向場景落地的速度。

企業藉助NVIDIA提供的「具身AI開發基礎設施」,形成協同生態,複製出更多「可落地」的智能體。

從交通保障到城市治理,物理AI重塑智慧城市底座

不僅是機械人,整個城市的感知系統也正在被重新定義。

例如,在法國SNCF車站、意大利K2K西西里交通系統等項目中,NVIDIA的Metropolis平台正被用於處理數萬路攝像頭視頻流,結合Omniverse / Cosmos模型,實現城市級的物理AI感知推理。

如何構建物理AI?NVIDIA給出了自己的答案 - 天天要聞

通過統一平台調度,系統可以實現:交通狀態實時識別、危險行為預測、能耗數據建模、應急響應規劃等複雜功能,並做到分鐘級部署、模塊化集成。

相比傳統「攝像頭識別+異構算法」方式,物理AI平台更強調數據統一、語義標準、場景預測,在複雜城市系統中體現出更強的「可遷移性」與「前瞻性」。

想像一下:一座城市,不再只是被動「保障的對象」,而是一個具身的、智能的Agent,自主識別問題,自我調度資源。

當我們把人形機械人和城市治理放在同一個物理AI體系下,會發現:「具身智能」不再只是一個產品,而是一種能力結構。它可以部署在機械人上,也可以部署在城市的管理體系里,甚至未來可能進入無人機、工廠機械臂、智能終端。

而這場能力遷移與規模複製的起點,不僅僅靠某個超級大模型,還包括像NVIDIA這樣能提供端到端整體解決方案的公司。

AI的下一個競爭維度:

從模型比拼,轉向世界理解能力建設

過去十年,AI的競爭在「語義空間」——我們訓練語言模型去理解文本、生成內容、掌握對話的邏輯;我們用圖像模型去生成畫面、識別物體、還原視覺。

但所有這些能力,最終都要穿越屏幕、走向物理世界。

而當這一步發生,AI的競爭維度也將徹底改寫。從NVIDIA技術和產品的基礎上展望未來,我們能看到以下幾個發展方向

1、從「通用大模型」到「通用智能體」,世界模型成為新引擎

LLM(大語言模型)是認知的開端,但不是智能的終點。

未來的AI競爭,不再只是誰的模型更大、更快,還是誰能構建出更強大的「世界模型」——能感知空間、理解時間、預判動態變化,並做出合理反應的能力。

這背後,是對AI模型結構的新要求:

·從「死記硬背」轉向「推理+常識」:基於VLM/VLA架構,逐步取代傳統LLM的「符號堆疊」路徑;

·從「語言為王」轉向「多模態融合」:語言、圖像、視頻、3D、運動軌跡等多源信息統一建模;

·從「離身智能」轉向「具身智能」:智能體不再只在雲端運算,還要在機械人和邊緣端實時運行。

NVIDIA的Cosmos就是這種「新型世界模型」的代表,它不生成語句,而是模擬決策過程;不只識別圖像,而是能在物理場景中執行操作指令。

2、模擬先於現實:合成數據將取代90%的實景訓練

在深度學習的世界裏,數據是「燃料」。

但在現實世界裏,數據往往昂貴、有限且帶有倫理邊界——特別是在自動駕駛、醫療、工業安全等高風險場景中。

因此,未來的AI系統將轉向一種新範式:先在模擬中訓練,再推理到現實中部署。核心技術包括:

·3D Gaussian Splatting + Omniverse + OpenUSD:構建高真實感虛擬世界;

·Cosmos Transfer + Predict:自動生成覆蓋各類邊緣場景的數據;

·自監督、仿真反饋閉環:通過自我優化+交互反饋,實現數據自動再生產。

模擬不再是「輔助工具」,而將成為訓練AI的主場,現實數據只是「修正器」。

這正如遊戲引擎之於虛擬現實,而AI的「仿真引擎」將成為理解物理世界的基礎設施。

這一切——從環境仿真到世界模型,從訓練到部署——最終匯聚成NVIDIA正在打造的下一代底座。

如果說CUDA是AI計算的引擎,那Omniverse+Cosmos+DGX就是物理智能體的 「操作系統」:

·Omniverse=虛擬世界建構器

·Cosmos=世界認知與推理引擎

·DGX Cloud + NIM = AI部署與執行平台

一個更深遠的類比是:AI正如人類剛剛學會「語言與思考」,但還不會「勞動與交互」。NVIDIA試圖做的,是為AI賦能手腳、眼睛和環境——把AI從「頭腦」變成「生命體」。

AI不止於智能,更走向真實

人類的智能進化,從來不是線性的。我們學會了語言,不是為了炫耀知識,而是為了彼此理解;我們製造工具,不是為了重複勞動,而是為了改變世界。

而AI,正走在同一條路上。

從GPT掀起的語義革命,到如今物理AI重塑的現實感知,人工智能正在完成一次從「抽象思維」到「具身行動」的躍遷。

它不再困於數據的回聲室,不再滿足於語言的模仿遊戲,而開始追問:「世界是什麼?我在哪裡?我能做什麼?」

這是一次深刻的轉向。

AI不再只是一種「計算能力」,而是一種「現實存在」的新形式。

未來某一天,我們或許不再將AI稱為工具。它們會成為城市的神經、機器的意志、空間的靈魂。

它們不會只在雲端思考,而會在地面奔跑、在空氣中感知、在現實中生長。

那將是AI真正「落地」的時代,一個「可感、可知、可控」的現實世界,也終將被AI深刻地理解、重構與改變。

財經分類資訊推薦

4月30日人社部發佈會召開,涉及到社保和養老金,具體有哪些內容 - 天天要聞

4月30日人社部發佈會召開,涉及到社保和養老金,具體有哪些內容

人力資源和社會保障部,組織召開的第一季度例行新聞發佈會。在新聞發佈會當中帶來了,關於社保和養老金方面的一些內容,那麼我們具體來了解一下究竟有哪些內容,這些內容對於我們個人來說會產生一個什麼樣的影響呢?養老保險的參保人數不斷提高根據人社部的例行新聞發佈會當中指出,截止到2026年的第1季度末,養老保險的參...
中興三星全球專利糾紛持續 知識產權保護需凝聚國際共識 - 天天要聞

中興三星全球專利糾紛持續 知識產權保護需凝聚國際共識

近期,中興通訊與三星電子圍繞無線通信標準必要專利(SEP)許可的全球性糾紛迎來多項關鍵司法裁決。當地時間4月30日,德國慕尼黑第一地區法院就雙方專利侵權糾紛作出當庭判決,中興通訊在主訴與反訴案件中同時勝出,成功獲得針對三星的德國禁令。而此前英國高等法院作出的一
巴菲特,最新發聲!接班人,股東大會觀點來了 - 天天要聞

巴菲特,最新發聲!接班人,股東大會觀點來了

【導讀】伯克希爾·哈撒韋股東大會要點直擊中國基金報記者 李智當地時間5月2日,伯克希爾·哈撒韋股東大會在美國奧馬哈召開。本次大會由格雷格·阿貝爾接任CEO後首次獨立主持,「股神」巴菲特則以董事會主席身份列席台下。在今年的大會上,阿貝爾探討了AI戰略、網絡安全、能源轉型、股票回購等諸多話題,宣告伯克希爾正式進...
早讀丨廣東多項交通數據創歷史新高;張雪機車再奪冠軍 - 天天要聞

早讀丨廣東多項交通數據創歷史新高;張雪機車再奪冠軍

◆「首展」添彩、國潮湧動,廣東4A級及以上景區單日接待遊客394.2萬人次。詳情--> 「五一」假期「逛吃」指南:廣交會客商與市民共享全城消費熱力。詳情--> ◆常規賽第六輪精彩紛呈,多場對決戰至最後時刻。詳情--> 粵超第二輪先賽五場:梅州反客為主大勝潮州,潮語電影《給阿嬤的情書》片花亮相汕頭主場。詳情--> 粵超、粵...
低價搶市場害苦科陸電子,連續5年虧損靠大股東「輸血續命」 - 天天要聞

低價搶市場害苦科陸電子,連續5年虧損靠大股東「輸血續命」

圖源:公司官網本報(chinatimes.net.cn)記者胡雅文 北京報道深圳市科陸電子科技股份有限公司(下稱「科陸電子」,002121.SZ)遲遲未能實現盈利。近日,科陸電子交出了被美的集團收購後的第二份年報,營收63.1億元創下歷史新高,凈利潤卻連續第5年虧損。截至2025年末,其資產負債率高達95.15%。進入2026年,一季度再虧0.4...