FSDrive統一VLA和世界模型,推動自動駕駛邁向視覺推理

2025年09月30日18:23:05 科技 1904

FSDrive統一VLA和世界模型,推動自動駕駛邁向視覺推理 - 天天要聞


面向自動駕駛的多模態大模型在 「推理鏈」 上多以文字或符號為中介,易造成空間 - 時間關係模糊與細粒度信息丟失。FSDrive(FutureSightDrive)提出 「時空視覺 CoT」(Spatio-Temporal Chain-of-Thought),讓模型直接 「以圖思考」,用統一的未來圖像幀作為中間推理步驟,聯合未來場景與感知結果進行可視化推理。該方法在不改動原有 MLLM 架構的前提下,通過 「詞表擴展 + 自回歸視覺生成」 激活圖像生成能力,並以 「由易到難」 的漸進式視覺 CoT 注入物理先驗。模型既充當 「世界模型」 預測未來,又作為 「逆動力學模型」 進行軌跡規劃。


FSDrive統一VLA和世界模型,推動自動駕駛邁向視覺推理 - 天天要聞


  • 項目主頁:https://miv-xjtu.github.io/FSDrive.github.io/
  • 論文鏈地址:https://arxiv.org/abs/2505.17685
  • 代碼地址:https://github.com/MIV-XJTU/FSDrive


FSDrive統一VLA和世界模型,推動自動駕駛邁向視覺推理 - 天天要聞

https://mp.weixin.qq.com/s/uLazfZGChZUbHo_jW_VN6g?click_id=3

多模態大語言模型(MLLM)憑藉世界知識與可解釋推理能力,正加速進入端到端 「視覺 - 語言 - 動作」(VLA)自動駕駛範式。但現有做法多依賴離散文本 CoT(如規則描述、坐標),本質上是對視覺信息的高度符號壓縮,存在跨模態語義鴻溝與時空關係表徵不足的問題。


FSDrive統一VLA和世界模型,推動自動駕駛邁向視覺推理 - 天天要聞


核心問題:面向與物理世界深度交互的自動駕駛,思考過程更應接近 「模擬與想像」 的視覺推演,而非純符號邏輯?


FSDrive 提出 「時空視覺 CoT」,將未來場景與感知結果(車道線、3D 檢測框)統一生成到一張未來圖像幀中,作為中間推理步驟。一方面用普通未來幀承載時序演化,另一方面用 「紅色車道線與 3D 框」 提供可駕駛區域與關鍵動態物體的空間先驗,從而在視覺域內完成因果推斷與決策規劃。


本文關鍵創新:


1) 統一的 「視覺中介」 替代文字 / 表格中介,消除跨模態語義鴻溝;

2) 以極小代價在現成 MLLM 上 「激活」 圖像生成能力:僅通過擴展詞表引入 VQ 類視覺 token,無需改架構大改或海量訓練;

3) 漸進式視覺 CoT:先生成 「物理約束」 的粗粒度感知圖(車道線 / 3D 框),再生成細節豐富的未來幀,顯式注入物理合理性。


價值:保持端到端簡潔鏈路與可解釋可視化推理,同時可大規模利用無標註視頻數據學習世界演化規律。


方法


FSDrive統一VLA和世界模型,推動自動駕駛邁向視覺推理 - 天天要聞


FSDrive 整體框架:


  • 輸入:環視圖像與任務指令;輸出:統一未來幀(含紅色車道線 / 3D 框疊加)作為時空 CoT,以及最終軌跡。
  • 雙角色:模型先作為 「世界模型」 生成未來統一幀(時空 CoT),再作為 「逆動力學模型」 依據當前觀測與未來預測進行軌跡規劃。


統一預訓練範式:理解 + 生成


  • 理解保持:沿用 VQA 任務(如 OmniDrive-nuScenes/DriveLM 風格),維持原 MLLM 的語義理解能力。
  • 生成激活:不改 MLLM 結構,僅將 VQ-VAE/MoVQGAN 等的視覺 token 併入 LLM 詞表,擴展到 「圖文共享辭彙」。隨後以自回歸下一 token 預測方式直接生成圖像 token,並由 detokenizer 還原像素。
  • 數據高效:相較部分統一理解 - 生成方法,所需數據量約為其 0.3%,且不需從零訓練或複雜解碼器融合。


漸進式視覺 CoT(物理先驗→細節補全)


  • 先推理未來車道線(Ql):指示可行駛區域,注入靜態物理約束;
  • 再推理未來 3D 檢測(Qd):刻畫關鍵動態體的運動模式,注入動態約束;
  • 最後在上述約束下生成完整未來幀(Qf):補全細節、提升真實性與一致性。
  • 訓練階段採用該 「由易到難」 順序,推斷階段將三者整合為 「統一未來幀」 以提高效率。

時空視覺 CoT 用於規劃


  • 將 「普通未來幀(時間演化)+ 紅色車道線 / 3D 框(空間結構)」 合成為統一圖像中介 QCoT,直接作為中間推理步驟輸入規劃頭。模型在視覺域完成因果鏈條的傳遞,顯著減少因符號化導致的語義缺失與二義性。
  • 表達式:基於 It 與 QCoT 自回歸生成未來軌跡 Wt,兼容導航指令與自車狀態(可選)。

訓練策略


  • 初始化:可從任一現成 MLLM(如 Qwen2-VL-2B、LLaVA-7B)出發;凍結視覺編碼器,微調 LLM 主體。
  • 階段一(統一預訓練):混合訓練 VQA、未來幀生成與漸進式感知生成(車道線 / 3D 框),大量使用 nuScenes 無標註視頻用於未來幀預測。
  • 階段二(SFT):聯合優化場景理解(DriveLM GVQA)與軌跡規劃(nuScenes,含統一時空 CoT 作為中間步驟),通過不同提示詞調用任務專屬推理。
  • 實現要點:MoVQGAN 視覺碼本併入詞表,detokenizer 回像素;預訓練 32 輪,SFT 12 輪;僅 LLM 全量微調。


實驗


FSDrive統一VLA和世界模型,推動自動駕駛邁向視覺推理 - 天天要聞


端到端軌跡規劃


相比同時具備視覺生成的 Doe-1(Lumina-mGPT-7B),FSDrive 在不使用自車狀態時取得更低 L2 與更低碰撞:


  • ST-P3 平均 L2:0.53 vs 0.70;碰撞率:0.19 vs 0.21(基於 Qwen2-VL-2B)。
  • UniAD 平均 L2:0.96 vs 1.26;碰撞率:0.40 vs 0.53。


與 LLaVA-7B 系列下的近期方法(如 OminiDrive、RDA-Driver)相比,FSDrive 在相同設置下展現出強競爭力,說明框架可廣泛遷移到主流 MLLM。


FSDrive統一VLA和世界模型,推動自動駕駛邁向視覺推理 - 天天要聞


未來幀生成質量(FID)


在 128×192 解析度下,FSDrive(自回歸)FID=10.1,優於多數擴散式世界模型(如 GEM 10.5)並顯著優於 Doe-1(15.9),兼顧實時性與質量。


FSDrive統一VLA和世界模型,推動自動駕駛邁向視覺推理 - 天天要聞


場景理解(DriveLM GVQA)


Final Score 0.57,超過 OminiDrive(0.56)、Cube-LLM 等;多項語言生成指標與多選準確率(0.72)均表現穩健,表明 「理解 + 生成」 統一預訓練的有效性。


FSDrive統一VLA和世界模型,推動自動駕駛邁向視覺推理 - 天天要聞


定性分析


在錯誤導航指令下,FSDrive 可通過 「觀察 + 未來預測」 的視覺推理糾偏路徑,降低潛在碰撞;體現其 「逆動力學」 能力與可解釋性。


總結


本文提出 FSDrive:以 「統一的時空視覺 CoT」 作為中間推理,打通未來場景預測與感知結果的視覺表達,讓 VLA 在視覺域內完成因果推理與軌跡規劃。


方法無需改動原 MLLM 結構,通過擴展詞表與自回歸訓練即可激活圖像生成;配合 「由易到難」 的漸進式視覺 CoT,顯式注入物理約束,提升未來預測的真實性與一致性。


在規劃、生成與理解三大任務的系統驗證顯示:FSDrive 以更低的數據 / 算力成本實現強競爭力甚至 SOTA 的開放迴路表現,並顯著降低碰撞風險,推動自動駕駛從 「符號推理」 走向 「視覺推理」。


局限與展望:當前為實時性考慮主要生成前視未來幀,未來可擴展至環視統一預測;同時,隨模型落地需重視安全、隱私與監管等倫理合規問題,確保技術向善與可靠部署。

科技分類資訊推薦

引領科技豪華MPV新風尚 第二代騰勢D9西安車展亮相 - 天天要聞

引領科技豪華MPV新風尚 第二代騰勢D9西安車展亮相

兼具宜商氣度與家用溫情的科技豪華旗艦MPV,第二代騰勢D9迎來西安地區正式亮相。新車依託全球新能源MPV冠軍底蘊,以第二代刀片電池、雙閥雲輦-C、天神之眼5.0智駕等核心技術全面升級,兼顧商務體面與家庭舒適,為西北高端用戶帶來一站式全能出行解決方案。
採購禁入!科華數據材料造假被拒門外 - 天天要聞

採購禁入!科華數據材料造假被拒門外

本報(chinatimes.net.cn)記者胡雅文 北京報道這家趕上AI算力風口的公司,因投標材料造假,被相關採購方列入禁入名單兩年,其此前提出的複議申請也被正式駁回。相關採購平台近日發布公告,明確駁回科華數據股份有限公司(下稱「科華數據」,002335.SZ)此前提交的複議申請。早在一年前,科華數據已被認定在「信息通信樞紐...
快評樂道L80:15萬元級買大五座,這波值得沖? - 天天要聞

快評樂道L80:15萬元級買大五座,這波值得沖?

日前,樂道L80正式發布並開啟預售,其整車購買預售價為24.58萬元起,租電購買預售價則低至15.98萬元起。面對大型SUV市場「細分再細分」之競爭趨勢,這款樂道年度重磅新車都有哪些優勢?又能否成為「大五座SUV革新之作」?下面,圈哥就帶大家全方位感受。
成都直擊凱威德:純電全尺寸SUV的張揚與大氣 - 天天要聞

成都直擊凱威德:純電全尺寸SUV的張揚與大氣

4月22日,凱迪拉克以奧斯卡級盛典規格,將上海保利大劇院點亮為璀璨舞台,在品牌代言人倪妮與全場嘉賓的共同見證下,凱迪拉克全尺寸純電公路旗艦——凱威德耀然上市。新車共推出長續航四驅Pro、高性能四驅Ultra兩款配置,官方售價區間為46.88萬-50.88萬元。