
面向自動駕駛的多模態大模型在 「推理鏈」 上多以文字或符號為中介,易造成空間 - 時間關係模糊與細粒度信息丟失。FSDrive(FutureSightDrive)提出 「時空視覺 CoT」(Spatio-Temporal Chain-of-Thought),讓模型直接 「以圖思考」,用統一的未來圖像幀作為中間推理步驟,聯合未來場景與感知結果進行可視化推理。該方法在不改動原有 MLLM 架構的前提下,通過 「詞表擴展 + 自回歸視覺生成」 激活圖像生成能力,並以 「由易到難」 的漸進式視覺 CoT 注入物理先驗。模型既充當 「世界模型」 預測未來,又作為 「逆動力學模型」 進行軌跡規劃。

- 項目主頁:https://miv-xjtu.github.io/FSDrive.github.io/
- 論文鏈地址:https://arxiv.org/abs/2505.17685
- 代碼地址:https://github.com/MIV-XJTU/FSDrive

https://mp.weixin.qq.com/s/uLazfZGChZUbHo_jW_VN6g?click_id=3
多模態大語言模型(MLLM)憑藉世界知識與可解釋推理能力,正加速進入端到端 「視覺 - 語言 - 動作」(VLA)自動駕駛範式。但現有做法多依賴離散文本 CoT(如規則描述、坐標),本質上是對視覺信息的高度符號壓縮,存在跨模態語義鴻溝與時空關係表徵不足的問題。

核心問題:面向與物理世界深度交互的自動駕駛,思考過程更應接近 「模擬與想像」 的視覺推演,而非純符號邏輯?
FSDrive 提出 「時空視覺 CoT」,將未來場景與感知結果(車道線、3D 檢測框)統一生成到一張未來圖像幀中,作為中間推理步驟。一方面用普通未來幀承載時序演化,另一方面用 「紅色車道線與 3D 框」 提供可駕駛區域與關鍵動態物體的空間先驗,從而在視覺域內完成因果推斷與決策規劃。
本文關鍵創新:
1) 統一的 「視覺中介」 替代文字 / 表格中介,消除跨模態語義鴻溝;
2) 以極小代價在現成 MLLM 上 「激活」 圖像生成能力:僅通過擴展詞表引入 VQ 類視覺 token,無需改架構大改或海量訓練;
3) 漸進式視覺 CoT:先生成 「物理約束」 的粗粒度感知圖(車道線 / 3D 框),再生成細節豐富的未來幀,顯式注入物理合理性。
價值:保持端到端簡潔鏈路與可解釋可視化推理,同時可大規模利用無標註視頻數據學習世界演化規律。
方法

FSDrive 整體框架:
- 輸入:環視圖像與任務指令;輸出:統一未來幀(含紅色車道線 / 3D 框疊加)作為時空 CoT,以及最終軌跡。
- 雙角色:模型先作為 「世界模型」 生成未來統一幀(時空 CoT),再作為 「逆動力學模型」 依據當前觀測與未來預測進行軌跡規劃。
統一預訓練範式:理解 + 生成
- 理解保持:沿用 VQA 任務(如 OmniDrive-nuScenes/DriveLM 風格),維持原 MLLM 的語義理解能力。
- 生成激活:不改 MLLM 結構,僅將 VQ-VAE/MoVQGAN 等的視覺 token 併入 LLM 詞表,擴展到 「圖文共享辭彙」。隨後以自回歸下一 token 預測方式直接生成圖像 token,並由 detokenizer 還原像素。
- 數據高效:相較部分統一理解 - 生成方法,所需數據量約為其 0.3%,且不需從零訓練或複雜解碼器融合。
漸進式視覺 CoT(物理先驗→細節補全)
- 先推理未來車道線(Ql):指示可行駛區域,注入靜態物理約束;
- 再推理未來 3D 檢測(Qd):刻畫關鍵動態體的運動模式,注入動態約束;
- 最後在上述約束下生成完整未來幀(Qf):補全細節、提升真實性與一致性。
- 訓練階段採用該 「由易到難」 順序,推斷階段將三者整合為 「統一未來幀」 以提高效率。
時空視覺 CoT 用於規劃
- 將 「普通未來幀(時間演化)+ 紅色車道線 / 3D 框(空間結構)」 合成為統一圖像中介 QCoT,直接作為中間推理步驟輸入規劃頭。模型在視覺域完成因果鏈條的傳遞,顯著減少因符號化導致的語義缺失與二義性。
- 表達式:基於 It 與 QCoT 自回歸生成未來軌跡 Wt,兼容導航指令與自車狀態(可選)。
訓練策略
- 初始化:可從任一現成 MLLM(如 Qwen2-VL-2B、LLaVA-7B)出發;凍結視覺編碼器,微調 LLM 主體。
- 階段一(統一預訓練):混合訓練 VQA、未來幀生成與漸進式感知生成(車道線 / 3D 框),大量使用 nuScenes 無標註視頻用於未來幀預測。
- 階段二(SFT):聯合優化場景理解(DriveLM GVQA)與軌跡規劃(nuScenes,含統一時空 CoT 作為中間步驟),通過不同提示詞調用任務專屬推理。
- 實現要點:MoVQGAN 視覺碼本併入詞表,detokenizer 回像素;預訓練 32 輪,SFT 12 輪;僅 LLM 全量微調。
實驗

端到端軌跡規劃
相比同時具備視覺生成的 Doe-1(Lumina-mGPT-7B),FSDrive 在不使用自車狀態時取得更低 L2 與更低碰撞:
- ST-P3 平均 L2:0.53 vs 0.70;碰撞率:0.19 vs 0.21(基於 Qwen2-VL-2B)。
- UniAD 平均 L2:0.96 vs 1.26;碰撞率:0.40 vs 0.53。
與 LLaVA-7B 系列下的近期方法(如 OminiDrive、RDA-Driver)相比,FSDrive 在相同設置下展現出強競爭力,說明框架可廣泛遷移到主流 MLLM。

未來幀生成質量(FID)
在 128×192 解析度下,FSDrive(自回歸)FID=10.1,優於多數擴散式世界模型(如 GEM 10.5)並顯著優於 Doe-1(15.9),兼顧實時性與質量。

場景理解(DriveLM GVQA)
Final Score 0.57,超過 OminiDrive(0.56)、Cube-LLM 等;多項語言生成指標與多選準確率(0.72)均表現穩健,表明 「理解 + 生成」 統一預訓練的有效性。

定性分析
在錯誤導航指令下,FSDrive 可通過 「觀察 + 未來預測」 的視覺推理糾偏路徑,降低潛在碰撞;體現其 「逆動力學」 能力與可解釋性。
總結
本文提出 FSDrive:以 「統一的時空視覺 CoT」 作為中間推理,打通未來場景預測與感知結果的視覺表達,讓 VLA 在視覺域內完成因果推理與軌跡規劃。
方法無需改動原 MLLM 結構,通過擴展詞表與自回歸訓練即可激活圖像生成;配合 「由易到難」 的漸進式視覺 CoT,顯式注入物理約束,提升未來預測的真實性與一致性。
在規劃、生成與理解三大任務的系統驗證顯示:FSDrive 以更低的數據 / 算力成本實現強競爭力甚至 SOTA 的開放迴路表現,並顯著降低碰撞風險,推動自動駕駛從 「符號推理」 走向 「視覺推理」。
局限與展望:當前為實時性考慮主要生成前視未來幀,未來可擴展至環視統一預測;同時,隨模型落地需重視安全、隱私與監管等倫理合規問題,確保技術向善與可靠部署。