google deepmind 近日發表了一篇論文,詳細介紹了其生成式視頻模型 veo 3 所展現出的「零樣本」學習與推理能力,並提出了一個與大型語言模型中的「思維鏈」相對應的核心概念——「幀鏈」(cof,chain-of-frames)。研究團隊通過對超過 18,000 個生成視頻的分析,系統地展示了 veo 3 在未經過任何特定任務微調的情況下,解決從基礎感知到複雜視覺推理等一系列問題的潛力。這篇題為《視頻模型是零樣本學習者和推理者》(video models are zero-shot learners and reasoners)的論文,明確提出了一個論點:正如 llm(large language model,大型語言模型)統一了自然語言處理領域,生成式視頻模型正走在成為機器視覺領域通用基礎模型的道路上。
圖丨相關論文(來源:arxiv)
在過去幾年中,自然語言處理(nlp,natural language processing)領域經歷了一場重大的變革,從為翻譯、摘要、問答等每個任務構建專門的「定製模型」,轉向了由一個統一的、可通過提示(prompting)解決多樣化問題的 llm 主導的時代。如今的機器視覺領域,在某種程度上正在復現 nlp 變革前的狀態:我們擁有在特定任務上表現卓越的模型,例如用於物體檢測的 yolo 系列或用於圖像分割的 segment anything,但缺少一個僅通過指令就能解決開放式視覺問題的通用模型。deepmind 的研究人員認為,促使 llm 能力湧現的核心要素——即在網路規模的數據集上訓練大型生成模型——同樣適用於當代的視頻模型。veo 3 的實驗結果,正是為了驗證這一判斷。
此項研究的亮點在於,它借鑒了大型語言模型中廣為人知的「思維鏈」(cot,chain-of-thought),並創造性地提出了一個視覺領域的平行概念——「幀鏈」(cof,chain-of-frames)。思維鏈通過將複雜問題分解為一系列中間推理步驟,並以文本形式逐步生成,極大地增強了語言模型的邏輯推理能力。
deepmind 指出,視頻生成在本質上是一個逐幀應用變化的過程,這種時空上的序列生成,恰好為視覺問題提供了一種內在的、循序漸進的解決方案,這便是「幀鏈」。語言模型操縱的是人類發明的符號,而視頻模型則直接在時間和空間這兩個物理維度上應用改變。因此,幀鏈推理使得視頻模型有潛力通過一步步生成畫面,來解決需要多步規劃和動態理解的複雜視覺任務。
為系統地評估 veo 3 的能力,研究團隊構建了一個涵蓋四個層級的能力框架:感知(perception)、建模(modeling)、操控(manipulation)和推理(reasoning)。在最基礎的感知層面,veo 3 展示了在沒有經過顯式訓練的情況下,完成一系列經典計算機視覺任務的能力,包括圖像分割、邊緣檢測、關鍵點定位、超解析度、盲去模糊和去噪。這些「湧現」出的能力,意味著視頻模型未來可能取代目前許多需要專門訓練的視覺工具模型。
圖丨veo 3 零樣本能力的定性概覽(來源:arxiv)
在感知之上是建模能力,即理解世界運行的基本規律,尤其是直覺物理。veo 3 能夠對剛體和柔體的動態、表面交互進行建模,並表現出對浮力、空氣阻力、折射與反射等物理現象的理解。在一個模擬「視覺疊疊樂」(visual jenga)的任務中,模型能夠以物理上合理的方式移除場景中的物體。它還能理解物體功能,例如判斷哪些物品可以被放進背包。此外,模型還能在時間和鏡頭移動中保持對世界狀態的記憶,這構成了其進行更複雜操作的基礎。
在此之上,便是模型的操控能力。veo 3 能夠執行多樣的零樣本圖像編輯任務,如背景移除、風格遷移、圖像上色和修復。它還能根據塗鴉指令編輯圖像,將不同物體合成為一個協調的場景,或將一張自拍肖像轉化為專業的商務頭像。這種對場景進行合理修改的能力,使其可以想像複雜的交互,模擬靈巧的物體操控,例如演示如何卷一個墨西哥卷餅,或讓機器人手臂像人類一樣自然地拿起鎚子。
這一系列能力的集成,最終賦予了模型進行視覺推理的能力。這正是「幀鏈」機制發揮關鍵作用的領域。在迷宮求解任務中,veo 3 通過逐幀生成紅色方塊在白色路徑上的移動,最終停在綠色終點,從而完成任務。其在 5x5 網格迷宮上的成功率(pass@10)達到了 78%,遠高於其前代模型 veo 2 的 14%。
圖丨veo 3 在不同複雜度迷宮中的求解表現(來源:arxiv)
研究還將其與最近大熱的圖像模型 nano banana 和語言模型 gemini 2.5 pro 進行了比較。結果顯示,靜態的圖像模型難以解決需要過程的迷宮任務,而語言模型雖然在處理 ascii 文本迷宮時表現優異,但在直接理解圖像輸入時則面臨困難。這也凸顯出視頻模型通過「幀鏈」進行逐步視覺推理的獨特優勢。除了迷宮,veo 3 還能完成視覺序列補全、連接匹配顏色、解決簡單的數獨謎題和視覺對稱性補全等任務。
不過,團隊表示,目前 veo 3 在許多任務上的表現仍不及最先進的專用模型,這與 llm 發展的早期階段(如 gpt-3 與精調模型的對比)非常類似。
此外,生成視頻的計算成本依然相當高昂。但論文援引歷史數據指出,llm 的推理成本正以每年 9 到 900 倍的速度下降,早期被認為「部署成本過高」的通用模型,最終憑藉其通用性和成本的快速下降取代了多數專用模型。如果 nlp 的發展軌跡可作為參考,同樣的趨勢也將在視覺領域上演。
參考資料:
1. https://arxiv.org/pdf/2509.20328
運營/排版:何晨龍