定義視頻生成模型的「思維鏈」:DeepMind團隊提出「幀鏈」理論,揭示Veo 3的通用智能潛力

2025年09月28日18:30:13 科技 3648

google deepmind 近日發表了一篇論文,詳細介紹了其生成式視頻模型 veo 3 所展現出的「零樣本」學習與推理能力,並提出了一個與大型語言模型中的「思維鏈」相對應的核心概念——「幀鏈」(cof,chain-of-frames)。研究團隊通過對超過 18,000 個生成視頻的分析,系統地展示了 veo 3 在未經過任何特定任務微調的情況下,解決從基礎感知到複雜視覺推理等一系列問題的潛力。這篇題為《視頻模型是零樣本學習者和推理者》(video models are zero-shot learners and reasoners)的論文,明確提出了一個論點:正如 llm(large language model,大型語言模型)統一了自然語言處理領域,生成式視頻模型正走在成為機器視覺領域通用基礎模型的道路上。

定義視頻生成模型的「思維鏈」:DeepMind團隊提出「幀鏈」理論,揭示Veo 3的通用智能潛力 - 天天要聞圖丨相關論文(來源:arxiv)

在過去幾年中,自然語言處理(nlp,natural language processing)領域經歷了一場重大的變革,從為翻譯、摘要、問答等每個任務構建專門的「定製模型」,轉向了由一個統一的、可通過提示(prompting)解決多樣化問題的 llm 主導的時代。如今的機器視覺領域,在某種程度上正在復現 nlp 變革前的狀態:我們擁有在特定任務上表現卓越的模型,例如用於物體檢測的 yolo 系列或用於圖像分割的 segment anything,但缺少一個僅通過指令就能解決開放式視覺問題的通用模型。deepmind 的研究人員認為,促使 llm 能力湧現的核心要素——即在網路規模的數據集上訓練大型生成模型——同樣適用於當代的視頻模型。veo 3 的實驗結果,正是為了驗證這一判斷。

此項研究的亮點在於,它借鑒了大型語言模型中廣為人知的「思維鏈」(cot,chain-of-thought),並創造性地提出了一個視覺領域的平行概念——「幀鏈」(cof,chain-of-frames)。思維鏈通過將複雜問題分解為一系列中間推理步驟,並以文本形式逐步生成,極大地增強了語言模型的邏輯推理能力。

deepmind 指出,視頻生成在本質上是一個逐幀應用變化的過程,這種時空上的序列生成,恰好為視覺問題提供了一種內在的、循序漸進的解決方案,這便是「幀鏈」。語言模型操縱的是人類發明的符號,而視頻模型則直接在時間和空間這兩個物理維度上應用改變。因此,幀鏈推理使得視頻模型有潛力通過一步步生成畫面,來解決需要多步規劃和動態理解的複雜視覺任務。

為系統地評估 veo 3 的能力,研究團隊構建了一個涵蓋四個層級的能力框架:感知(perception)、建模(modeling)、操控(manipulation)和推理(reasoning)。在最基礎的感知層面,veo 3 展示了在沒有經過顯式訓練的情況下,完成一系列經典計算機視覺任務的能力,包括圖像分割、邊緣檢測、關鍵點定位、超解析度、盲去模糊和去噪。這些「湧現」出的能力,意味著視頻模型未來可能取代目前許多需要專門訓練的視覺工具模型。

定義視頻生成模型的「思維鏈」:DeepMind團隊提出「幀鏈」理論,揭示Veo 3的通用智能潛力 - 天天要聞圖丨veo 3 零樣本能力的定性概覽(來源:arxiv)

在感知之上是建模能力,即理解世界運行的基本規律,尤其是直覺物理。veo 3 能夠對剛體和柔體的動態、表面交互進行建模,並表現出對浮力、空氣阻力、折射與反射等物理現象的理解。在一個模擬「視覺疊疊樂」(visual jenga)的任務中,模型能夠以物理上合理的方式移除場景中的物體。它還能理解物體功能,例如判斷哪些物品可以被放進背包。此外,模型還能在時間和鏡頭移動中保持對世界狀態的記憶,這構成了其進行更複雜操作的基礎。

在此之上,便是模型的操控能力。veo 3 能夠執行多樣的零樣本圖像編輯任務,如背景移除、風格遷移、圖像上色和修復。它還能根據塗鴉指令編輯圖像,將不同物體合成為一個協調的場景,或將一張自拍肖像轉化為專業的商務頭像。這種對場景進行合理修改的能力,使其可以想像複雜的交互,模擬靈巧的物體操控,例如演示如何卷一個墨西哥卷餅,或讓機器人手臂像人類一樣自然地拿起鎚子。

這一系列能力的集成,最終賦予了模型進行視覺推理的能力。這正是「幀鏈」機制發揮關鍵作用的領域。在迷宮求解任務中,veo 3 通過逐幀生成紅色方塊在白色路徑上的移動,最終停在綠色終點,從而完成任務。其在 5x5 網格迷宮上的成功率(pass@10)達到了 78%,遠高於其前代模型 veo 2 的 14%。

定義視頻生成模型的「思維鏈」:DeepMind團隊提出「幀鏈」理論,揭示Veo 3的通用智能潛力 - 天天要聞圖丨veo 3 在不同複雜度迷宮中的求解表現(來源:arxiv)

研究還將其與最近大熱的圖像模型 nano banana 和語言模型 gemini 2.5 pro 進行了比較。結果顯示,靜態的圖像模型難以解決需要過程的迷宮任務,而語言模型雖然在處理 ascii 文本迷宮時表現優異,但在直接理解圖像輸入時則面臨困難。這也凸顯出視頻模型通過「幀鏈」進行逐步視覺推理的獨特優勢。除了迷宮,veo 3 還能完成視覺序列補全、連接匹配顏色、解決簡單的數獨謎題和視覺對稱性補全等任務。

不過,團隊表示,目前 veo 3 在許多任務上的表現仍不及最先進的專用模型,這與 llm 發展的早期階段(如 gpt-3 與精調模型的對比)非常類似。

此外,生成視頻的計算成本依然相當高昂。但論文援引歷史數據指出,llm 的推理成本正以每年 9 到 900 倍的速度下降,早期被認為「部署成本過高」的通用模型,最終憑藉其通用性和成本的快速下降取代了多數專用模型。如果 nlp 的發展軌跡可作為參考,同樣的趨勢也將在視覺領域上演。

參考資料:

1. https://arxiv.org/pdf/2509.20328

運營/排版:何晨龍

科技分類資訊推薦

引領科技豪華MPV新風尚 第二代騰勢D9西安車展亮相 - 天天要聞

引領科技豪華MPV新風尚 第二代騰勢D9西安車展亮相

兼具宜商氣度與家用溫情的科技豪華旗艦MPV,第二代騰勢D9迎來西安地區正式亮相。新車依託全球新能源MPV冠軍底蘊,以第二代刀片電池、雙閥雲輦-C、天神之眼5.0智駕等核心技術全面升級,兼顧商務體面與家庭舒適,為西北高端用戶帶來一站式全能出行解決方案。
採購禁入!科華數據材料造假被拒門外 - 天天要聞

採購禁入!科華數據材料造假被拒門外

本報(chinatimes.net.cn)記者胡雅文 北京報道這家趕上AI算力風口的公司,因投標材料造假,被相關採購方列入禁入名單兩年,其此前提出的複議申請也被正式駁回。相關採購平台近日發布公告,明確駁回科華數據股份有限公司(下稱「科華數據」,002335.SZ)此前提交的複議申請。早在一年前,科華數據已被認定在「信息通信樞紐...
快評樂道L80:15萬元級買大五座,這波值得沖? - 天天要聞

快評樂道L80:15萬元級買大五座,這波值得沖?

日前,樂道L80正式發布並開啟預售,其整車購買預售價為24.58萬元起,租電購買預售價則低至15.98萬元起。面對大型SUV市場「細分再細分」之競爭趨勢,這款樂道年度重磅新車都有哪些優勢?又能否成為「大五座SUV革新之作」?下面,圈哥就帶大家全方位感受。
成都直擊凱威德:純電全尺寸SUV的張揚與大氣 - 天天要聞

成都直擊凱威德:純電全尺寸SUV的張揚與大氣

4月22日,凱迪拉克以奧斯卡級盛典規格,將上海保利大劇院點亮為璀璨舞台,在品牌代言人倪妮與全場嘉賓的共同見證下,凱迪拉克全尺寸純電公路旗艦——凱威德耀然上市。新車共推出長續航四驅Pro、高性能四驅Ultra兩款配置,官方售價區間為46.88萬-50.88萬元。