眼看就要到春節了,很多團隊已經開始放慢節奏,但 AI 圈還是一如既往地卷。就在不少人以為「該發的模型都發完了」的時候,新模型還是一波接一波往外上,完全沒有停住的趨勢。
這段時間你會發現一個很有意思的現象:一邊是各家都在 AI 入口上做很重的營銷動作,搶入口、搶用戶心智、搶使用場景;但另一邊,底層模型的更新速度其實一點都沒慢下來。
廠商自己也很清楚,只靠入口包裝和營銷聲量,是撐不住長期競爭力的,模型能力本身必須持續往前推。
最近,位元組跳動又放出了一張新牌:新一代視頻生成模型 Seedance 2.0 正式發布,把視頻生成這條線往「更可控、更連貫、更像真實鏡頭語言」的方向又推了一步。值得注意的是該大版本號模型,離前一代支持音視頻聯合生成的模型 Seedance 1.5 Pro 的發布日期只過去了 2 個月。
入口在打仗,模型在加速,兩條線同時在跑,而且都沒打算等對方。
下面,我們也完整實測了一波 Seedance 2.0。
先說一下,這次我是直接在「即夢」里用的 Seedance 2.0,下面講的體驗也都基於這個平台。
Seedance 2.0 這版主打一個點:參考能力更全面。跟上一代的音視頻模型 Seedance 1.5 Pro 比起來,它現在對多張圖片、多段視頻一起參考的支持更強,用起來也更順手。
另外你也能看到一個趨勢:不只是做視頻生成的模型在加強「參考視頻」這件事,像 Kimi 2.5 這種通用大模型,也開始強調可以參考視頻內容來生成結果,大家都在往這個方向走。
01
蘋果風格商品宣傳
我們一開始,就先做了一組素材:運動品牌風格的人物模特,加上運動手錶這種實物產品,一起拿來做測試。

然後我又上傳了一支很經典的 Apple Watch 官方宣傳片。這種片子本身就是多鏡頭結構,既有人物鏡頭,也有產品特寫,很適合拿來當參考素材。
現在在即夢裡,你基本不用寫很複雜的提示詞,按它那個很直觀的提示方式來就行。直接告訴它:參考這支視頻的鏡頭節奏和風格,生成一條新的運動手錶廣告。
同時把主角換成我自己的圖片,把商品也換成我準備好的產品圖。整套流程很直接,就是選參考視頻 + 選人物圖 + 選商品圖,然後讓模型去生成一條新的廣告片。
生成這類視頻的時間會比較久,而且積分消耗也不低。比如兩張圖片加一段參考視頻,同時都參與參考的話,做一條 15 秒的視頻,基本要花接近 200 積分。
不過成片出來之後,你能明顯感覺到質量是在線的。整體真實感很強,模特在公路上跑步時的光線變化、頭髮上的反光、臉部的受光細節,都做得很到位,看著不會假。
還有一點:我其實沒有給它一個完整的故事結構,只是給了參考素材和目標類型。最後的視頻節奏基本是它自己排出來的。
片子里出現的商品,主要就是我給它的那隻手錶。它裡面有兩段鏡頭是專門切到手錶上的,而且還加了動效。
整體看下來,畫面元素基本沒什麼大問題。比較常見的坑還是那個:數字和中文偶爾會亂寫,會有點「AI 幻覺」。
右下圖片那個轉場,它會有一個滑動手錶的動作。我專門截了幾幀去看,很多幀里文字其實是正常的,只是在滑動的那一瞬間容易出錯。這個表現跟上一代比,確實進步很明顯。

你要是認真去逐幀截圖看,會發現細節也比較到位。女模特手臂上的紋理、手上的細小汗毛,是能夠看清的。
02
「跨風格整合」的財神拜年
因為它的動效表現確實不錯,我就又多做了一組測試。我新生成了一張新春財神抱著金元寶的圖,再加上一張美劇風格的惡靈騎士角色圖,然後把這兩張圖一起丟進去當參考素材,讓它按這個方向繼續生成視頻。

我給它的目標其實很簡單:先讓財神出場,背後是一堆元寶和金幣,在發光、在晃動;接著惡靈騎士騎著摩托衝進畫面;然後變成財神騎著這輛摩托直接開走;最後閃出一幀畫面,打上「新春快樂」和具體日期的中文與數字。
成片看下來,開頭惡靈騎士那一段,AI 感還是偏重一點,能看出來是模型在「拼」畫面。不過從財神和道具之間的互動,到表情變化,再到動作銜接,比以前順了不少。
還有一個小規律我這次也注意到:如果畫面里放的是那種比較大的藝術字,Seedance 2.0 出錯的概率會低很多。
如果是一張圖片里有多個主體,然後讓鏡頭一個個掃過去,這種場景我也測了一下 Seedance 2.0 的表現。
03
多主體鏡頭
我做了一張圖:五個小動物穿著不同禮服,一起坐在同一條長椅上。主體多、造型差異大,還都在同一畫面里,這種情況其實挺考驗模型的鏡頭理解和主體保持能力。

我當時的提示詞設計很直接:讓畫面里所有小動物一起跳舞給大家拜年,鏡頭要一個個掃過去。每掃到一個角色,就在它的動作上停一下,給慢鏡頭和特寫。
這個視頻主要在考一件事:鏡頭逐個掃過時,角色的出現順序要對。也就是視頻里的出場順序,要和原圖裡小動物從左到右的順序一致,這點很看一致性能力。
從生成結果來看,Seedance 2.0 在畫面質量和整體一致性上都還不錯。不過這條視頻我也反覆跑了三四次才選到比較滿意的版本。動作質量普遍很高,但還是會有順序問題,比如熊貓和兔子的位置被對調,這種情況還是會出現。
但如果只看角色本身和動作表現,這一版確實提升很明顯。每次鏡頭停在單個角色上時,毛髮細節、質感、真實度,還有鏡頭之間的切換,都處理得比較順。
下面我做了一個更偏敘事向的視頻案例。接著用到的兩張圖,是我上傳給 Seedance 2.0 當參考素材用的。
04
宇航員與 3D LED 屏里的貓
左邊是一張十字路口的大型 3D LED 屏畫面,裡面有一隻貓,尾巴是從屏幕里伸出來的;右邊是一張很經典的宇航員圖片。

提示詞是:讓這個宇航員走進十字路口,在路口下面停住,把頭盔面罩打開,再戴上墨鏡,看向 3D LED 屏里的貓,然後整個人愣一下,周圍街道人來人往。
從最後生成的視頻來看,整體效果其實很不錯。尤其是宇航員走進路口那段,你能看到周圍行人和車輛都是在動態變化的,沒有那種很明顯的錯亂感,看起來會比較順。
小問題也有,就是屏幕里的貓還是顯得有點呆,靈動感差一點。整體能用,但這個角色的表現還有提升空間。
下面這張圖是我自己生成的一張 Instagram 風格的剪貼畫配圖,裡面有好幾個男性角色拼在一起。
05
多人物 INS 風剪貼畫
我給 Seedance 2.0 的目標也很明確:人物不要變,背景不要變,畫面里的這些男性角色都要保留下來,只是在這個基礎上,讓他們一起跳起來動起來。

這個任務其實挺難的。按以前的經驗,一張元素很多、結構很複雜的圖,光是做靜態生成就不太穩,很容易出錯。要是在視頻里再讓這些剪貼畫人物動起來,還要跳舞、互動,就更容易把周圍元素帶亂。
所以一開始我自己的預期也不高,會覺得出錯的概率不小。
我給的提示詞:這是一張有多個男性角色的剪貼畫,背景和版式全部保持不變,只讓人物跳舞;節奏偏搞笑、偏抽象;人物之間要有互動動作,比如握手、擊掌。
最後生成出來的視頻,其實跟提示詞對得挺准。畫面里的文字沒有被改動,不管是上面的主標題,還是下面的小塊文字,都保持原樣。整張圖裡一共七個角色,他們之間都有互動,而且基本是在同一個節奏上跳舞。
而且你仔細看細節會發現:這些角色就算把後面的剪貼畫文字擋住了,在遮住、再淡出的那一下,文字本身也沒有被改掉。
06
NIKE 風運動員剪影
最後一個案例,我用的是一位體操運動員運動時的模糊剪影。我給了它一套 5 張參考圖,每張都有很明顯的動態拖影,構圖也很極簡,沒有 logo 和文字,但整體質感很強。
我當時對 Seedance 2.0 的要求也比較高:希望它能把這種動態拖影的感覺保留下來,整體風格往運動廣告片那邊靠,像那種品牌宣傳片的質感,再簡單配點字,就能直接發到短視頻平台。
這個目標其實不低,但最後生成的效果還是挺可以的。
你能看出來,它在結構和節奏上是有主動安排的,不是那種很死板的處理方式。鏡頭切換也不生硬,沒有走老路:不是簡單把一張圖變成動圖,再在幾段動圖之間硬切。
這種老式做法在早期的視頻模型里很常見,這一版明顯更自然一些。
音樂這塊我其實什麼參考都沒給,也沒寫相關提示詞,但它最後配出來的音樂,和整條視頻的節奏還挺合拍的,不是很違和。
有幾個鏡頭它還會主動給慢鏡頭特寫,比如倒數第二個鏡頭,就明顯放慢了節奏,把動作拉出來單獨展示。我還專門截了一幀圖來看,那一刻的畫面,和我上傳的參考圖幾乎是一樣的。
同時你也能看出來,它為了把前後鏡頭接順,會把這張參考畫面往前多補一點內容,也往後多延一點動作,這樣前後過渡就會更自然,不會突然斷掉。
最後簡單收一下:整體看下來,Seedance 2.0 在敘事節奏、鏡頭切換,還有對參考圖片和參考視頻的一致性保持上,都比上一代音視頻模型強了不少。

問題也還是有的,比如畫面里有很小的文字,或者很細的小元素,在動態變化的時候,還是會偶爾出錯。不過出錯的頻率,確實比上一代低了很多。與此同時,單個視頻的生成時間往往非常漫長,積分的消耗也非常大。
對位元組的平台來說,這是內容供給效率的提升,畢竟位元組已經將該模型全面下發到旗下各個 AI 內容創作平台,例如即夢、CapCut(剪映)等等。
從更現實的角度看,視頻生成模型這條線,已經快速進入產品化和商業化驗證期。誰能把生成質量、生成速度、可控性和接入成本一起壓到可用區間,誰就更有機會進入真實內容生產鏈路。
可以說,春節前這一波密集發布,更像是新一輪視頻 AI 競速的發令槍。接下來,整個 AI 視頻模型領域的競速將會以肉眼可見的速度,迅速「開卷」。