機器之心專欄
QQ 瀏覽器搜索技術中心、騰訊 PCG ARC Lab
近年來,互聯網短小視頻內容的爆髮式增長,對視頻 - 文本檢索(Video-Text Retrieval)的能力提出了更高的要求。在 QQ 瀏覽器搜索中,視頻通常包含標題、封面圖、視頻幀、音頻等多種模態信息,因此視頻檢索模型引入了多模態特徵,以刻畫 query 與視頻在多個模態上的相關程度,並進行綜合排序,提升視頻搜索結果的整體滿意度。此外,QQ 瀏覽器還能根據用戶正在觀看的視頻內容,推薦用戶可能感興趣的搜索詞,推詞的挖掘、排序同樣需要模型對視頻多模態信息的有效利用。
在學術界,目前視頻檢索有兩種主流模型:
基於 CLIP 圖文預訓練的模型:代表工作為 CLIP4Clip,優點是成功地將圖文預訓練的知識遷移到視頻 - 文本檢索的任務中,不足是缺乏對視頻其他模態信息的利用;
基於多模態信息編碼的模型,代表工作為 MMT(Multi-Modal Transformer),優點是使用 transformer 將視頻的多種模態信息(物體、動作、場景、音頻等)進行聯合編碼;不足是將分布差異巨大的多模態特徵(embedding)輸入到一個黑盒(black box),不僅無法做到有效融合,也增加了模型訓練的難度。
由此,我們提出了一種既學習了圖文預訓練知識,又有效利用多模態標籤引導視覺 - 文本對齊的視頻檢索模型:TABLE(TAgging Before aLignmEnt)。
TABLE 模型在四個視頻 - 文本檢索的公開數據集上取得了 SOTA 的效果,相關研究已經被 AAAI 2023 錄用。
TABLE 的優勢
視頻 - 文本檢索是人工智慧領域非常重要的任務之一,任務關鍵在於視覺信息與文本信息在同一語義空間上的對齊。近年來,隨著大規模預訓練模型的提出,視頻檢索模型的性能得到了顯著提升。但當前大多數模型(如 CLIP4Clip、CLIP2VIDEO 等)只使用視覺模態進行檢索召回,視頻其他模態的信息沒有得到有效利用,因此召回的結果不管是在相關性還是多樣性上,都是有所欠缺的。
一些方法(如 MMT、MDMMT 等)嘗試使用多種任務上的預訓練模型(experts)提取多模態的 embedding,再用 transformer 結構對 embedding 進行融合。然而不同 experts 提取的 embedding 分布差異是巨大的,因此很難通過一個簡單的模塊就能完成多模態信息的融合。再者,這種黑盒融合的方式難以解釋,無法得知最終的輸出結果是否真的代表了多模態信息,還是只是引入了一些 「可學習的隨機輸入」。
針對以上問題,我們提出了一個新的以多模態標籤為引導的視頻 - 文本檢索模型:TABLE(TAgging Before aLignmEnt) 。TABLE 模型首先提取視頻各個模態的信息,在標籤域進行融合,融合的多模態標籤最終作為 anchor 促進視覺 - 文本的語義對齊。
我們使用多種預訓練 experts 模型進行多模信息的提取,包括物體、人物、場景、動作以及音頻。物體和人物信息聚焦視頻的局部或實體特徵;場景信息則關注視頻的整體、背景特徵;動作信息是視頻區別於圖像的重要特徵,其中包含的時序信息往往容易被忽略;音頻信息則提供了一些視覺以外的輔助信息。
為有效、高效地融合不同模態的信息,我們使用標籤域作為融合的橋樑,主要有以下兩點優勢:
不同 experts 生成的 embedding 難以互相融合,而標籤域的方式可以為不同模態信息生成統一、易解釋的表徵。
多模態標籤作為 anchor,可以迫使模型綜合學習視頻的局部特徵、全局特徵、時間特徵以及其他補充特徵。視頻的重要片段(時間)以及重要區域(空間)在多模態標籤的作用下得到凸顯,視頻 - 文本召回的整體效果便可以有所提升。
如圖一,通過目標檢測器,可以得到 "bowl、bottle" 等物體標籤以及 "woman" 的人物標籤;通過圖像分類器,可以得到 "kitchen" 的場景標籤;通過動作檢測器,可以得到 "cooking" 的動作標籤;最後,通過自動語音識別(Automatic Speech Recognition)以及關鍵詞提取,可以得到 "marinating a chicken" 等音頻標籤。上述標籤提供了來自視頻多個模態的豐富信息,作為視覺與文本之間交互的橋樑,可以使得對齊學習更加精確和高效。
圖一:多模態信息可以轉化為標籤促進視頻 - 文本的對齊。
如圖二,TABLE 模型包含四個編碼器:視覺編碼器、標籤編碼器、文本編碼器以及跨模態編碼器。其中,跨模態編碼聯合編碼多幀的視覺特徵以及多模態的標籤特徵,多模態標籤作為視覺 - 文本對齊的 anchor。此外,我們在模型訓練時引入了視頻文本匹配損失(Video Text Matching Loss,VTM)和掩碼語言模型損失(Masked Language Modeling,MLM)作為額外監督。相比以往方法,TABLE 的優勢可以總結如下:
不僅將圖文預訓練的知識遷移到視頻 - 文本檢索任務,而且充分利用了視頻的多模態信息,包括物體、人物、場景、動作、音頻;
多模態信息在標籤域上進行融合,得到了統一的表徵,可解釋性強,並且可以作為 anchor 促進視覺與文本在語義空間上的對齊;
對視頻多幀以及多模態標籤進行聯合編碼,並引入了 VTM 和 MLM 任務加強視覺 - 文本更細粒度的交互;
在 MSR-VTT、MSVD、LSMDC 和 DiDeMo 四個常用的視頻檢索數據集上取得 SOTA 的效果。
圖二:TABLE 模型的整體框架
模型細節
1、多模態標籤挖掘
TABLE 採用多種預訓模型用於提取視頻的多模態信息,如表一所示。為了儘可能地減小雜訊,每個模型中只有高置信的標籤得到保留。
表一:標籤挖掘中使用的具體模型
2、視覺與標籤、文本編碼器
視覺編碼器:採用 CLIP 中的 ViT 模型進行初始化。視頻幀序列表示為:
,則視覺編碼器的輸出可以表示為:
,N 表示視頻幀的數量。
標籤、文本編碼器:使用 CLIP 模型中的 BERT 模型進行初始化,兩個編碼器的 transformer 部分是共享參數的,但是線性投影層是相互獨立的。標籤、文本編碼器的輸出可以分別表示為:
,K 和 M 分別表示標籤、文本的 token 長度。
3、跨模態編碼器
如圖二,我們構建了一個以標籤為引導的跨模態編碼器。編碼器的輸入可以表示為:
,其中
表示標籤編碼器在 [EOS] 處的輸出,作為多模標籤的整體表徵。跨模態編碼器包含四層的 transformer 結構,採用 CLIP 文本編碼器的前四層進行初始化。跨模態編碼器對視覺信息和標籤信息進行了深度融合,同時由於視頻幀的有序輸入,模型還可以學習視頻的時序信息。其中,標籤信息作為引導,可以從嘈雜的視覺特徵中篩選出重要的視頻幀與視覺區域。跨模態編碼器的融合輸出可以表示為:
,然後我們採用池化層和殘差連接的方式,得到跨模融合的整體表徵:
,
是一個可學習的權重因子。
文本編碼端取 [EOS] 處的特徵作為標題的整體表徵,
。我們定義一個視頻 - 文本的相似函數:
為線性投影函數。最後,我們可以構建損失函數:
是一個可學習的溫度係數;B 是訓練批次大小;
分別代表文本到視頻、視頻到文本的對比損失函數;
是整體的對比損失。
4、額外監督
視頻文本匹配損失(VTM):將跨模態編碼器的輸出作為視頻的整體表徵,判定其與文本編碼器的輸出是否相匹配。視頻的整體表徵與文本特徵同時輸入到一個聯合編碼器中做進一步的融合,聯合編碼器與跨模態編碼器是共享參數的,在推斷時捨棄。取跨模態編碼器的首位特徵
作為視頻的整體表徵,文本特徵為
,預測的結果為
,則 VTM 的損失函數為:
t=0 表示正樣本對,t=1 表示負樣本對;
是一個符號函數,當 t=1 時值為 1,否則為 0;
為樣本對數。此處進行了難例挖掘,即相關性打分較高的負樣本有更大的概率被採樣。
掩碼語言模型損失(MLM):根據視頻的整體表徵以及標題上下文,預測標題中被遮擋的單詞。
表示受遮擋的文本,
表示遮擋單詞的預測結果,則 MLM 的損失函數為:
是一個符號函數,當第 i 個樣本的遮擋單詞為 v 時,值為 1,否則為 0;V 是詞表大小;Q 為樣本數量。
TABLE 模型的總體損失函數:
實驗評估
1、評估數據集:
MSR-VTT、MSVD、LSMDC、DiDeMo。
2、評估指標:
R@K:Recall at rank K,K=1,5,10,TOP-K 召回結果中包含正確結果的比例;
MdR:Median Rank,正確結果的排序中位數;
MnR:Mean Rank,正確結果的排序平均數。
3、與 SOTA 的性能對比
隨著 CLIP 等大規模預訓練模型的提出,視頻檢索模型的性能也實現了較大的突破。因此,在進行性能對比時,我們將現有方法分為 CLIP-based 和 NO-CLIP 的方法,可以看出,CLIP-based 的方法通常都會有更好的性能。例如,MMT 在 text-to-video 任務上的 R@1 僅為 26.6,而 CLIP4Clip 可以達到 43.1。
表二:MSR-VTT 數據集上的性能對比,* 表示使用了 CAMoE 中提出的推理策略。
如表二,TABLE 模型在 MSR-VTT 數據集上的表現超過了所有方法,取得了 SOTA 的效果。使用推理策略後,TABLE 在 text-to-video 任務上取得了 52.3 的 R@1,顯著提升了視頻檢索的效果。
表三:MSVD 數據集上的性能對比
如表三,TABLE 在 MSVD 數據集上同樣取得了 SOTA 的效果。我們認為在小樣本數據集上的訓練學習中,多模標籤的引導作用更為重要。
表四:LSMDC 數據集上的性能對比
LSMDC 數據集中包含了最多的視頻,且每個視頻只對應一個文本,因此大多數方法的表現都較差。TABLE 在這個數據集上稍微提升了一些分數,如表四所示。
表五:DiDeMo 數據集上的性能對比
在 DiDeMo 上,與其他方法一致,我們進行的是視頻 - 段落檢索任務,即將一個視頻對應的所有文本拼接為一個長文本。如表五,TABLE 在 text-to-video 的 R@1 指標上取得了 5.3 個百分點的顯著提升。該數據集的難點在於長視頻 - 長文本的對齊,這是因為長視頻包含很多無意義的片段,需要從中挑選有意義的幀和區域,而長文本中同樣需要找到關鍵句、關鍵詞。而 TABLE 模型中,多模態標籤就相當於一個對齊的 anchor,跨模態編碼器可以根據多模態標籤從複雜的視覺信息中凸顯出重要的視頻幀和空間區域,從而加強了視頻與文本的對齊,因此在該數據集上的增益明顯。
4、可視化結果分析
圖三:TABLE 模型的可視化結果。幀序列下方的顏色條表示每一幀的重要程度,而重要程度指的是與多模態標籤整體(a、b)或標題中的特定單詞(c、d)之間的相關性,由跨模態編碼器或聯合編碼器中的 cross attention 計算得到。每一幀中重要的空間區域進行了不同程度的高亮,由視覺編碼器中的 attention 計算得到。
圖三中對時間注意力和空間注意力同時進行了可視化。在 (a) 和 (b) 中,多模態特徵被視為一個整體,去計算與視覺特徵之間的 cross attention。如圖所示,cross attention 更加關注與多模態標籤高度相關的視頻幀,比如 (a) 中,第 1 幀(與 "man" 和 "ballplayer" 相關)與第 10 幀(與 "catching or throwing baseball" 和 "baseball glove" 相關)的權重是最大的。而在每一幀中,模型也聚焦到了一些重要的空間區域,如頭、軀幹、棒球手套等。雖然多模態標籤中可能包含一些雜訊,如 (a) 中的 "bird",但由於多模標籤是作為一個整體進行視覺注意力的引導,所以模型對於這些微弱的雜訊是比較魯棒的。此外,我們也發現,對於視頻檢索這項任務,動作標籤在 cross attention 中更加佔據主導性。例如,在 (b) 中,模型更加關注與 "dancing ballet" 高度相關的第 9 和 12 幀,而與場景、人物相關的幀則沒有獲得很高的權重。
此外,我們將聯合編碼器中的 cross attention 也進行了可視化。不同的是,這裡計算的是視覺特徵與標題中特定單詞向量之間的 cross attention。例如,在 (d) 中,第 10 幀和第 11 幀描述的是 "monkey" 的近景,因此在時間注意力上得到了凸顯,其他描述 "people" 或 "swimming" 的幀則相對而言被抑制。從這也可以看出,聯合編碼器可以對視頻與單個文本詞之間的細粒度相關性進行精準建模,這得益於 VTM 和 MLM 兩個輔助任務。
由於聯合編碼器與跨模態編碼器是共享參數的,因此可視化結果也進一步證明了跨模態編碼器的能力:它能夠在多模態標籤的引導下,從冗餘的視覺特徵中篩選出關鍵幀和關鍵區域,有利於視頻 - 文本的精準檢索。
TABLE 在 QQ 瀏覽器里的應用
為了滿足用戶在觀看視頻時的搜索需求,QQ 瀏覽器在視頻底部會以 「相關搜索」 的方式展現推詞,點擊推詞即可了解更多相關信息。
圖四:QQ 瀏覽器中的應用場景示例
推詞既要與視頻內容相關,又要能激發用戶的點擊需求。在相關性的排序上,需要考慮視頻多個模態的信息,如標題、視頻畫面、文字、音頻等。而 TABLE 模型可以結合多模態信息,輸出一個綜合打分,代表視頻內容與單條推詞的整體相關性。滿足相關性條件的推詞再經過一些其他的策略(如 ctr 預估、敏感詞打壓),就可以作為最終的展現結果。
作者團隊介紹
QQ 瀏覽器搜索技術中心團隊是騰訊 PCG 信息平台與服務線負責搜索技術研發的團隊,依託騰訊內容生態,通過用戶研究驅動產品創新,為用戶提供圖文、資訊、小說、長短視頻、服務等多方位的信息需求滿足。在演算法方面,以自然語言處理、深度學習、多模態理解與生成、知識計算與應用等技術為基礎,建設內容理解、相關性和排序、多模態搜索、智能問答、多語言翻譯、搜索推薦等技術方向,探索和應用業界先進技術、打造更優秀的用戶搜索體驗;在工程方面,建設搜索技術中台工業化系統,打磨高性能、高可用、低成本的百億級檢索系統,為騰訊 PCG 各個內容業務的搜索場景提供基礎的搜索引擎服務,當前已支持 QQ 瀏覽器、騰訊視頻、騰訊新聞、騰訊微視等 PCG 多條產品線。
騰訊 PCG ARC Lab 是騰訊 PCG 的 「偵察兵」、「特種兵」,站在騰訊探索挑戰智能媒體相關前沿技術的第一線。所屬的騰訊 PCG 是一個集社交、流量和內容平台於一體的大型事業群,業務需求覆蓋了人工智慧和大數據方面幾乎所有的技術。近兩年來 ARC Lab 秉持著做頂天(世界領先)立地(應用落地)的科研的宗旨,已吸引了一批優秀人才和國內外優秀實習生,已在國際頂會上發表 50 余篇論文,多項技術成果落地在實際應用中。