NeurIPS 2025 Spotlight | 條件表徵學習:一步對齊表徵與準則

2025年10月15日13:52:04 科技 1490

NeurIPS 2025 Spotlight | 條件表徵學習:一步對齊表徵與準則 - 天天要聞


本文第一作者為四川大學博士研究生劉泓麟,郵箱為[email protected],通訊作者為四川大學李雲帆博士後與四川大學彭璽教授。


一張圖片包含的信息是多維的。例如下面的圖 1,我們至少可以得到三個層面的信息:主體是大象,數量有兩頭,環境是熱帶稀樹草原(savanna)。然而,如果由傳統的表徵學習方法來處理這張圖片,比方說就將其送入一個在 ImageNet 上訓練好的 ResNet 或者 Vision Transformer,往往得到的表徵只會體現其主體信息,也就是會簡單地將該圖片歸為大象這一類別。這顯然是不合理的。


NeurIPS 2025 Spotlight | 條件表徵學習:一步對齊表徵與準則 - 天天要聞

圖 1:傳統表徵學習(上)與條件表徵學習(下)的比較。傳統的表徵學習方法只能學習到一種通用的表徵,忽略了其他有意義的信息;文章提出的條件表徵學習能夠基於指定準則,得到該準則下表現力更強的條件表徵,適應多種下游任務。


此外,在各大電商平台,用戶通常根據不同的標準(例如顏色、材質或場合)搜索商品。例如,用戶今天可能搜索 「紅色連衣裙」,明天搜索 「正裝」,後天搜索某個全新的關鍵詞。這對於擁有龐大規模商品的平台來說,手動打標籤是不現實的,而傳統的表徵學習也僅僅只能獲取到 「連衣裙」 這個層面的信息。


要獲取圖片中除了 「大象」、「連衣裙」 之外的信息,一個很容易想到的方法就是進行針對性的有監督訓練:基於不同的準則比如環境,進行額外的標註,再從頭訓練或者基於已有表徵訓練一個額外的線性層。但是基於這種方式,顯然是 「治標不治本」 的。因為一旦有了新的需求,便又需要進行針對性的數據收集、標註和訓練,需要付出大量的時間和人力成本。


很幸運的,我們處在多模態大模型的時代,這個在以前可能會很困難的問題在今天是有很多解法的。我們可以直接通過詢問 LLaVA,它便會告訴我們圖片在指定準則下的信息。但這種方式也還不夠高效,至少在 2025 年的今天,多模態大模型的使用成本還是需要考慮的。如果需要處理 ImageNet 之類的大規模數據集或者電商平台繁雜的商品,得到其在指定準則下的信息,這個開銷就比較大了。所以對大多數人來說,現如今要獲取圖片的多維信息,還是需要找到一個更加高效的方法。


NeurIPS 2025 Spotlight | 條件表徵學習:一步對齊表徵與準則 - 天天要聞


  • 論文標題:Conditional Representation Learning for Customized Tasks
  • 論文鏈接:https://arxiv.org/abs/2510.04564
  • 代碼鏈接:https://github.com/XLearning-SCU/2025-NeurIPS-CRL


方法


我們知道,對於三維直角坐標系,一組基,比如 [(1, 0, 0), (0, 1, 0), (0, 0, 1)],其線性組合即可構建出該坐標系中的任何向量。類似的,對於顏色體系,只需要 「紅」、「綠」、「藍」 三原色即可調出所有的顏色。


受此啟發,我們想到,是否對於任意一個給定的準則,也存在著一個對應的 「概念空間」 及其基?如果能在這個空間中找到一組基,那麼我們只需要將原始表徵投影到該空間上,理論上就能獲得在該準則下更具表現力和判別性的特徵。


找到給定準則對應的基,這聽起來有些困難。但沒關係,我們不需要很準確地找到,只需要接近它就好。


基於這個想法,論文提出了一種即插即用的條件表徵學習方法。如圖 2 所示,給定準則(例如 「顏色」),CRL 首先讓大語言模型 LLM 生成該準則相關的描述文本(例如 「紅色」,「藍色」 和 「綠色」 等)。隨後,CRL 將由 VLM 得到的通用圖片表徵,投影到由描述文本張成的空間中,得到該準則下的條件表徵。該表徵在指定的準則下表達更充分,並且具有更優的可解釋性,能有效適應下游定製化任務。


NeurIPS 2025 Spotlight | 條件表徵學習:一步對齊表徵與準則 - 天天要聞

圖 2:所提出的條件表徵學習(CRL)的總體框架。圖中以通用表徵空間(準則為隱式的 「形狀」)轉換到 「顏色」 準則空間為例。


直白地說,只需要將對齊的圖片和文本表徵,做個矩陣乘法就好了,甚至不需要訓練。復現難度約等於:


NeurIPS 2025 Spotlight | 條件表徵學習:一步對齊表徵與準則 - 天天要聞


實驗


分類和檢索任務是衡量表徵學習性能的兩個經典下游任務。論文在兩個分類任務(少樣本分類、聚類)和兩個檢索任務(相似度檢索、服裝檢索)上進行了充分的實驗驗證,部分實驗結果如下:


NeurIPS 2025 Spotlight | 條件表徵學習:一步對齊表徵與準則 - 天天要聞

圖 3:分類任務


NeurIPS 2025 Spotlight | 條件表徵學習:一步對齊表徵與準則 - 天天要聞

表 1:所提出的 CRL 在少樣本分類任務上的性能。


NeurIPS 2025 Spotlight | 條件表徵學習:一步對齊表徵與準則 - 天天要聞

表 2:所提出的 CRL 在聚類任務上的性能。


NeurIPS 2025 Spotlight | 條件表徵學習:一步對齊表徵與準則 - 天天要聞


NeurIPS 2025 Spotlight | 條件表徵學習:一步對齊表徵與準則 - 天天要聞

圖 4:相似度檢索任務。上為 「Focus on an object」(Focus),下為 「Change an Object」(Change)。


NeurIPS 2025 Spotlight | 條件表徵學習:一步對齊表徵與準則 - 天天要聞

表 3:所提出的 CRL 在相似度檢索任務上的性能。


NeurIPS 2025 Spotlight | 條件表徵學習:一步對齊表徵與準則 - 天天要聞

圖 5:服裝檢索任務。


NeurIPS 2025 Spotlight | 條件表徵學習:一步對齊表徵與準則 - 天天要聞

表 4:所提出的 CRL 在服裝檢索任務上的性能。


從上述結果中可以看出, CRL 可以作為一個即插即用的模塊,與現有多模態方法相結合,在不同準則下,其得到的條件表徵在下游任務中都取得了比原表徵更加優異的表現,性能甚至超過了對應領域的專用方法。更多實驗可參見論文。


總結


與傳統的表徵學習只得到單一的通用表徵不同,本文提出了條件表徵學習,通過獲取指定準則下的文本基,並將圖像表徵投影到該文本基張成的空間中,即可得到該準則下表現力更強的條件表徵,以更好地適應各種下游任務。

科技分類資訊推薦

引領科技豪華MPV新風尚 第二代騰勢D9西安車展亮相 - 天天要聞

引領科技豪華MPV新風尚 第二代騰勢D9西安車展亮相

兼具宜商氣度與家用溫情的科技豪華旗艦MPV,第二代騰勢D9迎來西安地區正式亮相。新車依託全球新能源MPV冠軍底蘊,以第二代刀片電池、雙閥雲輦-C、天神之眼5.0智駕等核心技術全面升級,兼顧商務體面與家庭舒適,為西北高端用戶帶來一站式全能出行解決方案。
採購禁入!科華數據材料造假被拒門外 - 天天要聞

採購禁入!科華數據材料造假被拒門外

本報(chinatimes.net.cn)記者胡雅文 北京報道這家趕上AI算力風口的公司,因投標材料造假,被相關採購方列入禁入名單兩年,其此前提出的複議申請也被正式駁回。相關採購平台近日發布公告,明確駁回科華數據股份有限公司(下稱「科華數據」,002335.SZ)此前提交的複議申請。早在一年前,科華數據已被認定在「信息通信樞紐...
快評樂道L80:15萬元級買大五座,這波值得沖? - 天天要聞

快評樂道L80:15萬元級買大五座,這波值得沖?

日前,樂道L80正式發布並開啟預售,其整車購買預售價為24.58萬元起,租電購買預售價則低至15.98萬元起。面對大型SUV市場「細分再細分」之競爭趨勢,這款樂道年度重磅新車都有哪些優勢?又能否成為「大五座SUV革新之作」?下面,圈哥就帶大家全方位感受。
成都直擊凱威德:純電全尺寸SUV的張揚與大氣 - 天天要聞

成都直擊凱威德:純電全尺寸SUV的張揚與大氣

4月22日,凱迪拉克以奧斯卡級盛典規格,將上海保利大劇院點亮為璀璨舞台,在品牌代言人倪妮與全場嘉賓的共同見證下,凱迪拉克全尺寸純電公路旗艦——凱威德耀然上市。新車共推出長續航四驅Pro、高性能四驅Ultra兩款配置,官方售價區間為46.88萬-50.88萬元。