強化學習讓離散自回歸生成方法重煥生機,輕鬆渲染長文本圖像

2025年08月10日22:42:05 科技 1545



在圖像生成領域,自回歸(Autoregressive, AR)模型與擴散(Diffusion)模型之間的技術路線 之爭始終未 曾停歇。 大語言模型(LLM)憑藉其基於「預測下一個詞元」的優雅範式,已在文本生成領域奠定了不可撼動的地位。然而,當這一範式被應用於視覺領域時,卻暴露出諸多瓶頸:生成圖像細節失真、語義理解偏差,尤其在複雜文本渲染任務中表現尤為乏力。目前,統一視覺理解和生成的主流研究工作在圖像生成部分往往採用擴散模型來建模,使得視覺理解和生成任務依然只是鬆散的耦合在一起。


近日,騰訊混元團隊的最新研究成果 X-Omni 模型 通過強化學習大幅提升了自回歸圖像生成方法的生成質量,這一模型能生成具有較高美學品質的圖像,同時展現出強大的遵循指令和渲染長文本圖像的能力。該模型已開源:


強化學習讓離散自回歸生成方法重煥生機,輕鬆渲染長文本圖像 - 天天要聞


  • 論文鏈接:https://arxiv.org/pdf/2507.22058

  • GitHub鏈接:https://github.com/X-Omni-Team/X-Omni

  • 項目主頁:https://x-omni-team.github.io

  • Hugging Face 模型:https://huggingface.co/collections/X-Omni/x-omni-models-6888aadcc54baad7997d7982

  • Hugging Face Space:https://huggingface.co/collections/X-Omni/x-omni-spaces-6888c64f38446f1efc402de7


強化學習讓離散自回歸生成方法重煥生機,輕鬆渲染長文本圖像 - 天天要聞

圖 1 對比主流閉源和開源模型的文字渲染效果


強化學習大幅提升

圖像生成質量和指令遵循能力


基於離散自回歸方法監督微調後圖像生成的質量相對較低,表現為文本生成錯誤、身體特徵失真以及無法遵循複雜指令。引入強化學習後,生成圖像的審美質量逐漸提高,遵循指令的能力和渲染長文本的能力穩步提升。如圖 2 所示,經過 200 步強化學習,X-Omni 模型展示了圖像生成的高質量視覺效果、強大的遵循複雜指令的能力,以及準確渲染中英文長文本的能力。


強化學習讓離散自回歸生成方法重煥生機,輕鬆渲染長文本圖像 - 天天要聞

圖 2 經過 200 步強化學習,圖像生成質量和指令跟隨能力逐步提高


方法


整體架構


如圖 3 所示,該框架是一個基於離散 token 的自回歸模型,其中 tokenizer 採用 SigLIP2-VQ 方法構建,在離散 token 上運行一個擴散解碼器生成最終的圖像。這一設計使得圖像理解和生成統一在離散自回歸框架中,從而實現優雅的聯合圖像理解與生成。


強化學習讓離散自回歸生成方法重煥生機,輕鬆渲染長文本圖像 - 天天要聞

3 X-Omni 整體網路架構


GRPO 強化學習方法


進行聯合圖像理解和生成的預訓練和監督微調後,本文繼續採用強化學習方法來提升圖像生成能力。強化學習過程的整體流程如圖 2 (a) 所示,由於採用離散自回歸的方法,可以應用語言模型中較為成熟的 GRPO 方法來進行強化學習:


強化學習讓離散自回歸生成方法重煥生機,輕鬆渲染長文本圖像 - 天天要聞


獎勵系統


我們構建了一個綜合性的獎勵模型系統,其包含多個專門的模型,從人類美學偏好、文本 - 圖像語義對齊以及文本渲染準確性等維度來評估圖像生成質量。最終獎勵分數通過各個獎勵信號的加權融合得出。


  • 偏好分數 :採用 HPSv2 模型評估人類美學偏好。該模型在多種圖像分布上均表現出優異的泛化能力,能夠可靠地預測人類對生成圖像的偏好排序。


  • U n ified Reward 分數 :引入 Unified Reward 對圖像進行整體質量評估。該獎勵函數將多維度質量指標聚合為一個統一的分數,為強化學習提供整體反饋。


  • 文本 - 圖像語義對齊分數 :為確保輸入提示和生成圖像間的語義一致性,我們利用 Qwen2.5-VL-32B 來計算對齊獎勵。藉助該模型強大的圖像理解能力,我們評估生成圖像是否準確反映了提示描述的內容。對齊分數量化了文本描述和視覺內容之間的對應關係,鼓勵生成與上下文相關的圖像,同時最大限度地減少語義幻覺。


  • OCR 準確性分數 :文本渲染準確性是文本到圖像生成中的一個關鍵挑戰。對於需要在圖像中生成文本的提示,我們聯合 GOT-OCR 2.0 與 PaddleOCR 對生成圖像進行雙重 OCR 解析,計算文本渲染的準確性分數。該獎勵信號為增強文本渲染能力提供了關鍵指導,使我們的模型能夠可靠地生成清晰準確的文本。


實驗結果


文本渲染能力評估:


強化學習讓離散自回歸生成方法重煥生機,輕鬆渲染長文本圖像 - 天天要聞

表 1 在 OneIG-Bench 和 LongText-Bench 上與現有模型的比較


指令跟隨能力評估:


強化學習讓離散自回歸生成方法重煥生機,輕鬆渲染長文本圖像 - 天天要聞

2 DPG-Bench 上與現有模型的比較


強化學習讓離散自回歸生成方法重煥生機,輕鬆渲染長文本圖像 - 天天要聞

表 3 在 GenEval 上與現有模型的比較


有意思的發現


不再需要分類器無關引導(C FG :傳統 AR 圖像模型嚴重依賴 CFG 來提升生成質量,這不僅增加了推理開銷,也反映了模型自身生成分布的偏差。X-Omni 在推理時,其自回歸部分 無需 CFG 即可生成高質量圖像 ,這力證了其視覺與語言生成機制的高度統一與內在一致性。


強化學習讓離散自回歸生成方法重煥生機,輕鬆渲染長文本圖像 - 天天要聞

圖 4 主流 AR 模型對 CFG 的依賴比較


RL 在圖像生成中的獨特優勢 :研究表明,在圖像生成領域,強化學習的優化效果顯著超越了監督微調(SFT)配合「N 選 1(Best-of-N)」的採樣策略。這揭示了 RL 在處理高維、空間依賴複雜的圖像數據時,能夠提供更全面、更高效的優化信號。


更多例子


強化學習讓離散自回歸生成方法重煥生機,輕鬆渲染長文本圖像 - 天天要聞


強化學習讓離散自回歸生成方法重煥生機,輕鬆渲染長文本圖像 - 天天要聞

圖 5 更多生成圖像可視化舉例


一個更統一、更強大、更優雅的全模態未來,正由離散自回歸圖像生成方法的復興開啟。

科技分類資訊推薦

引領科技豪華MPV新風尚 第二代騰勢D9西安車展亮相 - 天天要聞

引領科技豪華MPV新風尚 第二代騰勢D9西安車展亮相

兼具宜商氣度與家用溫情的科技豪華旗艦MPV,第二代騰勢D9迎來西安地區正式亮相。新車依託全球新能源MPV冠軍底蘊,以第二代刀片電池、雙閥雲輦-C、天神之眼5.0智駕等核心技術全面升級,兼顧商務體面與家庭舒適,為西北高端用戶帶來一站式全能出行解決方案。
採購禁入!科華數據材料造假被拒門外 - 天天要聞

採購禁入!科華數據材料造假被拒門外

本報(chinatimes.net.cn)記者胡雅文 北京報道這家趕上AI算力風口的公司,因投標材料造假,被相關採購方列入禁入名單兩年,其此前提出的複議申請也被正式駁回。相關採購平台近日發布公告,明確駁回科華數據股份有限公司(下稱「科華數據」,002335.SZ)此前提交的複議申請。早在一年前,科華數據已被認定在「信息通信樞紐...
快評樂道L80:15萬元級買大五座,這波值得沖? - 天天要聞

快評樂道L80:15萬元級買大五座,這波值得沖?

日前,樂道L80正式發布並開啟預售,其整車購買預售價為24.58萬元起,租電購買預售價則低至15.98萬元起。面對大型SUV市場「細分再細分」之競爭趨勢,這款樂道年度重磅新車都有哪些優勢?又能否成為「大五座SUV革新之作」?下面,圈哥就帶大家全方位感受。
成都直擊凱威德:純電全尺寸SUV的張揚與大氣 - 天天要聞

成都直擊凱威德:純電全尺寸SUV的張揚與大氣

4月22日,凱迪拉克以奧斯卡級盛典規格,將上海保利大劇院點亮為璀璨舞台,在品牌代言人倪妮與全場嘉賓的共同見證下,凱迪拉克全尺寸純電公路旗艦——凱威德耀然上市。新車共推出長續航四驅Pro、高性能四驅Ultra兩款配置,官方售價區間為46.88萬-50.88萬元。