强化学习让离散自回归生成方法重焕生机,轻松渲染长文本图像

2025年08月10日22:42:05 科技 1545



在图像生成领域,自回归(Autoregressive, AR)模型与扩散(Diffusion)模型之间的技术路线 之争始终未 曾停歇。 大语言模型(LLM)凭借其基于“预测下一个词元”的优雅范式,已在文本生成领域奠定了不可撼动的地位。然而,当这一范式被应用于视觉领域时,却暴露出诸多瓶颈:生成图像细节失真、语义理解偏差,尤其在复杂文本渲染任务中表现尤为乏力。目前,统一视觉理解和生成的主流研究工作在图像生成部分往往采用扩散模型来建模,使得视觉理解和生成任务依然只是松散的耦合在一起。


近日,腾讯混元团队的最新研究成果 X-Omni 模型 通过强化学习大幅提升了自回归图像生成方法的生成质量,这一模型能生成具有较高美学品质的图像,同时展现出强大的遵循指令和渲染长文本图像的能力。该模型已开源:


强化学习让离散自回归生成方法重焕生机,轻松渲染长文本图像 - 天天要闻


  • 论文链接:https://arxiv.org/pdf/2507.22058

  • GitHub链接:https://github.com/X-Omni-Team/X-Omni

  • 项目主页:https://x-omni-team.github.io

  • Hugging Face 模型:https://huggingface.co/collections/X-Omni/x-omni-models-6888aadcc54baad7997d7982

  • Hugging Face Space:https://huggingface.co/collections/X-Omni/x-omni-spaces-6888c64f38446f1efc402de7


强化学习让离散自回归生成方法重焕生机,轻松渲染长文本图像 - 天天要闻

图 1 对比主流闭源和开源模型的文字渲染效果


强化学习大幅提升

图像生成质量和指令遵循能力


基于离散自回归方法监督微调后图像生成的质量相对较低,表现为文本生成错误、身体特征失真以及无法遵循复杂指令。引入强化学习后,生成图像的审美质量逐渐提高,遵循指令的能力和渲染长文本的能力稳步提升。如图 2 所示,经过 200 步强化学习,X-Omni 模型展示了图像生成的高质量视觉效果、强大的遵循复杂指令的能力,以及准确渲染中英文长文本的能力。


强化学习让离散自回归生成方法重焕生机,轻松渲染长文本图像 - 天天要闻

图 2 经过 200 步强化学习,图像生成质量和指令跟随能力逐步提高


方法


整体架构


如图 3 所示,该框架是一个基于离散 token 的自回归模型,其中 tokenizer 采用 SigLIP2-VQ 方法构建,在离散 token 上运行一个扩散解码器生成最终的图像。这一设计使得图像理解和生成统一在离散自回归框架中,从而实现优雅的联合图像理解与生成。


强化学习让离散自回归生成方法重焕生机,轻松渲染长文本图像 - 天天要闻

3 X-Omni 整体网络架构


GRPO 强化学习方法


进行联合图像理解和生成的预训练和监督微调后,本文继续采用强化学习方法来提升图像生成能力。强化学习过程的整体流程如图 2 (a) 所示,由于采用离散自回归的方法,可以应用语言模型中较为成熟的 GRPO 方法来进行强化学习:


强化学习让离散自回归生成方法重焕生机,轻松渲染长文本图像 - 天天要闻


奖励系统


我们构建了一个综合性的奖励模型系统,其包含多个专门的模型,从人类美学偏好、文本 - 图像语义对齐以及文本渲染准确性等维度来评估图像生成质量。最终奖励分数通过各个奖励信号的加权融合得出。


  • 偏好分数 :采用 HPSv2 模型评估人类美学偏好。该模型在多种图像分布上均表现出优异的泛化能力,能够可靠地预测人类对生成图像的偏好排序。


  • U n ified Reward 分数 :引入 Unified Reward 对图像进行整体质量评估。该奖励函数将多维度质量指标聚合为一个统一的分数,为强化学习提供整体反馈。


  • 文本 - 图像语义对齐分数 :为确保输入提示和生成图像间的语义一致性,我们利用 Qwen2.5-VL-32B 来计算对齐奖励。借助该模型强大的图像理解能力,我们评估生成图像是否准确反映了提示描述的内容。对齐分数量化了文本描述和视觉内容之间的对应关系,鼓励生成与上下文相关的图像,同时最大限度地减少语义幻觉。


  • OCR 准确性分数 :文本渲染准确性是文本到图像生成中的一个关键挑战。对于需要在图像中生成文本的提示,我们联合 GOT-OCR 2.0 与 PaddleOCR 对生成图像进行双重 OCR 解析,计算文本渲染的准确性分数。该奖励信号为增强文本渲染能力提供了关键指导,使我们的模型能够可靠地生成清晰准确的文本。


实验结果


文本渲染能力评估:


强化学习让离散自回归生成方法重焕生机,轻松渲染长文本图像 - 天天要闻

表 1 在 OneIG-Bench 和 LongText-Bench 上与现有模型的比较


指令跟随能力评估:


强化学习让离散自回归生成方法重焕生机,轻松渲染长文本图像 - 天天要闻

2 DPG-Bench 上与现有模型的比较


强化学习让离散自回归生成方法重焕生机,轻松渲染长文本图像 - 天天要闻

表 3 在 GenEval 上与现有模型的比较


有意思的发现


不再需要分类器无关引导(C FG :传统 AR 图像模型严重依赖 CFG 来提升生成质量,这不仅增加了推理开销,也反映了模型自身生成分布的偏差。X-Omni 在推理时,其自回归部分 无需 CFG 即可生成高质量图像 ,这力证了其视觉与语言生成机制的高度统一与内在一致性。


强化学习让离散自回归生成方法重焕生机,轻松渲染长文本图像 - 天天要闻

图 4 主流 AR 模型对 CFG 的依赖比较


RL 在图像生成中的独特优势 :研究表明,在图像生成领域,强化学习的优化效果显著超越了监督微调(SFT)配合“N 选 1(Best-of-N)”的采样策略。这揭示了 RL 在处理高维、空间依赖复杂的图像数据时,能够提供更全面、更高效的优化信号。


更多例子


强化学习让离散自回归生成方法重焕生机,轻松渲染长文本图像 - 天天要闻


强化学习让离散自回归生成方法重焕生机,轻松渲染长文本图像 - 天天要闻

图 5 更多生成图像可视化举例


一个更统一、更强大、更优雅的全模态未来,正由离散自回归图像生成方法的复兴开启。

科技分类资讯推荐

引领科技豪华MPV新风尚 第二代腾势D9西安车展亮相 - 天天要闻

引领科技豪华MPV新风尚 第二代腾势D9西安车展亮相

兼具宜商气度与家用温情的科技豪华旗舰MPV,第二代腾势D9迎来西安地区正式亮相。新车依托全球新能源MPV冠军底蕴,以第二代刀片电池、双阀云辇-C、天神之眼5.0智驾等核心技术全面升级,兼顾商务体面与家庭舒适,为西北高端用户带来一站式全能出行解决方案。
采购禁入!科华数据材料造假被拒门外 - 天天要闻

采购禁入!科华数据材料造假被拒门外

本报(chinatimes.net.cn)记者胡雅文 北京报道这家赶上AI算力风口的公司,因投标材料造假,被相关采购方列入禁入名单两年,其此前提出的复议申请也被正式驳回。相关采购平台近日发布公告,明确驳回科华数据股份有限公司(下称“科华数据”,002335.SZ)此前提交的复议申请。早在一年前,科华数据已被认定在“信息通信枢纽...
快评乐道L80:15万元级买大五座,这波值得冲? - 天天要闻

快评乐道L80:15万元级买大五座,这波值得冲?

日前,乐道L80正式发布并开启预售,其整车购买预售价为24.58万元起,租电购买预售价则低至15.98万元起。面对大型SUV市场“细分再细分”之竞争趋势,这款乐道年度重磅新车都有哪些优势?又能否成为“大五座SUV革新之作”?下面,圈哥就带大家全方位感受。
成都直击凯威德:纯电全尺寸SUV的张扬与大气 - 天天要闻

成都直击凯威德:纯电全尺寸SUV的张扬与大气

4月22日,凯迪拉克以奥斯卡级盛典规格,将上海保利大剧院点亮为璀璨舞台,在品牌代言人倪妮与全场嘉宾的共同见证下,凯迪拉克全尺寸纯电公路旗舰——凯威德耀然上市。新车共推出长续航四驱Pro、高性能四驱Ultra两款配置,官方售价区间为46.88万-50.88万元。