从Image2到Midjourney,一场血腥的技术哲学道统之争

2026年04月29日08:00:23 历史 7743
从Image2到Midjourney,一场血腥的技术哲学道统之争 - 天天要闻



生图标准,正在被重写



作者| 大先生

用image2几天后

我突然想到midjourney怎样了?


ai生图圈一直以来都有个都市传说:


💡新模型三天降智,五天没热度

然后大家回到原来的工作流,该用啥用啥


image2不一样,用了几天之后,我意识ai生图的价值判断标准开始变了。


image2带来的冲击不只在于“它也能画得好看”,而在于它把过去ai生图里最难受的几个问题,文字、局部修改、连续编辑、复杂指令执行、空间判断,做到了像素级别的可控性。


可控性在工作中,向来珍贵。


从Image2到Midjourney,一场血腥的技术哲学道统之争 - 天天要闻

提示词:女生位置向前移一步,在她身后增加光源,勾勒微光剪影,女生的额头的头发减少几根


然后,我脑子里突然冒出一个问题:


💡曾经的王者midjourney现在怎么样了?


midjourney不死只是凋零


如果你和我一样是2022、2023年入坑ai生图的人,midjourney几乎是你的第一站。


那种独特的、带着油画质感的美学风格,让无数人第一次感受到ai也能创作。它的商业模式也跑通了:纯靠订阅制,没有外部融资,david holz带着一个小团队,做到了年收入过亿美元的规模。


从Image2到Midjourney,一场血腥的技术哲学道统之争 - 天天要闻

相同提示词下,左:midjourney7右:image2


💡midjourney依然在美学上体现个性

image2能精准给出了文字信息


2022年2025年midjourney无论营收还是技术上,都是王者。

但在2025年之后,midjourney的处境就开始变得微妙:


从Image2到Midjourney,一场血腥的技术哲学道统之争 - 天天要闻


直到image2出现,把灵感抽卡,向精确生产推进了一大步。这背后,其实是一场技术哲学道统之争。


道统之争:扩散模型vs自回归模型


▌扩散模型:从混沌中召唤秩序


从噪声出发,一步步去噪,把秩序从虚无中凿出来。这套逻辑让扩散模型天生是美学动物,光影、构图、色彩自然协调,给它一个模糊意象,它还你一幅有灵魂的画。midjourney、sora、veo、seedance,所有叫得出名字的顶级模型,清一色是这个门派的信徒,统治ai视觉生成整整五年。


但正统有正统的原罪:文字是它永远无法愈合的伤口。这不是训练不够,是架构层面的基因缺陷,打多少补丁都治不好根。


从Image2到Midjourney,一场血腥的技术哲学道统之争 - 天天要闻


▌自回归模型:用理解来作画


gpt image2把图像当成一种语言,像写文章一样一个token一个token地画出来。于是文字变成母语、gpt-4o的整个大脑直接参与作画、局部修改精准如手术刀。


它有"想"这个动作,扩散模型只有"感觉"。


从Image2到Midjourney,一场血腥的技术哲学道统之争 - 天天要闻


扩散模型证明了机器可以有审美,自回归模型证明了机器可以有理解。midjourney的美学护城河还在,但正被一个问题侵蚀:当理解越来越强,感觉还值多少钱?


这场道统之争,在视频领域同样在上演:但有趣的是,阵营换了位置。


▌sora:openai的扩散模型视频


前几天被宣判死刑的sora采用的是dit(diffusion transformer)架构:扩散模型与transformer的结合体。


它的核心思路是:把视频压缩成时空patch(时空块),在潜空间(latent space)里做扩散去噪,最终还原出视频。sora曾经的优势是长视频、复杂场景、物理真实感,能生成超过1分钟的连贯视频,场景切换自然,物理规律遵循较好。但它访问受限、价格昂贵,且生成速度较慢。


从Image2到Midjourney,一场血腥的技术哲学道统之争 - 天天要闻


▌seedance2.0:bytedance的多模态扩散


seedance2.0,大概率基于dit扩散架构,但在此基础上做了一个关键突破:统一多模态音视频联合生成架构


它支持同时输入最多15路混合模态:9张图像+3段视频+3段音频+自然语言,一次性生成带有同步音效的视频。


更重要的是它的两个核心能力:

•identity locking(身份锁定):

通过"reference cluster(参考簇)"机制,将角色的面部特征、服装纹理绑定到生成输出,在角色运动过程中保持视觉一致性。

•物理仿真:

能生成双人花样滑冰的高难度动作序列,冰屑飞溅、服装随动、光影折射,严格遵循真实物理规律。


从Image2到Midjourney,一场血腥的技术哲学道统之争 - 天天要闻


▌两者核心差异对比


从Image2到Midjourney,一场血腥的技术哲学道统之争 - 天天要闻


有意思的是:在图像领域,openai用自回归颠覆了扩散模型的统治;在视频领域,双方都在用扩散模型竞争,差异在于多模态融合的深度和商业化的速度。


未来在哪里?


扩散模型和自回归模型的道统之争还远没有结束,他们之间的战场已经悄悄延伸到了下一世代:


📌生图:自回归将继续蚕食扩散模型的领地


gpt image2已经证明,自回归架构在精确控制、文字渲染、指令遵循上有结构性优势。随着推理速度的提升和模型压缩技术的成熟,自回归生图的速度劣势会逐步缩小。


未来的生图模型,很可能走向混合架构,用自回归做语义规划和布局,用扩散模型做细节渲染和美学优化,取两者之长。


📌生视频:扩散模型短期仍是主流,但自回归化是趋势


视频生成的核心难题是时序一致性——相邻帧之间的连贯性,扩散模型在这方面有天然优势。但随着自回归模型处理更长序列的能力增强,"把视频token化"的路线也在探索中。


openai已经在尝试用统一的自回归架构同时处理图像和视频token。这意味着未来可能出现一个模型,从同一个prompt直接输出静图、gif、短视频,由用户选择格式。


📌最终形态:多模态世界模型


无论扩散还是自回归,两条路最终都在走向同一个目标:


💡一个能够理解、创作、编辑整个视觉世界的多模态世界模型。

图像是它的一个输出切面,视频是另一个,3d场景、ar内容将是下一个。


当这一天到来,生图工具和生视频工具的分可能就会消失。

历史分类资讯推荐

探展日志|西汉错金铜豹“亮点”在眼珠 - 天天要闻

探展日志|西汉错金铜豹“亮点”在眼珠

“饰文焕彩——河北古代艺术珍品展”■展期:至5月12日■地点:中国美术馆19、20、21号厅■票价:免费一件西汉错金铜豹小巧玲珑,却造型生动,装饰华丽,堪比一件“高级珠宝”。豹作蜷卧状,昂首张口,长尾弯卷。身躯用金银错出梅花状豹斑,头、足和尾部作点状纹,口部涂朱。豹体内灌铅以增稳重,可作镇席、镇纸之用。这件...
美伊战事60天期限届满,特朗普宣称美伊战事“结束”出于哪些考量 - 天天要闻

美伊战事60天期限届满,特朗普宣称美伊战事“结束”出于哪些考量

5月1日,美国总统特朗普未经国会授权动用军事力量的“60天期限”届满。当天,特朗普致函国会,称美国与伊朗的敌对行动已“结束”,白宫无需寻求国会授权。但特朗普在面对记者时说漏了嘴,称自己在信函中刻意回避“战争”表述,实则明了相关行动“本应获得批准”。特朗普规避国会授权主要出于哪些考量?此做法是否为美方腾出...
赵少康拉朱立伦卢秀燕下水?蒋万安被逼表态军购案?不简单 - 天天要闻

赵少康拉朱立伦卢秀燕下水?蒋万安被逼表态军购案?不简单

当前,国民党内部,“开除韩国瑜”风暴持续发酵,因为国民党不处分季麟连,赵少康持续施压郑丽文,甚至直接针对郑丽文,已经有点儿挑战国民党中央的意味。就在这个时候,面对郑丽文的回击,质疑赵少康跳得太高,赵少康开始急踩刹车了,甚至想拉朱立伦卢秀燕下
吕媭:吕后的妹妹,看破吕氏死局,却终究没能逃过灭族之祸 - 天天要闻

吕媭:吕后的妹妹,看破吕氏死局,却终究没能逃过灭族之祸

前180年,长安城里刚办完吕后的丧事,吕家已经站在悬崖边。吕禄听信郦寄劝说,竟把北军兵权交了出去,还准备外出游猎。姑姑吕媭一听,极为愤怒,指责他身为将军却离军游猎,并把珠宝玉器全扔到堂下,意思很明白:别替别人守财了。可她看破了吕氏死局,却终
王曾:连中三元的状元宰相,一生低调,一心为公 - 天天要闻

王曾:连中三元的状元宰相,一生低调,一心为公

1002年,北宋京城开封,一个来自青州的年轻人王曾,把科举考场几乎“刷通关”了:解试第一、省试第一、殿试第一,连中三元。换成别人,恨不得敲锣打鼓告诉全天下;王曾却给叔父写信说,别太高兴,我只是祖上积德。这么低调的人,后来为何能两度拜相,又为