← 懂一点

文生视频——为什么它比生成图片难得多

2026-07-12

本文是专栏《从零看懂多模态 AI》第 5 篇。回到目录与导读。上一篇:AI 与声音

2024 年 OpenAI 的 Sora 一放出来就震了全网,之后 Google 的 Veo、快手的 Kling(可灵)等接连跟上。到 2026 年,凭一句话生成几秒到十几秒、以假乱真的视频,已经不稀奇了。

但一个自然的问题是:既然扩散模型已经能生成很棒的图片,视频不就是"很多张图片连起来"吗,能难到哪去?

恰恰是这个"连起来",藏着文生视频最难的那道坎。

视频 = 图片 + 时间

一段视频,本质是每秒放二三十张图片(帧)连成的。所以最朴素的想法是:让 AI 一张张生成图片,再拼起来不就成了?

试试就知道行不通。如果每帧都独立生成,会出现这种灾难:

第 1 帧:一只橘猫,趴在红沙发上
第 2 帧:一只三花猫,趴在棕沙发上   ← 猫和沙发都变了!
第 3 帧:猫突然多了一条腿           ← 鬼畜
...

因为每一帧都是独立"去噪"出来的,模型没理由让它们保持一致——画面会疯狂闪烁、物体乱变、人脸飘忽。 这就引出了视频生成的核心难题。

核心难题:时间一致性

视频生成真正难的,不是把单帧画好看(那图像模型早就会了),而是:

让画面在时间上"连贯"——同一个人从头到尾是同一张脸,沙发不会中途变色,动作符合物理、不鬼畜。

这个"跨帧保持连贯"的能力,业内叫时间一致性(temporal consistency)。它是区分"惊艳"和"辣眼睛"的分水岭,也是各家模型真正拼的地方。要做到它,AI 必须理解很多关于世界如何运转的常识

说白了,生成连贯视频,等于逼 AI 学会一点"物理世界的运行规律"。 这远比画好一张静态图难。

怎么解决:把时间也一起"去噪"

现代文生视频模型(多是扩散 + Transformer 的结合,叫"扩散 Transformer")的关键思路是:

不再一帧一帧单独生成,而是把整段视频(所有帧)当成一个整体,一起去噪。

回忆第 2 篇:图像生成是从"一张噪点图"去噪成一张图。视频生成则是从"一叠噪点帧"出发,让模型同时给所有帧去噪——而且在去噪时,让每一帧都能"看到"其他帧。

图像生成:  1 张噪点  →去噪→  1 张图

视频生成:  一叠噪点帧(比如 100 帧)
              │  ← 去噪时,各帧互相"参照",保持连贯
              ▼
            一段连贯的视频

关键就在"各帧互相参照":靠注意力机制,模型在生成第 50 帧时能"注意到"第 1 帧和第 100 帧,从而让猫始终是同一只猫、动作平滑衔接。时间维度被纳入了统一的去噪过程,一致性才有了保障。文字提示则和图像一样,全程当"导航",指引内容和运镜。

2026 年到了什么水平

到 2026 年,第一梯队各有所长(会持续刷新,看个大概):

共同的趋势是:时长更长、分辨率更高、画面更稳、越来越能"听懂"复杂运镜和情节。

还没解决的短板

再惊艳,文生视频到 2026 年仍有明显软肋,用的时候心里要有数:

小结

图像、声音、视频都拆完了。最后一篇把它们收拢:为什么最新的模型能一个脑子同时看图、听声、说话?下一篇讲多模态大模型。

继续阅读:多模态大模型——一个模型通吃文字、图片和声音