2024 年 OpenAI 的 Sora 一放出来就震了全网,之后 Google 的 Veo、快手的 Kling(可灵)等接连跟上。到 2026 年,凭一句话生成几秒到十几秒、以假乱真的视频,已经不稀奇了。
但一个自然的问题是:既然扩散模型已经能生成很棒的图片,视频不就是"很多张图片连起来"吗,能难到哪去?
恰恰是这个"连起来",藏着文生视频最难的那道坎。
视频 = 图片 + 时间
一段视频,本质是每秒放二三十张图片(帧)连成的。所以最朴素的想法是:让 AI 一张张生成图片,再拼起来不就成了?
试试就知道行不通。如果每帧都独立生成,会出现这种灾难:
第 1 帧:一只橘猫,趴在红沙发上
第 2 帧:一只三花猫,趴在棕沙发上 ← 猫和沙发都变了!
第 3 帧:猫突然多了一条腿 ← 鬼畜
...
因为每一帧都是独立"去噪"出来的,模型没理由让它们保持一致——画面会疯狂闪烁、物体乱变、人脸飘忽。 这就引出了视频生成的核心难题。
核心难题:时间一致性
视频生成真正难的,不是把单帧画好看(那图像模型早就会了),而是:
让画面在时间上"连贯"——同一个人从头到尾是同一张脸,沙发不会中途变色,动作符合物理、不鬼畜。
这个"跨帧保持连贯"的能力,业内叫时间一致性(temporal consistency)。它是区分"惊艳"和"辣眼睛"的分水岭,也是各家模型真正拼的地方。要做到它,AI 必须理解很多关于世界如何运转的常识:
- 物体有惯性:球抛出去是抛物线,不会凭空拐弯;
- 物体有恒常性:人走到柱子后面再出来,还是原来那个人;
- 光影、重力、液体流动……都得符合直觉。
说白了,生成连贯视频,等于逼 AI 学会一点"物理世界的运行规律"。 这远比画好一张静态图难。
怎么解决:把时间也一起"去噪"
现代文生视频模型(多是扩散 + Transformer 的结合,叫"扩散 Transformer")的关键思路是:
不再一帧一帧单独生成,而是把整段视频(所有帧)当成一个整体,一起去噪。
回忆第 2 篇:图像生成是从"一张噪点图"去噪成一张图。视频生成则是从"一叠噪点帧"出发,让模型同时给所有帧去噪——而且在去噪时,让每一帧都能"看到"其他帧。
图像生成: 1 张噪点 →去噪→ 1 张图
视频生成: 一叠噪点帧(比如 100 帧)
│ ← 去噪时,各帧互相"参照",保持连贯
▼
一段连贯的视频
关键就在"各帧互相参照":靠注意力机制,模型在生成第 50 帧时能"注意到"第 1 帧和第 100 帧,从而让猫始终是同一只猫、动作平滑衔接。时间维度被纳入了统一的去噪过程,一致性才有了保障。文字提示则和图像一样,全程当"导航",指引内容和运镜。
2026 年到了什么水平
到 2026 年,第一梯队各有所长(会持续刷新,看个大概):
- Sora 2(OpenAI):在物理模拟和时间一致性上领先——水流、火焰、重力、复杂物体交互,处理得比同类更自然。
- Kling 3.0(快手可灵):支持单次最长约 10 秒,在保持人物身份、场景连贯上很强;2026 年年中一度领跑公开的文生视频榜单。
- Veo 3.1(Google DeepMind):主打电影级画质,还能同步生成配套音频。
共同的趋势是:时长更长、分辨率更高、画面更稳、越来越能"听懂"复杂运镜和情节。
还没解决的短板
再惊艳,文生视频到 2026 年仍有明显软肋,用的时候心里要有数:
- 时长有限:多在十几秒量级,生成几分钟的连贯长片仍很难(越长越容易"崩")。
- 精细控制难:"让他在第 3 秒回头微笑"这种精确编排,还不好稳定实现。
- 物理仍会穿帮:复杂场景里,物体穿模、动作违反常识的情况还是会冒出来。
- 算力极贵:同时给成百上千帧去噪,消耗远超生成一张图——这也是它为什么慢、为什么贵。
小结
- 视频 = 图片 + 时间;难点不在画好单帧,而在跨帧连贯——即时间一致性。
- 每帧独立生成会导致画面闪烁、物体乱变;做好一致性,等于逼 AI 学会一点物理世界的常识(惯性、恒常性、光影重力)。
- 现代做法(扩散 Transformer)是把整段视频一起去噪,靠注意力让各帧互相参照,保持连贯;文字全程当导航。
- 2026 第一梯队:Sora 2(物理/一致性)、Kling 3.0(人物/时长)、Veo 3.1(画质+音频)。
- 短板仍在:时长有限、精细控制难、物理会穿帮、算力极贵。
图像、声音、视频都拆完了。最后一篇把它们收拢:为什么最新的模型能一个脑子同时看图、听声、说话?下一篇讲多模态大模型。