本文是专栏《从零看懂多模态 AI》第 1 篇。回到目录与导读。
"多模态"这个词听着高级,其实拆开就一句话:
让 AI 不只处理文字,还能处理图像、声音、视频——甚至把它们混在一起理解。
"模态(modality)"就是信息的形式:一段文字是一种模态,一张照片是一种,一段录音、一段视频各是一种。只会一种的叫单模态,能跨多种的叫多模态。
你其实早就在用了:拍张照问 AI "这是什么植物"、对着手机说话让它转成文字、打一行字生成一张海报——这些都是多模态。这一篇不讲具体技术,先建立一个贯穿全专栏的核心直觉,有了它,后面每一篇都会变简单。
核心直觉:万物皆可翻译成"一串数字"
先回忆《大模型专栏》里的一个关键点:模型并不直接理解文字,它先把文字转成一串代表"含义"的数字——这串数字叫向量(embedding),可以理解为"语义坐标"。意思相近的词,坐标就相近。
多模态的全部魔法,就建立在一个大胆的推广上:
不只是文字,图像、声音、视频,统统都能被转成这种"含义向量"。
- 一张"金毛犬"的照片 → 一串数字;
- "金毛犬"这三个字 → 一串数字;
- 一段狗叫的录音 → 一串数字。
关键在于:如果训练得当,"金毛照片"的向量和"金毛"文字的向量,会落在相近的坐标上——因为它们讲的是同一件事。一旦不同模态被翻译进了同一个坐标系,AI 就能在它们之间自由"换算":
文字 "一只狗" ┐
├─→ 都翻译成 ──→ 同一个语义空间里相近的坐标
狗的照片 ┘ (AI 于是"知道"它们是一回事)
这就是为什么 AI 能"看图说话"(图像坐标 → 附近的文字)、能"照文字画图"(文字坐标 → 对应的图像)。本质上,它是在同一张'语义地图'上,从一个模态走到另一个模态。
两个方向:理解 vs 生成
多模态的能力,可以按方向分成两大类,后面所有文章都逃不出这两类:
| 方向 | 干什么 | 例子 | 本专栏对应 |
|---|---|---|---|
| 理解(输入是多模态) | 把图/声"读"成含义 | 看图问答、语音转文字、视频摘要 | 第 3、4 篇 |
| 生成(输出是多模态) | 凭含义"造"出图/声/视频 | 文生图、语音合成、文生视频 | 第 2、4、5 篇 |
- 理解是"从丰富的形式里提取意思"——把一张照片压缩成"一只趴在沙发上的橘猫"。
- 生成是反过来"从意思里长出丰富的形式"——把"一只趴在沙发上的橘猫"变成一张具体的图。
生成往往比理解更难,因为理解只要抓住要点,生成却要无中生有地补全所有细节(每一根毛、每一道光影)。这也是为什么"文生视频"是本专栏最难的一篇。
为什么这几年突然爆发?
多模态不是新概念,但 2023 年后突然"能打"了,主要靠三股合力:
- 统一的"翻译"技术成熟了:像 CLIP这类模型(第 3 篇细讲),第一次让图像和文字被稳定地翻译进同一个语义空间。
- 生成技术突破了:扩散模型(第 2 篇)让"从噪点生成高质量图像"成为可能。
- 大模型的"通用理解力"可以迁移:处理文字那套强大的 Transformer,被证明同样能处理"图像块""音频片段"——换个输入,老办法照样灵。
三者叠加,AI 就从"话痨"进化成了"能看会听能画的多面手"。
小结
- 模态 = 信息的形式(文字/图像/声音/视频);能跨多种形式的 AI 就是多模态。
- 核心直觉:万物都能被翻译成"含义向量",落进同一个语义坐标系——一旦对齐,AI 就能在模态间自由换算(看图说话、照字画图)。
- 能力分两个方向:理解(形式→意思) 和 生成(意思→形式);生成通常更难,因为要无中生有补全细节。
- 爆发靠三股合力:统一翻译(CLIP)+ 生成突破(扩散模型)+ Transformer 的可迁移性。
直觉建好了,我们从最惊艳、也最好懂的一块切入——AI 到底是怎么凭一句话,从一团噪点里"画"出一张图的?