← 懂一点

什么是多模态——AI 从“只会文字”到“能看能听能画”

2026-07-12

本文是专栏《从零看懂多模态 AI》第 1 篇。回到目录与导读

"多模态"这个词听着高级,其实拆开就一句话:

让 AI 不只处理文字,还能处理图像、声音、视频——甚至把它们混在一起理解。

"模态(modality)"就是信息的形式:一段文字是一种模态,一张照片是一种,一段录音、一段视频各是一种。只会一种的叫单模态,能跨多种的叫多模态。

你其实早就在用了:拍张照问 AI "这是什么植物"、对着手机说话让它转成文字、打一行字生成一张海报——这些都是多模态。这一篇不讲具体技术,先建立一个贯穿全专栏的核心直觉,有了它,后面每一篇都会变简单。

核心直觉:万物皆可翻译成"一串数字"

先回忆《大模型专栏》里的一个关键点:模型并不直接理解文字,它先把文字转成一串代表"含义"的数字——这串数字叫向量(embedding),可以理解为"语义坐标"。意思相近的词,坐标就相近。

多模态的全部魔法,就建立在一个大胆的推广上:

不只是文字,图像、声音、视频,统统都能被转成这种"含义向量"。

关键在于:如果训练得当,"金毛照片"的向量和"金毛"文字的向量,会落在相近的坐标上——因为它们讲的是同一件事。一旦不同模态被翻译进了同一个坐标系,AI 就能在它们之间自由"换算":

    文字 "一只狗" ┐
                 ├─→ 都翻译成 ──→ 同一个语义空间里相近的坐标
    狗的照片     ┘                (AI 于是"知道"它们是一回事)

这就是为什么 AI 能"看图说话"(图像坐标 → 附近的文字)、能"照文字画图"(文字坐标 → 对应的图像)。本质上,它是在同一张'语义地图'上,从一个模态走到另一个模态。

两个方向:理解 vs 生成

多模态的能力,可以按方向分成两大类,后面所有文章都逃不出这两类:

方向 干什么 例子 本专栏对应
理解(输入是多模态) 把图/声"读"成含义 看图问答、语音转文字、视频摘要 第 3、4 篇
生成(输出是多模态) 凭含义"造"出图/声/视频 文生图、语音合成、文生视频 第 2、4、5 篇

生成往往比理解更难,因为理解只要抓住要点,生成却要无中生有地补全所有细节(每一根毛、每一道光影)。这也是为什么"文生视频"是本专栏最难的一篇。

为什么这几年突然爆发?

多模态不是新概念,但 2023 年后突然"能打"了,主要靠三股合力:

  1. 统一的"翻译"技术成熟了:像 CLIP这类模型(第 3 篇细讲),第一次让图像和文字被稳定地翻译进同一个语义空间。
  2. 生成技术突破了扩散模型(第 2 篇)让"从噪点生成高质量图像"成为可能。
  3. 大模型的"通用理解力"可以迁移:处理文字那套强大的 Transformer,被证明同样能处理"图像块""音频片段"——换个输入,老办法照样灵。

三者叠加,AI 就从"话痨"进化成了"能看会听能画的多面手"。

小结

直觉建好了,我们从最惊艳、也最好懂的一块切入——AI 到底是怎么凭一句话,从一团噪点里"画"出一张图的?

继续阅读:AI 是怎么"画画"的——扩散模型的大白话原理