← 懂一点

多模态大模型——一个模型通吃文字、图片和声音

2026-07-12

本文是专栏《从零看懂多模态 AI》第 6 篇(终篇)。回到目录与导读。上一篇:文生视频

前面几篇把图像、声音、视频拆开讲了。这最后一篇要把它们收拢到一起,回答一个你天天在体验的问题:

为什么现在的 AI 能一边看你拍的照片、一边听你说话、还能立刻用语音回答你?

答案就是这几年的大方向——多模态大模型:不再是"文字模型 + 外挂一个图像工具",而是一个模型,天生就同时懂文字、图像和声音

两种做法:拼装 vs 原生

让 AI"多才多艺",历史上有两条路。

做法一:拼装(模块化)

早期的思路是搭积木:一个专门的语音识别模型负责把话转成字,转好的字丢给文字大模型处理,再让一个语音合成模型把回答念出来。

你说话 → [语音识别] → 文字 → [文字大模型] → 文字 → [语音合成] → AI 说话

这能用,但有硬伤:每一次"翻译"都在丢信息。 语音一旦转成纯文字,你的语气、情绪、是不是在笑、背景有没有噪音就全丢了。模型看到的只是干巴巴的字,自然也听不出你的言外之意、答不出"你听起来有点急"。

做法二:原生多模态(一个脑子)

新一代的思路(以 GPT-4o 这类模型为标志)更彻底:让同一个模型,从一开始就直接"吃"各种模态,中间不做有损翻译。

秘诀还是第 1 篇那个核心直觉——万物皆可转成 token(含义向量)

一旦全都变成 token,对模型来说它们就是同一种东西,可以混在一个序列里,一起丢进那套万能的注意力机制

你发来: [图片token][图片token] "这是什么" [语音token 带着你的语气]
              │
              ▼  同一个大模型,一视同仁地处理这串混合 token
              ▼
回答: 可以是文字,也可以直接是 [音频token] → 说出来

因为语气、情绪没有在中途被翻译丢掉,模型能捕捉到它们,于是才有了那种"它好像真的在听你说话"的自然体验——延迟低、能被打断、听得出情绪。这就是"拼装"和"原生"的本质差别。

为什么"统一"能带来质变

把各模态揉进一个模型,好处不只是"方便",而是能力上的质变:

一句话:统一表示让"处理文字的那身本事",一次性长到了所有感官上。

它把前面几篇串成了一条线

回头看,整个专栏其实在讲同一件事的不同侧面:

篇目 讲的模态/能力 共同的底层逻辑
第 1 篇 总纲:万物转向量 统一到同一个语义空间
第 2 篇 图像生成 去噪 + 文本导航
第 3 篇 图像理解 CLIP 对齐图文
第 4 篇 声音 声音转成"图"再统一处理
第 5 篇 视频 整段一起去噪保一致
第 6 篇 全部融合 全变 token,一个脑子通吃

贯穿始终的,就是导读里那句话:把万物翻译成同一种"内部语言",处理文字的本事就能迁移到万物之上。多模态 AI 的全部魔法,几乎都从这一句里长出来。

短板与提醒

再强,也要拎清它的边界:

小结


《从零看懂多模态 AI》到此收尾。加上另外三个专栏——《从零看懂大模型》《从零看懂 AI Agent》《AI 编程实战》——我们从"模型怎么想",走到了"怎么让它干活""怎么和它写代码""怎么让它能看会听能画"。四条线拼在一起,希望能帮你把今天的 AI,看成一个原理清晰、边界明确、可以放心上手的工具。