前面三个专栏——《从零看懂大模型》、《从零看懂 AI Agent》、《AI 编程实战》——有个共同点:讲的全是"文字"。 但今天的 AI 早就不只会打字了:
它会画画、会看懂照片、会听会说、还能凭一句话生成一段视频。
这些"文字之外"的本事,统称多模态(multimodal)——"模态"就是信息的形式:文字、图像、声音、视频各算一种。这个专栏就来补上这一大块,把每种模态背后的原理讲成人话。
这个专栏适合谁
- 天天用 AI 画图、生成视频,好奇"它到底怎么做到的"的人;
- 想搞懂扩散模型、CLIP、文生视频这些词,又不想啃论文的开发者;
- 做内容、设计、产品,需要判断"多模态 AI 能干什么、还差在哪"的人。
不需要任何数学。看过《大模型专栏》会更顺,但不是前提。
目录
按"先看全貌 → 图像 → 声音 → 视频 → 融会贯通"的顺序编排:
什么是多模态——AI 从"只会文字"到"能看能听能画" 一个统一的直觉:不同模态,怎么被 AI 装进同一个"理解框架"。
AI 是怎么"画画"的——扩散模型的大白话原理 从一团噪点里"雕"出一张图——扩散模型的核心思想,出乎意料地好懂。
AI 是怎么"看懂"图片的——视觉理解与 CLIP 让文字和图像"说上同一种语言",是多模态的地基。
AI 与声音——语音识别、语音合成与音乐 AI 怎么把话变成字、把字变成声,甚至"克隆"一个人的嗓音。
文生视频——为什么它比生成图片难得多 Sora、Veo、Kling 惊艳全网,但它们要跨过的那道坎叫"时间一致性"。
多模态大模型——一个模型通吃文字、图片和声音 为什么最新的模型能一边看图一边听你说话、还张口就答。
一句话预告
如果整个专栏只留一句话,我希望是这句:
多模态 AI 的秘密,是把图像、声音、视频都翻译成模型能理解的同一种"内部语言"——一旦翻译成功,处理文字的那套本事,就能迁移到万物之上。
带着这句话,我们从第一篇开始。
本专栏基于 2026 年的公开资料整理,力求通俗准确。多模态领域进展极快,具体模型会不断刷新,但底层原理相对稳定——我们重点讲那些不会很快过时的东西。若有疏漏,欢迎指正。