← 懂一点

专栏《从零看懂多模态 AI》:目录与导读

2026-07-12

前面三个专栏——《从零看懂大模型》《从零看懂 AI Agent》《AI 编程实战》——有个共同点:讲的全是"文字"。 但今天的 AI 早就不只会打字了:

它会画画、会看懂照片、会听会说、还能凭一句话生成一段视频。

这些"文字之外"的本事,统称多模态(multimodal)——"模态"就是信息的形式:文字、图像、声音、视频各算一种。这个专栏就来补上这一大块,把每种模态背后的原理讲成人话。

这个专栏适合谁

不需要任何数学。看过《大模型专栏》会更顺,但不是前提。

目录

按"先看全貌 → 图像 → 声音 → 视频 → 融会贯通"的顺序编排:

  1. 什么是多模态——AI 从"只会文字"到"能看能听能画" 一个统一的直觉:不同模态,怎么被 AI 装进同一个"理解框架"。

  2. AI 是怎么"画画"的——扩散模型的大白话原理 从一团噪点里"雕"出一张图——扩散模型的核心思想,出乎意料地好懂。

  3. AI 是怎么"看懂"图片的——视觉理解与 CLIP 让文字和图像"说上同一种语言",是多模态的地基。

  4. AI 与声音——语音识别、语音合成与音乐 AI 怎么把话变成字、把字变成声,甚至"克隆"一个人的嗓音。

  5. 文生视频——为什么它比生成图片难得多 Sora、Veo、Kling 惊艳全网,但它们要跨过的那道坎叫"时间一致性"。

  6. 多模态大模型——一个模型通吃文字、图片和声音 为什么最新的模型能一边看图一边听你说话、还张口就答。

一句话预告

如果整个专栏只留一句话,我希望是这句:

多模态 AI 的秘密,是把图像、声音、视频都翻译成模型能理解的同一种"内部语言"——一旦翻译成功,处理文字的那套本事,就能迁移到万物之上。

带着这句话,我们从第一篇开始。


本专栏基于 2026 年的公开资料整理,力求通俗准确。多模态领域进展极快,具体模型会不断刷新,但底层原理相对稳定——我们重点讲那些不会很快过时的东西。若有疏漏,欢迎指正。