本文是专栏《从零看懂多模态 AI》第 3 篇。回到目录与导读。上一篇:AI 是怎么"画画"的。
你拍一张照片问 AI:"这是什么品种的狗?"它答"金毛"。你截个图问:"这段报错什么意思?"它给你分析。AI 是怎么"看懂"图片的?
这一篇讲的是整个多模态的地基——因为无论是画图时的文本引导,还是看图说话,背后都要先解决一个根本问题:
怎么让"文字"和"图像"这两种完全不同的东西,说上同一种语言?
解决这个问题的功臣,是一个 2021 年的关键模型 CLIP。理解了它,多模态就通了一大半。
先说难在哪
文字是一串符号,图像是一堆像素,两者八竿子打不着。要让 AI 判断"这张图和'一只金毛'这句话搭不搭",你得先有个办法,把图和文放到同一个尺子上比较。
回到第 1 篇的核心直觉:把两者都翻译成"含义向量",落进同一个坐标系。CLIP 就是那个翻译官。 但难点是:怎么训练出一个靠谱的翻译官,让"金毛照片"和"金毛文字"真的落在相近的坐标?
CLIP 的绝妙训练法:看图配文
CLIP 的办法简单得惊人:从互联网上扒来 4 亿组"图片 + 配文"(比如新闻图配的说明、商品图配的标题),让模型做一道'连连看'。
它内部有两个翻译官:一个把图片转成向量(图像编码器),一个把文字转成向量(文本编码器)。训练目标就一句话:
让"配对的"图和文,向量靠近;让"不配对的"图和文,向量远离。
一批图片:🐕金毛 🐈橘猫 🚗跑车
一批配文:"一只金毛" "一只橘猫" "一辆红色跑车"
训练时逼模型学会:
🐕金毛 的向量 ←最近→ "一只金毛"
🐈橘猫 的向量 ←最近→ "一只橘猫"
(对角线配对,其余都推远)
在 4 亿组图文上反复做这道连连看,两个翻译官就被磨合到了同一个频道上:任何一张图、任何一句话,都能被翻译成可以直接比较的向量。 图文的鸿沟,就这么被填平了。
有了 CLIP,能干什么
一旦图和文进了同一个坐标系,很多能力顺理成章:
- 零样本分类:给一张图,拿它的向量去和"金毛""橘猫""跑车"等一堆文字向量比,哪个最近就是哪个——不用为每个新类别专门训练。
- 以文搜图 / 以图搜文:搜索框里打"海边日落",就去找向量最接近的图片。你相册和网盘的"智能搜索"多半就靠这个。
- 给扩散模型当导航:上一篇说的"文本引导去噪",那个把提示词转成向量的文本编码器,很多时候正是 CLIP。
CLIP 本身不会说话、不会长篇分析,它只是个精准的"图文翻译对齐器"。但正是这块地基,撑起了上层更强的模型。
再上一层:会看图说话的多模态大模型
CLIP 解决了"对齐",但你问"这张图里的人为什么在笑",需要的是推理和表达——这得靠大模型(LLM)。于是自然的组合出现了,这类模型叫 VLM(视觉语言模型),思路是:
- 用一个视觉编码器(CLIP 那类)把图片转成一串"视觉 token"(图像的含义向量);
- 把这串视觉 token,当成一种"外语单词"喂给大模型,和你的文字问题拼在一起;
- 大模型用它处理文字那套注意力机制,一视同仁地"读"图和字,然后作答。
图片 → 视觉编码器 → 一串"视觉 token" ┐
├─→ 一起喂给大模型 → 生成回答
你的问题 "他为什么笑" → 文字 token ┘
关键洞察在这里:对大模型来说,图片被翻译成 token 之后,和文字没有本质区别——都是一串向量。所以它处理文字的全部本领(理解、推理、表达),一下子就能用到图像上。这也解释了第 1 篇那句话:"翻译成同一种内部语言,文字的本事就能迁移到万物之上。"
几个要拎清的点
- 看得懂 ≠ 看得准:VLM 可能把图里的字认错、把数错、把不存在的东西"看"出来——这是幻觉在图像上的翻版。看图给的信息,重要的仍要核实。
- 看图理解 和 画图生成 是两码事:本篇讲的是"图→意思"(理解,用 CLIP/VLM);上一篇讲的是"意思→图"(生成,用扩散模型)。方向相反,别混。
- 细节分辨率有限:把高清大图压成有限的视觉 token,难免丢细节。问它图中极小的字、很密的表格,容易翻车。
小结
- 视觉理解的地基问题是:让文字和图像说同一种语言——即翻译进同一个语义坐标系。
- CLIP 用"4 亿组图文连连看"训练出图像、文本两个对齐的编码器,让配对的图文向量靠近,填平了图文鸿沟。
- 有了 CLIP:零样本分类、以文搜图、给扩散模型当导航都顺理成章。
- 更强的 VLM(视觉语言模型) 把图片转成"视觉 token"喂给大模型,于是处理文字的推理表达本事,迁移到了看图上。
- 注意:看得懂不等于看得准,图像信息同样会有幻觉,细节也受分辨率限制。
图像讲完了,我们换一种模态——声音。AI 怎么把话听成字、把字念成声,甚至克隆一个人的嗓音?下一篇聊语音。
继续阅读:AI 与声音——语音识别、语音合成与音乐