← 懂一点

AI 是怎么“看懂”图片的——视觉理解与 CLIP

2026-07-12

本文是专栏《从零看懂多模态 AI》第 3 篇。回到目录与导读。上一篇:AI 是怎么"画画"的

你拍一张照片问 AI:"这是什么品种的狗?"它答"金毛"。你截个图问:"这段报错什么意思?"它给你分析。AI 是怎么"看懂"图片的?

这一篇讲的是整个多模态的地基——因为无论是画图时的文本引导,还是看图说话,背后都要先解决一个根本问题:

怎么让"文字"和"图像"这两种完全不同的东西,说上同一种语言?

解决这个问题的功臣,是一个 2021 年的关键模型 CLIP。理解了它,多模态就通了一大半。

先说难在哪

文字是一串符号,图像是一堆像素,两者八竿子打不着。要让 AI 判断"这张图和'一只金毛'这句话搭不搭",你得先有个办法,把图和文放到同一个尺子上比较

回到第 1 篇的核心直觉:把两者都翻译成"含义向量",落进同一个坐标系。CLIP 就是那个翻译官。 但难点是:怎么训练出一个靠谱的翻译官,让"金毛照片"和"金毛文字"真的落在相近的坐标?

CLIP 的绝妙训练法:看图配文

CLIP 的办法简单得惊人:从互联网上扒来 4 亿组"图片 + 配文"(比如新闻图配的说明、商品图配的标题),让模型做一道'连连看'。

它内部有两个翻译官:一个把图片转成向量(图像编码器),一个把文字转成向量(文本编码器)。训练目标就一句话:

让"配对的"图和文,向量靠近;让"不配对的"图和文,向量远离。

一批图片:🐕金毛  🐈橘猫  🚗跑车
一批配文:"一只金毛" "一只橘猫" "一辆红色跑车"

训练时逼模型学会:
  🐕金毛 的向量  ←最近→ "一只金毛"
  🐈橘猫 的向量  ←最近→ "一只橘猫"
  (对角线配对,其余都推远)

在 4 亿组图文上反复做这道连连看,两个翻译官就被磨合到了同一个频道上:任何一张图、任何一句话,都能被翻译成可以直接比较的向量。 图文的鸿沟,就这么被填平了。

有了 CLIP,能干什么

一旦图和文进了同一个坐标系,很多能力顺理成章:

CLIP 本身不会说话、不会长篇分析,它只是个精准的"图文翻译对齐器"。但正是这块地基,撑起了上层更强的模型。

再上一层:会看图说话的多模态大模型

CLIP 解决了"对齐",但你问"这张图里的人为什么在笑",需要的是推理和表达——这得靠大模型(LLM)。于是自然的组合出现了,这类模型叫 VLM(视觉语言模型),思路是:

  1. 用一个视觉编码器(CLIP 那类)把图片转成一串"视觉 token"(图像的含义向量);
  2. 把这串视觉 token,当成一种"外语单词"喂给大模型,和你的文字问题拼在一起;
  3. 大模型用它处理文字那套注意力机制,一视同仁地"读"图和字,然后作答。
图片 → 视觉编码器 → 一串"视觉 token" ┐
                                     ├─→ 一起喂给大模型 → 生成回答
你的问题 "他为什么笑" → 文字 token   ┘

关键洞察在这里:对大模型来说,图片被翻译成 token 之后,和文字没有本质区别——都是一串向量。所以它处理文字的全部本领(理解、推理、表达),一下子就能用到图像上。这也解释了第 1 篇那句话:"翻译成同一种内部语言,文字的本事就能迁移到万物之上。"

几个要拎清的点

小结

图像讲完了,我们换一种模态——声音。AI 怎么把话听成字、把字念成声,甚至克隆一个人的嗓音?下一篇聊语音。

继续阅读:AI 与声音——语音识别、语音合成与音乐