本文是专栏《从零看懂多模态 AI》第 4 篇。回到目录与导读。上一篇:AI 是怎么"看懂"图片的。
图像讲完,换一种我们每天都在用的模态:声音。语音输入、导航播报、有声书、AI 配音、AI 唱歌……背后是几项相互关联的技术。这一篇把它们串清楚。
声音这一模态主要分两个方向,正好对应第 1 篇说的"理解"和"生成":
- 听懂:声音 → 文字(语音识别);
- 说出:文字 → 声音(语音合成)。
先解决一个共同问题:声音怎么"数字化"
在讲听和说之前,得先知道 AI 眼里的声音长什么样。
声音本是空气的振动波。计算机会先把它切成极短的小片段,转成一种叫声谱图(spectrogram) 的东西——你可以理解成"声音的照片":横轴是时间,纵轴是音高,颜色深浅代表强弱。
一段"你好"的录音 → 转成声谱图(一张"声音的图片")
横轴:时间 →
纵轴:音高 ↑
(像热力图一样的图案)
这一步很关键:声音一旦变成"图",就能借用处理图像的那套办法来处理了。 这又一次呼应了全专栏的主题——换成统一的表示,老办法就能通用。
听懂:语音识别(ASR)
语音识别(ASR,把语音转成文字) 的现代做法,思路和看图说话如出一辙:
- 把录音转成声谱图(声音的"图");
- 用一个编码器把它转成"含义向量";
- 再解码成文字。
代表作是 OpenAI 的 Whisper 这类模型。它们之所以强,一是用了海量、多语言的真实录音训练,二是底层还是那个万能的 Transformer。效果好到什么程度?嘈杂环境、口音、多语种混说,很多场景已经接近甚至超过人类速记。
有意思的是:因为模型学的是"声音片段 → 对应文字"的规律,它有时也会幻觉——一段没人说话的空白录音,可能被它"脑补"出几个字。这仍是那个老问题。
说出:语音合成(TTS)
反过来,语音合成(TTS,把文字念成声音) 就是走另一个方向。有意思的是,它常常和画图用同一套思路:
- 先由模型根据文字,生成一张"声谱图"(声音的图)——很多现代 TTS 就用扩散模型或类似的生成技术来"画"这张声音图;
- 再由一个叫"声码器"的部件,把声谱图还原成你能听到的波形。
文字 "今天天气不错"
│ ← 模型据文字生成声谱图(像"画"一张声音图)
▼
声谱图 → 声码器还原 → 一段自然的人声
现代 TTS 的自然度已经很高——语气、停顿、情感都能带上,早不是十几年前那种机械的"电子音"了。
进阶:声音克隆与音乐生成
理解了上面两步,两个热门应用就好懂了:
① 声音克隆(voice cloning) 只要给模型几秒到几十秒某人的录音,它就能提取出这个人的"音色向量"(嗓音的独特指纹),之后合成任何文字时都套用这个音色——于是"用某人的声音读任意文本"成为可能。
⚠️ 这也带来严肃的伦理与安全问题:伪造他人声音进行诈骗、造假已有真实案例。听到"熟人语音"要求转账,务必另行核实——声音不再是身份的可靠凭证。
② 音乐生成 思路类似:把海量"文字描述 + 音乐"配对来训练,模型学会"'轻快的钢琴 lofi'这种描述 → 对应什么样的声音图案"。之后你打一句话,它就能生成整段配乐。人声歌唱、多乐器编曲,如今也都能生成。
声音、图像、文字,正在合流
你可能已经发现:语音识别、合成、音乐生成,用的其实是和图像、文字高度相通的那套办法——转成统一表示(声谱图/向量)、用 Transformer 处理、用扩散类技术生成。
这不是巧合。正因为各模态底层"套路"越来越统一,才有了下下篇要讲的多模态大模型——一个模型同时能听、能说、能看。你现在用的语音助手能"边听你说话边看你发的图还能对答如流",正是这种合流的结果。
小结
- 声音先被转成声谱图("声音的照片"),从此能借用处理图像的办法——统一表示是关键。
- 听懂(ASR):声谱图 → 向量 → 文字,代表如 Whisper;同样可能有幻觉。
- 说出(TTS):文字 → 生成声谱图(常用扩散类技术)→ 声码器还原成人声,自然度已很高。
- 声音克隆靠提取"音色指纹",几秒录音即可复刻——带来诈骗风险,声音不再是可靠身份凭证。
- 音乐生成同理:文字描述 → 对应声音图案。各模态套路趋同,正通向多模态大模型。
图像、声音都讲了,接下来是最难啃的一块——视频。为什么"文生视频"比生成一张图难得多?下一篇揭晓。
继续阅读:文生视频——为什么它比生成图片难得多