← 懂一点

AI 与声音——语音识别、语音合成与音乐

2026-07-12

本文是专栏《从零看懂多模态 AI》第 4 篇。回到目录与导读。上一篇:AI 是怎么"看懂"图片的

图像讲完,换一种我们每天都在用的模态:声音。语音输入、导航播报、有声书、AI 配音、AI 唱歌……背后是几项相互关联的技术。这一篇把它们串清楚。

声音这一模态主要分两个方向,正好对应第 1 篇说的"理解"和"生成":

先解决一个共同问题:声音怎么"数字化"

在讲听和说之前,得先知道 AI 眼里的声音长什么样。

声音本是空气的振动波。计算机会先把它切成极短的小片段,转成一种叫声谱图(spectrogram) 的东西——你可以理解成"声音的照片":横轴是时间,纵轴是音高,颜色深浅代表强弱。

一段"你好"的录音  →  转成声谱图(一张"声音的图片")
                      横轴:时间 → 
                      纵轴:音高 ↑
                      (像热力图一样的图案)

这一步很关键:声音一旦变成"图",就能借用处理图像的那套办法来处理了。 这又一次呼应了全专栏的主题——换成统一的表示,老办法就能通用。

听懂:语音识别(ASR)

语音识别(ASR,把语音转成文字) 的现代做法,思路和看图说话如出一辙:

  1. 把录音转成声谱图(声音的"图");
  2. 用一个编码器把它转成"含义向量";
  3. 再解码成文字。

代表作是 OpenAI 的 Whisper 这类模型。它们之所以强,一是用了海量、多语言的真实录音训练,二是底层还是那个万能的 Transformer。效果好到什么程度?嘈杂环境、口音、多语种混说,很多场景已经接近甚至超过人类速记。

有意思的是:因为模型学的是"声音片段 → 对应文字"的规律,它有时也会幻觉——一段没人说话的空白录音,可能被它"脑补"出几个字。这仍是那个老问题

说出:语音合成(TTS)

反过来,语音合成(TTS,把文字念成声音) 就是走另一个方向。有意思的是,它常常和画图用同一套思路:

文字 "今天天气不错"
   │  ← 模型据文字生成声谱图(像"画"一张声音图)
   ▼
声谱图  →  声码器还原  →  一段自然的人声

现代 TTS 的自然度已经很高——语气、停顿、情感都能带上,早不是十几年前那种机械的"电子音"了。

进阶:声音克隆与音乐生成

理解了上面两步,两个热门应用就好懂了:

① 声音克隆(voice cloning) 只要给模型几秒到几十秒某人的录音,它就能提取出这个人的"音色向量"(嗓音的独特指纹),之后合成任何文字时都套用这个音色——于是"用某人的声音读任意文本"成为可能。

⚠️ 这也带来严肃的伦理与安全问题:伪造他人声音进行诈骗、造假已有真实案例。听到"熟人语音"要求转账,务必另行核实——声音不再是身份的可靠凭证。

② 音乐生成 思路类似:把海量"文字描述 + 音乐"配对来训练,模型学会"'轻快的钢琴 lofi'这种描述 → 对应什么样的声音图案"。之后你打一句话,它就能生成整段配乐。人声歌唱、多乐器编曲,如今也都能生成。

声音、图像、文字,正在合流

你可能已经发现:语音识别、合成、音乐生成,用的其实是和图像、文字高度相通的那套办法——转成统一表示(声谱图/向量)、用 Transformer 处理、用扩散类技术生成。

这不是巧合。正因为各模态底层"套路"越来越统一,才有了下下篇要讲的多模态大模型——一个模型同时能听、能说、能看。你现在用的语音助手能"边听你说话边看你发的图还能对答如流",正是这种合流的结果。

小结

图像、声音都讲了,接下来是最难啃的一块——视频。为什么"文生视频"比生成一张图难得多?下一篇揭晓。

继续阅读:文生视频——为什么它比生成图片难得多