text-to-speech
概念词 📚 基础词库 · 存量热词语音合成
🔍 Google 联想 10 📄 arxiv 2423 篇 📅 首次出现 2026-08-28
🧠 text-to-speech 是什么
文本转语音(text-to-speech,TTS)是让机器"开口说话"的经典人机交互技术:输入文字,输出可听的语音。技术历经拼接合成、参数合成,到 2016 年后基于神经网络的端到端合成(WaveNet、Tacotron 2),自然度与流畅度实现质变。
现代 TTS 以自回归、扩散或编解码语言模型为核心,配合神经声码器输出高保真音频;2023 年以来,流式低延迟、情感控制与多语言多音色成为产品竞争焦点,各云厂商均提供 TTS API。
中文 TTS 生态在长文本朗读、方言与声音复刻上成熟度高;TTS 与 LLM 结合的"语音对话"体验,正成为 AI 陪伴、客服与车载交互的新形态。
🔥 为什么现在火
短视频配音、语音助手、无障碍阅读与车载场景需求持续扩张;语音交互被普遍视为大模型之后的下一个交互入口,带动 TTS 持续升温。
📄 证据链(交叉验证)
- ▸维基百科:Speech synthesis(语音合成)
- ▸arXiv 论文《Natural TTS Synthesis by Conditioning WaveNet on Mel Spectrogram Predictions》(Tacotron 2)
🔍 搜索形态
what is text-to-speech what is TTS
text-to-speech 常见问题 FAQ
TTS 和语音识别(ASR)是什么关系?+
方向相反:ASR 把语音转成文字,TTS 把文字转成语音,两者组合可构成完整的语音对话闭环。
TTS 声音为什么越来越像真人?+
大规模多说话人训练数据、神经声码器与韵律建模让音色、语调和停顿都更接近人类自然发音。
与 text-to-speech 相关的搜索
人们搜索 text-to-speech 时,还会关心这些问题:
- 语音合成 是什么
- 什么是 语音合成
- 语音合成 是什么意思
- 语音合成 原理
- 语音合成 有什么用
- 语音合成 应用场景
- 语音合成 为什么火
- 语音合成 2026