Skip to main content
TTS 服务使用完全运行在 Qualcomm NPU 上的端侧模型将文本转换为语音。音频通过 HTTP 分块传输编码以原始 PCM 形式返回。

前提条件

请确保 Audio Analytics 容器已部署并正在运行。有关设置说明,请参阅运行 Audio Analytics 容器。

可用模型

查询 models 端点以获取可用的 TTS 模型和语音列表:
当前可用的模型如下: 在合成请求中,使用响应中返回的 name 值。

端点

合成语音

参数:
  • text(必填):要合成的文本
  • model(必填):TTS 模型名称
  • language(可选):语言代码(en、es、zh、de、it)
  • voice(可选):语音名称(默认:default)
  • sample_rate(可选):输出采样率 — 44100、22050 或 16000 Hz。如果与模型的原生采样率不同,则会对音频进行重采样。
  • parameters.speaking_rate(可选):语速倍率,例如 "0.8" 表示更慢,"1.5" 表示更快。
响应: 通过 HTTP 分块传输流式返回的原始 PCM 音频。
TTS 返回的是原始 PCM,而不是 WAV。播放前请将其转换为 WAV。

语速

如果模型支持,可调整语速,例如 "0.8" 表示更慢或 "1.5" 表示更快:

取消合成

停止正在进行的合成:

关闭

完成合成后释放 TTS 资源:

Python 示例

疑难解答

PCM 无法播放: PCM 是原始音频。播放前请将其转换为 WAV。 音频质量差: 尝试更高的采样率(44100 Hz),或检查输入文本中是否包含特殊字符。

后续步骤

语音识别

在端侧将音频转录为文本

语言翻译

在端侧对文本进行语言之间的翻译