Skip to main content
TTS 服务使用完全在 Qualcomm NPU 上运行的设备端模型将文本转换为语音。音频以原始 PCM 格式通过 HTTP 分块传输编码返回。

前提条件

确保 Audio Analytics 容器已部署并正在运行。有关设置说明,请参见运行 Audio Analytics 容器

可用模型

查询模型端点以获取可用的 TTS 模型和语音列表:
当前可用的模型有: 在合成请求中使用响应中的 name 值。

端点

合成语音

参数:
  • text(必需):要合成的文本
  • model(必需):TTS 模型名称
  • language(可选):语言代码(eneszhdeit)
  • voice(可选):语音名称(默认:default)
  • sample_rate(可选):输出采样率 — 441002205016000 Hz。如果与模型的原生采样率不同,音频将被重采样。
  • parameters.speaking_rate(可选):语速倍率,例如 "0.8" 表示更慢,"1.5" 表示更快。
响应: 通过 HTTP 分块传输流式返回的原始 PCM 音频。
TTS 返回的是原始 PCM,而非 WAV。请在播放前将其转换为 WAV。

语速

如果模型支持,可以调整语速,例如 "0.8" 表示更慢,"1.5" 表示更快:

取消合成

停止正在进行的合成:

关闭

合成完成后释放 TTS 资源:

Python 示例

故障排除

PCM 无法播放: PCM 是原始音频。请在播放前将其转换为 WAV。 音频质量差: 尝试更高的采样率(44100 Hz),或检查输入文本中是否包含特殊字符。

后续步骤

语音识别

在设备端将音频转录为文本

语言翻译

在设备端进行语言间文本翻译