前提条件
确保 Audio Analytics 容器已部署并正在运行。有关设置说明,请参见运行 Audio Analytics 容器。可用模型
查询模型端点以获取可用的 TTS 模型和语音列表:
在合成请求中使用响应中的
name 值。
端点
合成语音
text(必需):要合成的文本model(必需):TTS 模型名称language(可选):语言代码(en、es、zh、de、it)voice(可选):语音名称(默认:default)sample_rate(可选):输出采样率 —44100、22050或16000Hz。如果与模型的原生采样率不同,音频将被重采样。parameters.speaking_rate(可选):语速倍率,例如"0.8"表示更慢,"1.5"表示更快。
TTS 返回的是原始 PCM,而非 WAV。请在播放前将其转换为 WAV。
语速
如果模型支持,可以调整语速,例如"0.8" 表示更慢,"1.5" 表示更快:
取消合成
停止正在进行的合成:关闭
合成完成后释放 TTS 资源:Python 示例
故障排除
PCM 无法播放: PCM 是原始音频。请在播放前将其转换为 WAV。 音频质量差: 尝试更高的采样率(44100 Hz),或检查输入文本中是否包含特殊字符。后续步骤
语音识别
在设备端将音频转录为文本
语言翻译
在设备端进行语言间文本翻译

