Skip to main content
Whisper 是 OpenAI 的通用自动语音识别(ASR)模型。您可以将其用于音频转录、翻译和语言识别。您可以使用 Qualcomm 的 VoiceAI ASR 在 Dragonwing 开发板的 NPU 上运行 Whisper,或使用 whisper.cpp 在 CPU 上运行。

使用 VoiceAI ASR 在 NPU 上运行 Whisper

1. 安装 SDK

  1. 在开发板上打开终端,并为此示例设置基本依赖:
  2. 安装 AI Runtime SDK - Community Edition:
  3. 安装 VoiceAI ASR - Community Edition:

2. 从 AI Hub 下载模型

安装好 SDK 后,您可以从 AI Hub 下载预编译的 Whisper 模型。下载模型时,请选择以下设备:
  • RB3 Gen 2 Vision Kit:‘Qualcomm QCS6490 (Proxy)’
  • RUBIK Pi 3:‘Qualcomm QCS6490 (Proxy)’
  • IQ-9075 EVK:‘Qualcomm QCS9075 (Proxy)’
下载后,将编码器模型重命名为 encoder_model_htp.bin,将解码器模型重命名为 decoder_model_htp.bin 要在开发板上直接下载 Whisper-Small-Quantized 模型:
  • RB3 Gen 2 Vision Kit / Rubik Pi 3:
  • IQ-9075 EVK:

3. 编译并运行示例

  1. 构建 npu_rpc_linux_sample/voice-ai-ref 示例:
  2. 现在您可以转录 .WAV 文件:
  3. 甚至可以进行实时转录: a. 将麦克风连接到开发板。 b. 找到麦克风的名称:
    1. 运行实时转录:
当 VAD 判断没有语音后,实时转录会立即报错退出,希望这一问题会在未来的更新中得到修复。
🚀 您现在可以在开发板上完全离线地转录音频了!VoiceAI ASR 没有面向高级语言(如 Python)的绑定,因此如果您想在应用程序中使用 Whisper,最简单的方法是直接启动 voice-ai-ref 二进制文件,并从 stdout 读取数据。

使用 whisper.cpp 在 CPU 上运行 Whisper

您也可以使用 whisper.cpp(或其他任何流行的 Whisper 库)在 CPU 上运行 Whisper(性能较低)。 以下是 whisper.cpp 的操作说明。在开发板上打开终端,或通过 SSH 会话连接到开发板,然后运行:
  1. 安装构建依赖项:
  2. 构建 whisper.cpp:
  3. 将 whisper.cpp 路径添加到您的 PATH:
  4. 现在您可以使用 whisper.cpp 转录一些音频:
  5. 您还可以实时转录音频: a. 将麦克风连接到开发板。 b. 找到麦克风 ID:
    c. 开始实时转录:

使用 OpenCL 在 GPU 上运行

您还可以构建在 GPU 上运行的二进制文件:
  1. 首先按照 llama.cpp 中”安装 OpenCL 头文件和 ICD 加载器库”下的步骤操作。
  2. 使用 OpenCL 构建二进制文件: