使用 VoiceAI ASR 在 NPU 上运行 Whisper
1. 安装 SDK
-
在开发板上打开终端,并为此示例设置基本依赖:
-
安装 AI Runtime SDK - Community Edition:
-
安装 VoiceAI ASR - Community Edition:
2. 从 AI Hub 下载模型
安装好 SDK 后,您可以从 AI Hub 下载预编译的 Whisper 模型。下载模型时,请选择以下设备:- RB3 Gen 2 Vision Kit:‘Qualcomm QCS6490 (Proxy)’
- RUBIK Pi 3:‘Qualcomm QCS6490 (Proxy)’
- IQ-9075 EVK:‘Qualcomm QCS9075 (Proxy)’
encoder_model_htp.bin,将解码器模型重命名为 decoder_model_htp.bin。
要在开发板上直接下载 Whisper-Small-Quantized 模型:
-
RB3 Gen 2 Vision Kit / Rubik Pi 3:
-
IQ-9075 EVK:
3. 编译并运行示例
-
构建
npu_rpc_linux_sample/voice-ai-ref示例: -
现在您可以转录 .WAV 文件:
-
甚至可以进行实时转录:
a. 将麦克风连接到开发板。
b. 找到麦克风的名称:
-
运行实时转录:
-
运行实时转录:
当 VAD 判断没有语音后,实时转录会立即报错退出,希望这一问题会在未来的更新中得到修复。
voice-ai-ref 二进制文件,并从 stdout 读取数据。
使用 whisper.cpp 在 CPU 上运行 Whisper
您也可以使用 whisper.cpp(或其他任何流行的 Whisper 库)在 CPU 上运行 Whisper(性能较低)。 以下是 whisper.cpp 的操作说明。在开发板上打开终端,或通过 SSH 会话连接到开发板,然后运行:-
安装构建依赖项:
-
构建 whisper.cpp:
-
将 whisper.cpp 路径添加到您的 PATH:
-
现在您可以使用 whisper.cpp 转录一些音频:
-
您还可以实时转录音频:
a. 将麦克风连接到开发板。
b. 找到麦克风 ID:
c. 开始实时转录:
使用 OpenCL 在 GPU 上运行
您还可以构建在 GPU 上运行的二进制文件:- 首先按照 llama.cpp 中”安装 OpenCL 头文件和 ICD 加载器库”下的步骤操作。
-
使用 OpenCL 构建二进制文件:

