安装 AI Runtime SDK - Community Edition
首先安装 AI Runtime SDK - Community Edition。打开开发板上的终端,或与开发板建立 ssh 会话,然后运行:查找支持的模型
Genie 兼容的 LLM 模型可以在以下几处找到。下面的示例适用于基于 QCS6490 的开发板,如 RB3 Gen 2 Vision Kit 和 RUBIK Pi 3。IQ-9075 EVK/QCS9075 目前不支持 Genie 模型;在支持的 Genie 模型可用之前,请在 IQ-9075 EVK 上使用 llama.cpp。-
Aplux 模型库:
-
在 ‘Chipset’ 下选择:
- RB3 Gen 2 Vision Kit:‘Qualcomm QCS6490’
- RUBIK Pi 3:‘Qualcomm QCS6490’
- 在 ‘NLP’ 下选择 “Text Generation”。
-
在 ‘Chipset’ 下选择:
-
Qualcomm AI Hub:
-
在 ‘Chipset’ 下选择:
- RB3 Gen 2 Vision Kit:‘Qualcomm QCS6490 (Proxy)’
- RUBIK Pi 3:‘Qualcomm QCS6490 (Proxy)’
- 在 ‘Domain/Use Case’ 下选择 “Generative AI”。
-
在 ‘Chipset’ 下选择:
运行 Qwen2.5-0.5B-Instruct
下载模型时,您需要 3 个文件:- 一个或多个
*.serialized.bin文件——包含模型的权重。 tokenizer.json——一个序列化配置文件,定义如何将文本拆分为 token,以及字符、子词与 LLM 使用的整数 ID 之间的映射。通常可以从 HuggingFace 上的模型空间下载。Genie 支持模型的链接列表见 quic/ai-hub-apps: LLM On-Device Deployment > Prepare Genie configs。- 一个 Genie 配置文件——包含如何通过 Genie 运行此模型的说明。AI Hub 中模型的配置文件可以在 GitHub 上找到:quic/ai-hub-apps: tutorials/llm_on_genie/configs/genie。
-
将模型下载到您的开发板。可以:
-
从我们的 CDN 下载模型(仅提供 Qwen 模型):
-
从 Aplux 模型库下载模型:
- 前往 Aplux 模型库:Qwen2.5-0.5B-Instruct。
- 注册一个 Aplux 账户。
- 在 ‘Device’ 下选择 QCS6490。
-
点击 “Download Model & Test code”。

下载适用于 QCS6490 的 Genie 兼容模型
-
下载后,通过 ssh 将 ZIP 文件推送到您的开发板:
-
查找开发板的 IP 地址。在开发板上运行:
-
推送 .zip 文件。在您的计算机上运行:
-
查找开发板的 IP 地址。在开发板上运行:
-
从我们的 CDN 下载模型(仅提供 Qwen 模型):
-
解压模型。在您的开发板上:
-
运行您的模型:
通过 QAI AppBuilder 提供 UI 或 API 服务
要在您的应用程序中使用 Genie 模型,可以使用 QAI AppBuilder 仓库。AppBuilder 仓库既提供 OpenAI 兼容的 chat completion API,也提供用于与模型交互的 Web UI(就像 llama.cpp 一样)。 开发迭代频繁: AppBuilder 正在密集开发中。我们已尽可能固定版本,但使用较新版本的 AppBuilder 可能与以下说明不兼容。-
安装 AppBuilder:
-
运行 Web UI(在
samples/目录中):现在在您计算机的网页浏览器中打开 http://192.168.1.253:8976 (替换为您的 IP)与模型交互。请务必先使用 “models” 下拉菜单选择模型。
ai-engine-direct-helper WebUI 演示
-
您还可以使用 OpenAI Chat Completions API 以编程方式访问此服务器。例如,通过 Python:
-
启动服务器(在
samples/目录中): -
在新终端中,创建一个新的 venv 并安装
requests: -
创建一个新文件
chat.py: -
运行
chat.py:(模型似乎总是返回IBM-Granite,您可以忽略这一点)
-
启动服务器(在
提示与技巧
从 HuggingFace 下载需要身份验证的文件
如果您想下载需要权限或身份验证的文件,例如 Llama-3.2-1B-Instruct 的tokenizer.json 文件:
- 前往 HuggingFace 上的模型页面,登录(或注册),并填写表单以获取模型访问权限。
-
在 https://huggingface.co/settings/tokens 创建一个具有 ‘Read’ 权限的新 HuggingFace 访问令牌,并在您的开发板上配置它:
-
获得访问权限后,您就可以下载 tokenizer:

