Skip to main content
借助 Qualcomm Gen AI Inference Extensions (Genie),部分大语言模型(LLM)和视觉语言模型(VLM)可以在您的 Dragonwing 开发板的 NPU 上运行。这些模型已由 Qualcomm 移植和优化,以便在硬件上尽可能高效地运行。Genie 仅支持手动移植的部分模型,因此如果您喜欢的模型不在列表中,请参阅使用 llama.cpp 运行 LLM / VLM,作为备选方案在 GPU 上运行模型。 IQ-9075 EVK 不支持: 目前尚无适用于 IQ-9075 EVK 的模型。请改用 llama.cpp

安装 AI Runtime SDK - Community Edition

首先安装 AI Runtime SDK - Community Edition。打开开发板上的终端,或与开发板建立 ssh 会话,然后运行:

查找支持的模型

Genie 兼容的 LLM 模型可以在以下几处找到。下面的示例适用于基于 QCS6490 的开发板,如 RB3 Gen 2 Vision Kit 和 RUBIK Pi 3。IQ-9075 EVK/QCS9075 目前不支持 Genie 模型;在支持的 Genie 模型可用之前,请在 IQ-9075 EVK 上使用 llama.cpp
  • Aplux 模型库
    1. 在 ‘Chipset’ 下选择:
      • RB3 Gen 2 Vision Kit:‘Qualcomm QCS6490’
      • RUBIK Pi 3:‘Qualcomm QCS6490’
    2. 在 ‘NLP’ 下选择 “Text Generation”。
  • Qualcomm AI Hub
    1. 在 ‘Chipset’ 下选择:
      • RB3 Gen 2 Vision Kit:‘Qualcomm QCS6490 (Proxy)’
      • RUBIK Pi 3:‘Qualcomm QCS6490 (Proxy)’
    2. 在 ‘Domain/Use Case’ 下选择 “Generative AI”。
作为示例,我们来部署 Qwen2.5-0.5B-Instruct 模型,它可以在基于 QCS6490 的 Dragonwing 开发板(如 RUBIK Pi 3 和 RB3 Gen 2 Vision Kit)上运行。

运行 Qwen2.5-0.5B-Instruct

下载模型时,您需要 3 个文件: 让我们获取所有这些文件并运行 Qwen2.5-0.5B-Instruct。打开开发板上的终端,或与开发板建立 ssh 会话,然后:
  1. 将模型下载到您的开发板。可以:
    • 从我们的 CDN 下载模型(仅提供 Qwen 模型):
    • 从 Aplux 模型库下载模型:
      1. 前往 Aplux 模型库:Qwen2.5-0.5B-Instruct
      2. 注册一个 Aplux 账户。
      3. 在 ‘Device’ 下选择 QCS6490。
      4. 点击 “Download Model & Test code”。

        下载适用于 QCS6490 的 Genie 兼容模型

      5. 下载后,通过 ssh 将 ZIP 文件推送到您的开发板:
        1. 查找开发板的 IP 地址。在开发板上运行:
        2. 推送 .zip 文件。在您的计算机上运行:
  2. 解压模型。在您的开发板上:
  3. 运行您的模型:
太棒了!您现在已经通过 Genie 运行了这个 LLM。

通过 QAI AppBuilder 提供 UI 或 API 服务

要在您的应用程序中使用 Genie 模型,可以使用 QAI AppBuilder 仓库。AppBuilder 仓库既提供 OpenAI 兼容的 chat completion API,也提供用于与模型交互的 Web UI(就像 llama.cpp 一样)。 开发迭代频繁: AppBuilder 正在密集开发中。我们已尽可能固定版本,但使用较新版本的 AppBuilder 可能与以下说明不兼容。
  1. 安装 AppBuilder:
  2. 运行 Web UI(在 samples/ 目录中):
    现在在您计算机的网页浏览器中打开 http://192.168.1.253:8976 (替换为您的 IP)与模型交互。请务必先使用 “models” 下拉菜单选择模型。

    ai-engine-direct-helper WebUI 演示

  3. 您还可以使用 OpenAI Chat Completions API 以编程方式访问此服务器。例如,通过 Python:
    1. 启动服务器(在 samples/ 目录中):
    2. 新终端中,创建一个新的 venv 并安装 requests
    3. 创建一个新文件 chat.py
    4. 运行 chat.py
      (模型似乎总是返回 IBM-Granite,您可以忽略这一点)

提示与技巧

从 HuggingFace 下载需要身份验证的文件

如果您想下载需要权限或身份验证的文件,例如 Llama-3.2-1B-Instructtokenizer.json 文件:
  1. 前往 HuggingFace 上的模型页面,登录(或注册),并填写表单以获取模型访问权限。
  2. https://huggingface.co/settings/tokens 创建一个具有 ‘Read’ 权限的新 HuggingFace 访问令牌,并在您的开发板上配置它:
  3. 获得访问权限后,您就可以下载 tokenizer: