Skip to main content
本指南介绍如何使用 Qualcomm Dragonwing IoT 平台支持的工具、运行时和框架进行 AI 应用开发。它面向希望训练或微调模型、为部署做准备,并在 Qualcomm 硬件上构建 AI 应用的开发者。 本指南中的大多数决策归结为三个问题:
  • 您在构建什么? 经典 ML/视觉、生成式 AI(LLM/VLM),或语音 AI — 每一种都有其自己的工具和快速入门路径。
  • 您将如何准备模型? 为目标硬件转换、量化、编译或微调模型。
  • 您将如何运行推理? 用于在设备上执行模型的运行时、容器或集成路径。
您可以带入来自 ONNX、PyTorch、TensorFlow 或 LiteRT 的预训练模型,或者从 Qualcomm 现成可运行的 LLM、VLM、ASR 和 TTS 模型开始,并在 Qualcomm Kryo™ CPU、Adreno™ GPU 和 Hexagon™ NPU(HTP)上高效运行。
我们假设设备设置已完成。如果尚未完成,请按照以下链接(IQ-9075 EVK 或 IQ-8275 EVK)设置设备,并更新(IQ-9075 EVK 或 IQ-8275 EVK)软件。

选择您的路径

使用下方的流程图,找到适合您应用的路径。它会引导您确认是否已经拥有模型、正在构建什么、如何准备以及如何运行推理,然后将您链接到对应的 Ubuntu 工作流页面。每个高亮的方框都可点击。
端侧生成式 AI 的可用性取决于您的 Dragonwing 开发板和模型。请从使用 Genie 运行 LLM 开始,在 Genie 不支持相应模型时,使用 Llama.cpp 作为备用方案。对于语音 AI,请参阅语音 AI 工作流和 Whisper。

应用开发与执行流程概览

准备您的模型

在模型能够高效运行在 Qualcomm 硬件上之前,它会被转换为可执行格式,并且在 Hexagon NPU(HTP)上还需量化为受支持的精度。(LiteRT 模型是个例外:它们通过 AI Engine Direct 委托直接运行。)请选择与您起点相匹配的准备工具。

运行推理

模型准备就绪后,选择在设备上执行它的方式。您选择的运行时取决于您的编程语言、模型格式,以及是否在构建完整的摄像头/视频管线。
在构建机器人应用吗?Qualcomm® Intelligent Robotics (QIR) SDK 在这些运行时之上增加了基于 ROS 的模块和硬件加速节点。

AI 硬件

Qualcomm 平台包含以下用于 AI 推理的硬件加速器:
  • Qualcomm Kryo™ CPU — 具备一流能效的高性能 CPU。
  • Qualcomm Adreno™ GPU:面向 AI 工作负载的均衡功耗与性能,通过 OpenCL 内核进行加速。也用于模型的前处理和后处理(例如,IM SDK 在 GPU 上运行缩放、颜色转换和叠加)。
  • Qualcomm Hexagon™ Tensor Processor (HTP):也称为 NPU/DSP/HMX。针对低功耗、高性能的 AI推理进行了优化。为获得最佳性能,请将预训练模型量化为受支持的精度。