- 您在构建什么? 经典 ML/视觉、生成式 AI(LLM/VLM),或语音 AI — 每一种都有其自己的工具和快速入门路径。
- 您将如何准备模型? 为目标硬件转换、量化、编译或微调模型。
- 您将如何运行推理? 用于在设备上执行模型的运行时、容器或集成路径。
我们假设设备设置已完成。如果尚未完成,请按照以下链接(IQ-9075 EVK 或 IQ-8275 EVK)设置设备,并更新(IQ-9075 EVK 或 IQ-8275 EVK)软件。
选择您的路径
使用下方的流程图,找到适合您应用的路径。它会引导您确认是否已经拥有模型、正在构建什么、如何准备以及如何运行推理,然后将您链接到对应的 Ubuntu 工作流页面。每个高亮的方框都可点击。端侧生成式 AI 的可用性取决于您的 Dragonwing 开发板和模型。请从使用 Genie 运行 LLM 开始,在 Genie 不支持相应模型时,使用 Llama.cpp 作为备用方案。对于语音 AI,请参阅语音 AI 工作流和 Whisper。
应用开发与执行流程概览
准备您的模型
在模型能够高效运行在 Qualcomm 硬件上之前,它会被转换为可执行格式,并且在 Hexagon NPU(HTP)上还需量化为受支持的精度。(LiteRT 模型是个例外:它们通过 AI Engine Direct 委托直接运行。)请选择与您起点相匹配的准备工具。运行推理
模型准备就绪后,选择在设备上执行它的方式。您选择的运行时取决于您的编程语言、模型格式,以及是否在构建完整的摄像头/视频管线。在构建机器人应用吗?Qualcomm® Intelligent Robotics (QIR) SDK 在这些运行时之上增加了基于 ROS 的模块和硬件加速节点。
AI 硬件
Qualcomm 平台包含以下用于 AI 推理的硬件加速器:- Qualcomm Kryo™ CPU — 具备一流能效的高性能 CPU。
- Qualcomm Adreno™ GPU:面向 AI 工作负载的均衡功耗与性能,通过 OpenCL 内核进行加速。也用于模型的前处理和后处理(例如,IM SDK 在 GPU 上运行缩放、颜色转换和叠加)。
- Qualcomm Hexagon™ Tensor Processor (HTP):也称为 NPU/DSP/HMX。针对低功耗、高性能的 AI推理进行了优化。为获得最佳性能,请将预训练模型量化为受支持的精度。

