> ## Documentation Index
> Fetch the complete documentation index at: https://dragonwingdocs.qualcomm.com/llms.txt
> Use this file to discover all available pages before exploring further.

# 概述

> 介绍在 Qualcomm 平台上构建 AI 应用可用的工具、运行时和框架,并提供选择模型准备和运行方式的引导路径。

本指南介绍如何使用 Qualcomm Dragonwing IoT 平台支持的工具、运行时和框架进行 AI 应用开发。它面向希望训练或微调模型、为部署做准备,并在 Qualcomm 硬件上构建 AI 应用的开发者。

本指南中的大多数决策归结为三个问题:

* **您在构建什么?** 经典 ML/视觉、生成式 AI(LLM/VLM),或语音 AI — 每一种都有其自己的工具和快速入门路径。
* **您将如何准备模型?** 为目标硬件转换、量化、编译或微调模型。
* **您将如何运行推理?** 用于在设备上执行模型的运行时、容器或集成路径。

您可以带入来自 ONNX、PyTorch、TensorFlow 或 LiteRT 的预训练模型,或者从 Qualcomm 现成可运行的 LLM、VLM、ASR 和 TTS 模型开始,并在 Qualcomm Kryo™ CPU、Adreno™ GPU 和 Hexagon™ NPU(HTP)上高效运行。

<Note>
  我们假设设备设置已完成。如果尚未完成,请按照以下链接([IQ-9075 EVK](https://dragonwingdocs.qualcomm.com/Ubuntu/devices/iq9075-evk/set-up-the-device) 或 [IQ-8275 EVK](https://dragonwingdocs.qualcomm.com/Ubuntu/devices/iq8275-evk/set-up-the-device))设置设备,并更新([IQ-9075 EVK](https://dragonwingdocs.qualcomm.com/Ubuntu/devices/iq9075-evk/update-software/overview) 或 [IQ-8275 EVK](https://dragonwingdocs.qualcomm.com/Ubuntu/devices/iq8275-evk/update-software/overview))软件。
</Note>

## 选择您的路径

使用下方的流程图,找到适合您应用的路径。它会引导您确认是否已经拥有模型、正在构建什么、如何准备以及如何运行推理,然后将您链接到对应的 Ubuntu 工作流页面。每个高亮的方框都可点击。

```mermaid theme={null}
%%{init: {"flowchart": {"rankSpacing": 110, "nodeSpacing": 65}} }%%
flowchart TD
    Q1{"Do you already have<br/>a trained model?"}

    Q1 -->|"No, just show me<br/>what it can do"| RunPrebuilt["Run prebuilt AI models & apps<br/>Qdemo UI · prebuilt samples · IM SDK"]
    Q1 -->|"I want to fine tune a model<br/>with my own data"| EI["Edge Impulse"]
    Q1 -->|"Yes / bring my own<br/>ONNX · PyTorch · TF · LiteRT"| TypeQ{"What are you building?"}

    TypeQ -->|"Classic ML / vision"| Prep{"Prepare the model"}
    TypeQ -->|"Generative AI<br/>LLM · VLM"| GenAI["On-device GenAI workflows<br/>Genie · Llama.cpp · OpenAI-compatible container"]
    TypeQ -->|"Voice / speech AI"| VoiceQ{"What do you need?"}

    VoiceQ -->|"ASR + TTS +<br/>translation"| VoiceContainer["Audio Analytics container"]
    VoiceQ -->|"Specifically<br/>Whisper ASR"| Whisper["Whisper<br/>VoiceAI ASR (NPU) or whisper.cpp (CPU/GPU)"]

    Prep -->|"Ready model, or BYOM<br/>in the cloud"| AIHub["Qualcomm AI Hub<br/>ready models · BYOM<br/>(optimize in the cloud)"]
    Prep -->|"Convert + quantize<br/>my own (local)"| QAIRT["Qualcomm AI Runtime SDK<br/>(QAIRT)"]
    Prep -->|"Recover quantized<br/>accuracy"| AIMET["AIMET (PTQ / QAT)"]

    AIHub --> Runtime{"Run inference"}
    QAIRT --> Runtime
    AIMET --> Runtime

    Runtime -->|"Python / quick .tflite"| LiteRT["LiteRT / TFLite<br/>AI Engine Direct delegate"]
    Runtime -->|"ONNX models"| ONNXRun["ONNX Runtime<br/>AI Engine Direct"]
    Runtime -->|"C++ / low-level control<br/>SNPE or QNN"| QAIRTcpp["QAIRT SDK C++ APIs"]
    Runtime -->|"Camera / video +<br/>AI pipeline"| IMSDK["Qualcomm IM SDK<br/>GStreamer · zero-copy · GPU pre/post"]

    click RunPrebuilt "../map/run-prebuilt-models-and-apps"
    click EI "../topic/edge-impulse"
    click GenAI "../map/run-on-device-genai"
    click VoiceContainer "../map/run-on-device-voice-ai"
    click Whisper "../topic/whisper"
    click AIHub "../topic/ai-hub"
    click QAIRT "../topic/qairt"
    click AIMET "../topic/aimet"
    click LiteRT "../topic/litert-overview"
    click ONNXRun "../topic/onnxruntime"
    click QAIRTcpp "../topic/develop-your-own-application-qairt-cpp"
    click IMSDK "../topic/develop-your-own-application-im-sdk"

    classDef prep fill:#31017D,stroke:#31017D,color:#fff;
    classDef run fill:#3253DC,stroke:#3253DC,color:#fff;
    classDef genai fill:#B45309,stroke:#B45309,color:#fff;
    classDef voice fill:#0F766E,stroke:#0F766E,color:#fff;
    class AIHub,QAIRT,AIMET,EI prep;
    class RunPrebuilt,LiteRT,ONNXRun,QAIRTcpp,IMSDK run;
    class GenAI genai;
    class VoiceContainer,Whisper voice;
```

<Note>
  端侧生成式 AI 的可用性取决于您的 Dragonwing 开发板和模型。请从[使用 Genie 运行 LLM](../topic/use-genai-model-with-genie) 开始,在 Genie 不支持相应模型时,使用 [Llama.cpp](../topic/llama-cpp) 作为备用方案。对于语音 AI,请参阅[语音 AI 工作流](../map/run-on-device-voice-ai)和 [Whisper](../topic/whisper)。
</Note>

## 应用开发与执行流程概览

| 流程                                                              | 用途                                                                                                    |
| --------------------------------------------------------------- | ----------------------------------------------------------------------------------------------------- |
| [Edge Impulse](../topic/edge-impulse)                           | 使用音频、图像和其他传感器数据构建和训练 AI 模型,或以多种格式带入您自己的模型。                                                            |
| [Qualcomm AI Hub](../topic/ai-hub)                              | 下载预优化模型,或带入您自己的模型(BYOM),在几分钟内在托管的 Qualcomm 平台设备上进行优化、验证和部署。                                           |
| [Qualcomm AI Runtime SDK (QAIRT)](../topic/qairt)               | 在本地转换、量化和编译来自 TensorFlow、PyTorch、LiteRT 或 ONNX 的模型,以便部署到 NPU。                                         |
| [AIMET (PTQ / QAT)](../topic/aimet)                             | 通过训练后量化或量化感知训练,恢复量化过程中损失的精度。                                                                          |
| [LiteRT / TFLite](../topic/litert-overview)                     | 使用 AI Engine Direct 委托,在 NPU 上运行 `.tflite` 模型(Python 或 C++)。可与来自 AI Hub、QAIRT 或 Edge Impulse 的模型配合使用。 |
| [ONNX Runtime](../topic/onnxruntime)                            | 使用 ONNX Runtime 结合 AI Engine Direct,在 NPU 上运行 ONNX 模型。                                                |
| [使用 SNPE 或 QNN 运行模型](../topic/run-models)                       | 使用 QAIRT SDK C/C++ API,在 CPU、GPU 或 HTP 上运行已转换的 `.dlc` 或 `.so` 文件。                                     |
| [Qualcomm IM SDK](../topic/develop-your-own-application-im-sdk) | 使用 GStreamer、零拷贝缓冲区和 GPU 前/后处理,构建高性能的摄像头和视频 AI 管线。                                                    |
| [Llama.cpp](../topic/llama-cpp)                                 | 使用针对 CPU/GPU 和量化格式优化的 C++ 后端,在本地运行 LLM 和 VLM。                                                         |
| [Genie / GenieX](../topic/use-genai-model-with-genie)           | 编排端侧生成式 AI(LLM/VLM)工作流,并在 NPU 上运行文本、图像和音频推理。                                                          |
| [使用 Qualcomm OpenAI 容器运行 LLM/VLM](../topic/llm-vlm-qcom-setup)  | 通过可直接替换的 OpenAI 兼容 API,在 NPU 上运行 LLM/VLM。                                                             |
| [Whisper](../topic/whisper)                                     | 使用 NPU(VoiceAI ASR)或 CPU(whisper.cpp)进行语音转录、翻译和语言识别。                                                  |
| [Audio Analytics 容器](../topic/audio-analytics-overview)         | 在 NPU 上进行语音识别(ASR)、文本转语音(TTS)和语言翻译。                                                                   |

## 准备您的模型

在模型能够高效运行在 Qualcomm 硬件上之前,它会被转换为可执行格式,并且在 Hexagon NPU(HTP)上还需量化为受支持的精度。(LiteRT 模型是个例外:它们通过 AI Engine Direct 委托直接运行。)请选择与您起点相匹配的准备工具。

| 工具                                                     | 用途                                                                                                                       | 输出                                           |
| ------------------------------------------------------ | ------------------------------------------------------------------------------------------------------------------------ | -------------------------------------------- |
| [Qualcomm AI Hub](../topic/ai-hub)                     | 下载预优化模型,或**带入您自己的模型(BYOM)**,让 QAIRT **在云端针对您的目标芯片组进行编译、转换和量化**,无需本地工具链。                                                  | 可直接运行的 LiteRT 或 Qualcomm AI Engine Direct 模型 |
| [Qualcomm AI Runtime SDK (QAIRT)](../topic/qairt)      | AI Hub BYOM 的**本地**替代方案:您自己转换、量化和编译来自 TensorFlow、PyTorch、LiteRT 或 ONNX 的模型。集成了 AI Engine Direct 和 Neural Processing SDK。 | 量化模型/编译后的上下文二进制文件                            |
| [Qualcomm AI Model Efficiency Toolkit](../topic/aimet) | 使用训练后量化(PTQ)和量化感知训练(QAT),恢复量化过程中损失的精度。                                                                                   | 精度更高的量化模型                                    |
| [Edge Impulse](../topic/edge-impulse)                  | 使用您自己的音频、图像和传感器数据构建、训练或微调模型。                                                                                             | 采用您选定格式的已训练模型                                |

## 运行推理

模型准备就绪后,选择在设备上执行它的方式。您选择的运行时取决于您的编程语言、模型格式,以及是否在构建完整的摄像头/视频管线。

| 运行时/集成                                                                                                       | 最适合                                                        |
| ------------------------------------------------------------------------------------------------------------ | ---------------------------------------------------------- |
| [LiteRT](../topic/litert-overview)                                                                           | 使用 Qualcomm AI Engine Direct 委托,在 Python 或 C++ 中进行高性能端侧推理。 |
| [QAIRT SDK C++ API](../topic/develop-your-own-application-qairt-cpp)                                         | 对模型执行和推理后端进行低层级的 C++ 控制。                                   |
| [Qualcomm Intelligent Multimedia SDK (IM SDK)](../topic/develop-your-own-application-im-sdk)                 | 结合采集、预处理、推理和渲染的高性能摄像头、视频和视觉管线,并使用零拷贝缓冲区和 GPU 前/后处理。        |
| [Qualcomm® GenAI Inference Engine (Genie)](https://docs.qualcomm.com/doc/80-63442-10/topic/index_Genie.html) | 运行和编排端侧生成式 AI(LLM、多模态)工作流。                                 |
| [使用 Geniex 的 LLM](../topic/geniex)                                                                           | 通过 GenieX CLI 在 NPU 上运行 LLM/VLM 文本、图像和音频推理的最快方式。           |
| [Llama.cpp](../topic/llama-cpp)                                                                              | 使用针对 CPU/GPU 和量化格式优化的 C++ 后端,在本地运行 LLM 和 VLM。              |

<Note>
  在构建机器人应用吗?[Qualcomm® Intelligent Robotics (QIR) SDK](https://www.thundercomm.com/rubik-pi-3/en/docs/rubik-pi-3-user-manual/1.0.0-u/Application%20Development%20and%20Execution%20Guide/Robotics-Sample-Applications/Robotics%20Sample%20Applications/) 在这些运行时之上增加了基于 ROS 的模块和硬件加速节点。
</Note>

## AI 硬件

Qualcomm 平台包含以下用于 AI 推理的硬件加速器:

* **Qualcomm Kryo™ CPU** — 具备一流能效的高性能 CPU。
* **Qualcomm Adreno™ GPU**:面向 AI 工作负载的均衡功耗与性能,通过 OpenCL 内核进行加速。也用于模型的**前处理和后处理**(例如,IM SDK 在 GPU 上运行缩放、颜色转换和叠加)。
* **Qualcomm Hexagon™ Tensor Processor (HTP)**:也称为 NPU/DSP/HMX。针对低功耗、高性能的 AI**推理**进行了优化。为获得最佳性能,请将预训练模型量化为受支持的精度。
