> ## Documentation Index
> Fetch the complete documentation index at: https://dragonwingdocs.qualcomm.com/llms.txt
> Use this file to discover all available pages before exploring further.

# LiteRT 概述

> LiteRT 框架在 Qualcomm Dragonwing IoT 平台上进行设备端 AI 推理的概述,包括支持的委托和加速器。

\*\*LiteRT(Lite Runtime)\*\*是一个开源框架,专为高效的设备端深度学习推理而设计。它提供工具,可将预训练模型(例如 TensorFlow SavedModel 或 Keras)转换为 LiteRT 格式,并针对边缘部署进行优化。

在 Qualcomm Linux 平台上,LiteRT 模型可以通过原生 LiteRT 应用运行,也可以通过基于 GStreamer 的 Qualcomm Intelligent Multimedia SDK 运行。该框架通过委托支持多种硬件加速器——包括 CPU、GPU 和 Qualcomm Hexagon™ Tensor Processor。它针对移动、嵌入式和边缘设备上的低延迟、紧凑的模型大小以及高能效性能进行了优化。

下图展示了 LiteRT 框架用于运行模型的委托:

<Frame caption="LiteRT 架构">
  <img src="https://mintlify.s3.us-west-1.amazonaws.com/qualcomm-prod/zh/AI-Developer-Workflow-Ubuntu/_images/litert-arch.png" alt="LiteRT 架构,展示用于 CPU、GPU 和 NPU 加速的委托" />
</Frame>

## LiteRT 设备端推理

LiteRT 设备端推理过程将模型加载到解释器中,解释器解析模型并使用委托来运行它。

该过程包括以下步骤:

<Steps>
  <Step title="将模型加载到解释器中">
    推理过程将 LiteRT 模型加载到 LiteRT 解释器接口中,解释器接口解析模型以识别其中包含的神经网络算子。
  </Step>

  <Step title="使用委托配置解释器">
    将解释器接口配置为使用委托运行模型。
  </Step>

  <Step title="调用推理">
    解释器对提供的输入调用模型推理,并将相应的输出保存到提供给解释器接口的缓冲区中。
  </Step>
</Steps>

Qualcomm 支持使用委托在以下加速器上运行 LiteRT 模型:

* CPU
* Adreno GPU
* NPU

**支持的委托和加速器**

| 委托                                    | 加速            |
| ------------------------------------- | ------------- |
| XNNPACK 委托                            | CPU           |
| GPU 委托                                | GPU           |
| Qualcomm® AI Engine Direct 委托(QNN 委托) | CPU、GPU 和 NPU |

## 后续步骤

有关每种委托及其使用方法的详细信息,请参阅[支持的 LiteRT 运行时](../topic/run-a-litert-model)。
