Skip to main content
**LiteRT(Lite Runtime)**是一个开源框架,专为高效的设备端深度学习推理而设计。它提供工具,可将预训练模型(例如 TensorFlow SavedModel 或 Keras)转换为 LiteRT 格式,并针对边缘部署进行优化。 在 Qualcomm Linux 平台上,LiteRT 模型可以通过原生 LiteRT 应用运行,也可以通过基于 GStreamer 的 Qualcomm Intelligent Multimedia SDK 运行。该框架通过委托支持多种硬件加速器——包括 CPU、GPU 和 Qualcomm Hexagon™ Tensor Processor。它针对移动、嵌入式和边缘设备上的低延迟、紧凑的模型大小以及高能效性能进行了优化。 下图展示了 LiteRT 框架用于运行模型的委托:
LiteRT 架构,展示用于 CPU、GPU 和 NPU 加速的委托

LiteRT 架构

LiteRT 设备端推理

LiteRT 设备端推理过程将模型加载到解释器中,解释器解析模型并使用委托来运行它。 该过程包括以下步骤:
1

将模型加载到解释器中

推理过程将 LiteRT 模型加载到 LiteRT 解释器接口中,解释器接口解析模型以识别其中包含的神经网络算子。
2

使用委托配置解释器

将解释器接口配置为使用委托运行模型。
3

调用推理

解释器对提供的输入调用模型推理,并将相应的输出保存到提供给解释器接口的缓冲区中。
Qualcomm 支持使用委托在以下加速器上运行 LiteRT 模型:
  • CPU
  • Adreno GPU
  • NPU
支持的委托和加速器

后续步骤

有关每种委托及其使用方法的详细信息,请参阅支持的 LiteRT 运行时。