Skip to main content
LiteRT 通过委托(delegate)支持硬件加速,委托可将图执行卸载到专用硬件。Qualcomm Dragonwing IoT 平台上可使用以下委托。

CPU 委托

XNNPACK 委托使用 XNNPACK 库在 CPU 上加速 LiteRT 模型。XNNPACK 是 Google 的开源库,它:
  • 为 Arm CPU 提供神经网络算子的优化实现。
  • 使用底层 CPU 指令(例如 Arm® Neon™ 指令集)来优化算子,实现高效执行。
XNNPACK 委托支持 32 位浮点和 int8 两种格式的模型。有关更多信息,请参见 XNNPACK back-end for TensorFlow Lite 要使用 XNNPACK 委托运行 LiteRT 模型,请参见部署 LiteRT 模型

GPU 委托

GPU 开源委托在特定厂商的 GPU(包括 Qualcomm Adreno GPU)上加速 LiteRT 模型。它使用 OpenCL 内核在 GPU 上运行 LiteRT 模型执行图中的神经网络运算,从而提升并行处理性能。 GPU 委托在 Adreno GPU 上支持以下模型精度:
  • 16 位浮点
  • 32 位浮点
有关更多信息,请参见 GPU delegates for LiteRT 要使用 GPU 委托运行 LiteRT 模型,请参见部署 LiteRT 模型

HTP 委托

Qualcomm AI Runtime 委托是专为 Qualcomm 平台硬件加速设计的专有委托。它基于 LiteRT 的外部委托接口,可将 LiteRT 模型的部分或全部卸载到专用 Qualcomm 硬件,包括 Adreno GPU 和 NPU。 该委托通过减少 CPU 工作负载来提升模型执行性能和能效。它使用现有的 Qualcomm AI Runtime API 和可用后端来加速模型。有关更多信息,请参见 Qualcomm AI Runtime(QAIRT)SDK Qualcomm AI Runtime 委托在可用硬件上同时支持 32 位浮点和 int8 精度。 您可以使用以下接口构建应用:
  • Qualcomm AI Runtime 委托接口
  • LiteRT 外部委托接口
这两种接口都可在独立的 LiteRT 应用中使用。如果您使用 Qualcomm IM SDK 部署 LiteRT 模型,qtimltflite GStreamer 插件将使用 QNN 委托。有关更多信息,请参见 Leverage external delegate