Skip to main content
LiteRT 通过委托支持硬件加速,委托可将图执行卸载到专用硬件。在 Qualcomm Dragonwing IoT 平台上可使用以下委托。

CPU 委托

XNNPACK 委托使用 XNNPACK 库在 CPU 上加速 LiteRT 模型。XNNPACK 是 Google 提供的一个开源库,它:
  • 为 Arm CPU 提供优化的神经网络算子实现。
  • 使用低级 CPU 指令(例如 Arm® Neon™ 指令集)来优化算子以高效执行。
XNNPACK 委托支持 32 位浮点和 int8 两种格式的模型。有关更多信息,请参阅 XNNPACK back-end for TensorFlow Lite。 要使用 XNNPACK 委托运行 LiteRT 模型,请参阅部署 LiteRT 模型。

GPU 委托

GPU 开源委托可在特定厂商的 GPU 上(包括 Qualcomm Adreno GPU)加速 LiteRT 模型。它使用 OpenCL 内核在 GPU 上运行 LiteRT 模型执行图中的神经网络运算,从而提升并行处理性能。 GPU 委托在 Adreno GPU 上支持以下模型精度:
  • 16 位浮点
  • 32 位浮点
有关更多信息,请参阅 GPU delegates for LiteRT。 要使用 GPU 委托运行 LiteRT 模型,请参阅部署 LiteRT 模型。

HTP 委托

Qualcomm AI Runtime 委托是专为 Qualcomm 平台上的硬件加速而设计的专有委托。它基于 LiteRT 的外部委托接口,可以将 LiteRT 模型的部分或全部卸载到 Qualcomm 专用硬件,包括 Adreno GPU 和 NPU。 该委托通过减少 CPU 工作负载来提升模型执行性能和能效。它使用现有的 Qualcomm AI Runtime API 和可用后端来加速模型。有关更多信息,请参阅 Qualcomm AI Runtime (QAIRT) SDK。 Qualcomm AI Runtime 委托在可用硬件上支持 32 位浮点和 int8 精度。 您可以使用以下接口构建应用:
  • Qualcomm AI Runtime 委托接口
  • LiteRT 外部委托接口
这两种接口均可在独立的 LiteRT 应用中使用。如果您使用 Qualcomm IM SDK 部署 LiteRT 模型,则 qtimltflite GStreamer 插件会使用 QNN 委托。有关更多信息,请参阅 Leverage external delegate。