CPU 委托
XNNPACK 委托使用 XNNPACK 库在 CPU 上加速 LiteRT 模型。XNNPACK 是 Google 的开源库,它:- 为 Arm CPU 提供神经网络算子的优化实现。
- 使用底层 CPU 指令(例如 Arm® Neon™ 指令集)来优化算子,实现高效执行。
GPU 委托
GPU 开源委托在特定厂商的 GPU(包括 Qualcomm Adreno GPU)上加速 LiteRT 模型。它使用 OpenCL 内核在 GPU 上运行 LiteRT 模型执行图中的神经网络运算,从而提升并行处理性能。 GPU 委托在 Adreno GPU 上支持以下模型精度:- 16 位浮点
- 32 位浮点
HTP 委托
Qualcomm AI Runtime 委托是专为 Qualcomm 平台硬件加速设计的专有委托。它基于 LiteRT 的外部委托接口,可将 LiteRT 模型的部分或全部卸载到专用 Qualcomm 硬件,包括 Adreno GPU 和 NPU。 该委托通过减少 CPU 工作负载来提升模型执行性能和能效。它使用现有的 Qualcomm AI Runtime API 和可用后端来加速模型。有关更多信息,请参见 Qualcomm AI Runtime(QAIRT)SDK。 Qualcomm AI Runtime 委托在可用硬件上同时支持 32 位浮点和 int8 精度。 您可以使用以下接口构建应用:- Qualcomm AI Runtime 委托接口
- LiteRT 外部委托接口
qtimltflite GStreamer 插件将使用 QNN 委托。有关更多信息,请参见 Leverage external delegate。
