> ## Documentation Index
> Fetch the complete documentation index at: https://dragonwingdocs.qualcomm.com/llms.txt
> Use this file to discover all available pages before exploring further.

# 使用 Jupyter notebook 准备 GenAI 模型

> 使用 Qualcomm 提供的 Jupyter notebook 在 Qualcomm Dragonwing IoT 平台上准备、优化和部署大语言模型 (LLM)。

使用 Qualcomm 提供的 Jupyter notebook,在交互式、分步的环境中在 Qualcomm 平台上准备、优化和部署大语言模型 (LLM)。这些 Jupyter notebook 在模型准备和执行过程中提供了完全透明度和定制能力。

下图展示了整个工作流中常用的三个主要步骤及其对应的 Jupyter notebook:模型准备、模型转换和模型执行。

<img src="https://mintlify.s3.us-west-1.amazonaws.com/qualcomm-prod/zh/AI-Developer-Workflow-Ubuntu/_images/genai-prepare-jupyter.png" alt="三阶段 Jupyter notebook 工作流:模型准备、模型转换和模型执行" />

下表总结了 GenAI 模型的 Jupyter notebook 工作流。此工作流适用于多种类别的 GenAI 模型,包括 LLM 和视觉模型。

<Note>
  用于模型导出的 Jupyter notebook 可在 [`Qualcomm Package Manager`](https://qpm.qualcomm.com/#/main/home) 中获取。导航到 Tools 并搜索 **Generative AI Tutorials** 以查看可用的 notebook。
</Note>

| 步骤         | 目标                                                 | 详情                                                                                                                                                                 | 生成的产物             |          |        |
| ---------- | -------------------------------------------------- | ------------------------------------------------------------------------------------------------------------------------------------------------------------------ | ----------------- | -------- | ------ |
| Notebook 1 | 适配并优化 Hugging Face PyTorch 模型,以适用于 Qualcomm 硬件。    | 1. 从 HuggingFace 加载基础模型。<br /> 2. 应用 AIMET 变换——图优化,使用 Sequential MSE、AdaRound 等技术计算编码。<br /> 3. 将优化后的模型导出为 ONNX 格式,并附带 AIMET 编码。AI Hub 路径通过在云平台上托管此步骤的预计算编码来简化工作流。 | ONNX 模型           | AIMET 编码 | 性能剖析报告 |
| Notebook 2 | 将 ONNX 模型转换为 Qualcomm AI Engine Direct (QNN) 二进制文件 | 4. 使用 Qualcomm AI Runtime SDK 工具从 Notebook 1 中生成的 ONNX 模型生成序列化二进制文件。<br /> 5. 为提示和 token 生成创建上下文二进制文件。<br /> 6. 使用性能剖析指标验证模型转换。                                    | 用于推理的 QAIRT 二进制文件 |          |        |
| Notebook 3 | 在基于 Qualcomm 的设备上运行准备好的模型。                         | 7. 将二进制文件和配置文件传输到目标设备。<br /> 8. 使用 Genie-CLI 或 QAIRT 运行时 API 进行推理。<br /> 9. 验证性能(延迟、吞吐量)和准确性。                                                                      | 目标端模型推理           |          |        |
