> ## Documentation Index
> Fetch the complete documentation index at: https://dragonwingdocs.qualcomm.com/llms.txt
> Use this file to discover all available pages before exploring further.

# 使用 Jupyter notebook 准备 GenAI 模型

> 使用 Qualcomm 提供的 Jupyter notebook 在 Qualcomm Dragonwing IoT 平台上准备、优化和部署大语言模型（LLM）。

使用 Qualcomm 提供的 Jupyter notebook，在交互式、
分步操作的环境中在 Qualcomm 平台上准备、优化和部署
大语言模型（LLM）。Jupyter notebook 在模型准备和执行过程中
提供完全的透明度和可定制性。

下图展示了 Jupyter notebook 通常涵盖的三个阶段和
对应的 notebook：模型准备、模型转换和模型执行。

<img src="https://mintcdn.com/qualcomm-prod/L-jqwrTTz49ZAgVX/Key-Documents/AI-Developer-Workflow/_images/genai-prepare-jupyter.png?fit=max&auto=format&n=L-jqwrTTz49ZAgVX&q=85&s=7cfac477cf2501241531028194c327df" alt="三阶段 Jupyter notebook 工作流程：模型准备、模型转换和模型执行" width="3870" height="1464" data-path="Key-Documents/AI-Developer-Workflow/_images/genai-prepare-jupyter.png" />

下表总结了 GenAI 模型的 Jupyter notebook 工作流程。
该工作流程适用于多类 GenAI 模型，包括
LLM 和视觉模型。

| 步骤         | 目标                                               | 详细信息                                                                                                                                                                   | 生成的产物             |          |        |
| ---------- | ------------------------------------------------ | ---------------------------------------------------------------------------------------------------------------------------------------------------------------------- | ----------------- | -------- | ------ |
| Notebook 1 | 针对 Qualcomm 硬件调整和优化 Hugging Face PyTorch 模型。     | 1. 从 HuggingFace 加载基础模型。<br /> 2. 应用 AIMET 变换以进行图优化、使用 Sequential MSE 和 AdaRound 等技术计算编码。<br /> 3. 将优化后的模型连同 AIMET 编码一起导出为 ONNX 格式。AI Hub 路径通过在云平台上托管此步骤的预计算编码来简化工作流程。 | ONNX 模型           | AIMET 编码 | 性能分析报告 |
| Notebook 2 | 将 ONNX 模型转换为 Qualcomm AI Engine Direct（QNN）二进制文件 | 4. 使用 Qualcomm AI Runtime SDK 工具从 Notebook 1 中生成的 ONNX 模型生成序列化二进制文件。<br /> 5. 为提示词和 token 生成创建上下文二进制文件。<br /> 6. 通过性能分析指标验证模型转换。                                       | 用于推理的 QAIRT 二进制文件 |          |        |
| Notebook 3 | 在基于 Qualcomm 的设备上运行准备好的模型。                       | 7. 将二进制文件和配置文件传输到目标设备。<br /> 8. 使用 Genie-CLI 或 QAIRT 运行时 API 进行推理。<br /> 9. 验证性能（延迟、吞吐量）和准确性。                                                                          | 目标设备上的模型推理        |          |        |
