- GenAI Studio 不包含模型文件或容器镜像。
- 您必须自行生成模型并构建容器镜像。
- 请确保您的主机满足要求。
- 使用主机生成模型。
- 使用目标设备构建 docker 容器。
高层架构
下图显示了 GenAI Studio 的高层架构。每个功能模块作为独立容器运行,提供隔离性、可扩展性和可延展性。这使得新的模态可以作为额外容器添加,而不会干扰现有服务。每个端点都有特定端口。请参阅端点端口号中的端口号。

用户交互
用户可通过托管在主机上的网页访问 GenAI Studio,或通过具有 OpenAI 兼容端点的第三方应用程序进行 API 调用。请求路由到目标设备
网页或 API 调用与运行在目标设备(例如 Qualcomm Dragonwing™ IQ9)上的编排器服务通信,并将 UI 上的每个用户操作转换为对后端服务的相应 REST API 调用。编排层
编排器容器充当中央枢纽。它接收请求、管理会话历史、处理多轮对话连续性(KV-cache),并聚合各模态容器的响应,为用户呈现统一的体验。 容器化架构与可扩展性: 每个功能模块(编排器、文本到文本、文本转语音、文本转图像、图像转文本、语音转文本)作为独立容器运行。 这带来以下优势:- 服务之间相互隔离。
- 可扩展性,每个服务可根据用例独立扩展。
- 可延展性,您可以将新的模态或模型作为额外容器添加。
文本到文本
此应用程序使用 Genie API 运行文本到文本大语言模型(LLM)。 它提供一个持久(常驻)LLM 服务器,支持以下功能:- 根据用户提示词生成 LLM 回复(文本到文本)。
- 复用预加载模型,避免每次请求都重新加载。
- 用于模型/会话重置和模型重新加载的控制端点。
- 直接从 UI 更新系统提示词。
- 对话历史,允许 UI 获取之前的消息。

文本转图像
已知问题:GA 版本不支持文本转图像。

图像转文本
图像转文本容器使用视觉语言模型(VLM)以自然语言描述图像,支持视觉理解和内容审核用例。 有关更多信息,请参阅图像转文本 README 和代码流程文件。文本转语音
下图显示了文本转语音容器中的调用流程序列示例。
语音转文本
已知问题:GA 版本不支持语音转文本。

设置 GenAI Studio
GenAI Studio 在 IQ9 上受支持,兼容 Qualcomm Linux 发行版和 Qualcomm IoT 平台上的 Ubuntu。GenAI Studio 不随附语言模型。您必须使用 AI Hub 生成模型。
- 在主机上,从 CodeLinaro 下载适用于您 EVK 的预编译 Qualcomm Linux 构建镜像。
-
从主机将镜像刷写到目标设备。
在 QLI 上,Qualcomm 相关的 DSP 库和 Docker 已预装。
-
将仓库克隆到目标设备并进入本地目录:
-
在主机上准备 SDK(可选)。
仅当您要启动完整技术栈或私有 STT 或 TTS 服务时才需要执行此操作。
-
在目标设备上的示例应用仓库根目录中,完成预检(preflight)检查:
在运行预检检查之前,请确保设备已正确配置。 有关设备初始配置,请参阅 设备设置。
-
为目标设备准备模型。
有关更多信息,请参阅各服务的模型生成和设置文档。
-
构建基础镜像(一次性设置)。
-
构建服务镜像。
请参阅各服务的 README 文件(例如 core-services/README.md)
获取指导,确保所有必需文件均已就位。
-
使用
docker-compose启动服务。 有关运行docker-compose之前建议设置的环境变量,请参阅 README。 -
运行服务健康检查和功能检查,验证所有服务均在运行:
-
运行统一测试套件:
有关功能端点检查和测试,请参阅 功能端点测试 和各服务的 README 文件。
docs 文件夹中的故障排除和常见问题文档。
要查看服务日志,请运行以下命令:

