- GenAI Studio 不包含模型文件或容器镜像。
- 您必须自行生成模型并构建容器镜像。
- 请确保您的主机满足要求。
- 使用主机生成模型。
- 使用目标设备构建 docker 容器。
高层架构
下图显示了 GenAI Studio 的高层架构。每个功能模块都作为独立的容器运行,提供隔离性、可扩展性和可扩展性。这样便可将新的模态作为额外容器添加,而不会中断现有服务。每个端点都有特定的端口。请在端点端口号中查看端口号。
下表列出了每个端点及其关联的端口号。
端点端口号
用户交互
用户通过主机上托管的网页访问 GenAI Studio,或者通过带有与 OpenAI 兼容端点的第三方应用的 API 调用访问 GenAI Studio。请求路由到目标
网页或 API 调用与运行在目标设备(例如 Qualcomm Dragonwing™ IQ9)上的 Orchestrator 服务通信,并将 UI 上的每个用户操作转换为对后端服务的相应 REST API 调用。编排层
Orchestrator 容器充当中央枢纽。它接收请求,管理会话历史, 处理多轮对话连续性(KV-cache),并聚合来自各个模态 容器的响应,向用户呈现统一的体验。 容器化架构和可扩展性: 每个功能模块(orchestrator、text-to-text、text-to-speech、text-to-image、image-to-text、speech-to-text)都作为独立的容器运行。 这提供了以下优势:- 服务之间的隔离。
- 可扩展性,因为每个服务可以根据用例独立扩展。
- 可扩展性,因为您可以将新的模态或模型作为额外的容器添加。
文本转文本
此应用使用 Genie API 运行文本转文本的大语言模型(LLM)。 它提供了一个持久化(始终开启)的 LLM 服务器,支持以下功能:- 根据用户提示生成 LLM 响应(文本转文本)。
- 预加载的模型可复用,避免每次请求都重新加载。
- 用于模型/会话重置和模型重新加载的控制端点。
- 直接从 UI 更新系统提示。
- 会话历史,允许 UI 获取之前的消息。
有关更多信息,请参阅 text-to-text README
和代码流程文件。
文本转图像
下图显示了文本转图像容器中的示例调用流程序列。
有关更多信息,请参阅 text-to-image README
和代码流程文件。
图像转文本
图像转文本容器使用视觉语言模型(VLM)以自然语言描述图像,支持视觉理解和内容审核用例。 有关更多信息,请参阅 image-to-text README 和代码流程文件。文本转语音
下图显示了文本转语音容器中的示例调用流程序列。
有关更多信息,请参阅 text-to-speech README。
语音转文本
下图显示了语音转文本容器中的示例调用流程序列。
有关更多信息,请参阅 speech-to-text README
和代码流程文件。
设置 GenAI Studio
Qualcomm IoT 平台上搭载 Ubuntu 发行版的 IQ9 和 IQ8 支持 GenAI Studio。语言模型不随 GenAI Studio 一起提供。您必须使用 AI Hub 生成模型。
1
根据构建指南下载并烧录适用于 ubuntu 的构建
根据构建指南下载并烧录适用于 ubuntu 的构建。
2
将存储库克隆到目标设备并进入本地目录
3
在主机上准备 SDK(可选)
仅当您要启动完整技术栈或私有 STT 或 TTS 服务时才需要此操作。
4
在目标设备上的示例应用存储库根目录中,完成飞行前检查
5
为目标准备模型
有关更多信息,请参阅每个服务的模型生成和设置文档。
6
构建基础镜像(一次性设置)
导航到 GenAI-Studio 文件夹并运行以下命令:
7
构建服务镜像
8
使用 docker-compose 启动服务
9
运行服务健康检查和功能检查以验证所有服务是否正在运行
10
在主机上运行统一测试套件
11
通过 Orchestrator 访问
打开浏览器并访问以下 URL:
docs 文件夹中的故障排除和痛点文档。
要检查服务日志,请运行以下命令:

