运行生成式 AI(GenAI)模型
使用 Genie、Qualcomm AI Runtime SDK 或开源运行时,在 Qualcomm Dragonwing IoT 设备上运行准备好的 GenAI 模型。
在 GenAI 模型准备完毕并针对部署进行优化后,您就可以在目标设备上运行该模型。Qualcomm 平台提供多种执行路径以满足不同需求,从高级抽象到低级控制不等。
下表总结了 GenAI 模型的执行方式。
Documentation Index
Fetch the complete documentation index at: /llms.txt
Use this file to discover all available pages before exploring further.
🚀 QLI Version 2.1 is now live ! Switch to new version to check out the latest content
使用 Genie、Qualcomm AI Runtime SDK 或开源运行时,在 Qualcomm Dragonwing IoT 设备上运行准备好的 GenAI 模型。
| 执行方式 | 详情 | 关键考量 | |||
|---|---|---|---|---|---|
| Generative AI Inference Extensions(Genie) | Qualcomm 提供的框架,旨在简化 LLM 和多模态模型等复杂 GenAI 模型的执行。 | 处理多个二进制文件的编排、内存管理以及跨 CPU、GPU 和 NPU 的硬件加速。 | 适合希望以最少集成工作量实现即插即用部署的开发者。 | 针对 Qualcomm 硬件优化,提供低延迟和高能效。 | 最适合快速部署和生产级应用。 |
| Qualcomm AI Runtime SDK(QAIRT) | 提供用于直接执行 QAIRT 二进制文件的低级 API。 | 为需要自定义执行流程或性能分析的开发者提供细粒度控制。 | 适用于性能调优至关重要的高级用例。 | 针对 Qualcomm 硬件优化,提供低延迟和高能效。 | 最适合自定义工作流和性能分析。 |
| 开源运行时 | 模型也可以使用开源运行时执行。 | 这种方法适用于希望在利用 Qualcomm 优化的同时,保持与现有开源生态系统兼容的开发者。 | 开源运行时提供可移植性,但可能需要针对 Qualcomm 平台进行额外调优。 | 最适合研究或混合环境。 |
