- 从 AI Hub 拉取 Gemma 4 E4B 模型包。
- 运行文本、图像和音频推理,并可选择提供兼容 OpenAI 的 API 服务。
先决条件
继续之前,请确认架构和可用空间:
如果开发板尚未完成启动配置,请先完成设备设置 — 请参阅
IQ-9075 EVK 设置指南。
这仅适用于 IQ9;对于其他平台,请参阅 GenieX 页面并选择受支持的模型。
安装 GenieX
1
运行安装程序
如果未设置 该脚本会下载最新的稳定版本并验证其 SHA256 校验和。
HOME(在精简容器中很常见),请先将其导出:验证 GenieX
--log 可提高日志级别。该标志等同于
GENIEX_LOG 环境变量,并且优先于该变量。
下载模型
对于 GGUF 模型,当发布了多个精度时,CLI 会提示您选择精度。对于 IQ9,请选择
Q4_0 — 这是经过量化感知训练的版本,在 NPU 上能提供最佳的单位字节精度。
在脚本中可以内联固定该精度以跳过提示:
pull 会将文件复制到 GenieX 缓存中。使用 --local-path 成功拉取后,您可以
删除源目录,而无需保留约 5 GB 模型的两份副本。模型包内容
GenieX 会为您管理 GGUF 模型包。它包含量化后的*.gguf 权重、用于图像和音频输入的
mmproj-*.gguf 多模态投影器、嵌入在 GGUF 容器中的分词器元数据,以及记录精度、
运行时和计算默认值的清单文件。
而 Genie/QAIRT 模型包(w4a16 版本,或 Jupyter 路径的输出)则是显式的,
必须包含:
示例 Genie 配置发布在
AI Hub Apps 代码仓库中;
有关字段定义,请参阅
Genie dialog JSON 参考。
运行推理
启动交互式聊天会话:常用标志
多模态提示词
q4_0 模型包附带支持音频的投影器,因此单个提示词可以同时携带一张
图像和一段音频。将两个示例文件下载到您的主目录:
图像和音频输入请始终使用绝对路径。相对路径会相对于进程工作目录进行解析,
是“file not found”错误的常见原因。
/mic 会录制一段音频,而不是从磁盘加载;
Ctrl-C 会停止录制并进行转录。这需要 PATH 中有 SoX。
提供兼容 OpenAI 的端点
要进行应用集成,请运行本地服务器,而不是交互式 CLI:reasoning_format 字段,可将思考模型的思维链从
message.content 移至 message.reasoning_content,从而在保持呈现的答案简洁的同时,
保留推理过程用于日志记录。
请先在设备本机上使用
curl 进行测试。如果端点在本地可用但远程不可用,
则说明服务器绑定到了回环地址,或者防火墙阻止了该端口。性能和最佳实践
在 IQ9 上,参考数据为 4096 token 上下文、约 660 tokens/s 的预填充速度,以及 约 17.9 tokens/s 的解码速度。由于解码速度比预填充慢约 37 倍,输出长度对响应时间的 影响远大于提示词长度。- 复用已加载的模型。 模型加载是最大的固定开销 — 请使用
geniex serve或长期运行的交互式会话,而不是每个请求都调用一次geniex infer。 - 限制输出长度。 当延迟很重要时,请要求“三个要点”,而不是“详细解释”。
- 保持提示词简短。 预填充速度很快,但提示词 token 仍会占用生成所需的上下文。
- 禁用思考模式(
--think=false),除非您需要使用推理轨迹;它可能会使 生成的 token 数量成倍增加。 - 合理设置上下文大小。 KV 缓存内存随上下文长度增长,因此不要为从不需要大窗口的 任务配置大窗口。
- 关注散热。 持续生成会使 SoC 温度升高并触发降频;请测量稳态吞吐量, 而不仅仅是第一个请求。
- 预留存储空间。 请预留约为模型包大小(约 5 GB)两倍的空间,以便进行升级。
验证结果
如果任何检查失败,请参阅故障排除。

