语音服务
Zorv AI 内置本地语音能力,输入(STT)与输出(TTS)均在设备端完成,离线可用,不依赖把你的声音传到公网。
本地 STT(语音识别)
- 模型:
sherpa-onnx-whisper-tiny(约 85MB onnx 模型); - 完全离线,识别结果在本地处理;
- 首次使用需下载 / 放置 onnx 模型到指定目录(见快速开始 · 排查)。
本地 TTS(语音合成)
- 单例
QuroTtsHolder管理合成; - 支持多服务商(如小米 MiMo 真情感合成);
- 情绪标签跟随文本:合成时根据文本中的情绪标记调整语调。
隐私与离线
语音链路默认走本地模型,不经过云端语音服务。这与 Zorv AI「设备端运行、隐私可控」的整体定位一致——你的语音数据留在手机上。
常见问题
| 现象 | 处理 |
|---|---|
| 本地语音识别不可用 | 本地 STT 模型约 85MB onnx,首次使用需下载 / 放置到指定目录 |
| 合成音色不符合预期 | 在 TTS 服务商设置中切换 / 配置可用服务商 |