Skip to content

语音服务

Zorv AI 内置本地语音能力,输入(STT)与输出(TTS)均在设备端完成,离线可用,不依赖把你的声音传到公网。

本地 STT(语音识别)

  • 模型:sherpa-onnx-whisper-tiny(约 85MB onnx 模型);
  • 完全离线,识别结果在本地处理;
  • 首次使用需下载 / 放置 onnx 模型到指定目录(见快速开始 · 排查)。

本地 TTS(语音合成)

  • 单例 QuroTtsHolder 管理合成;
  • 支持多服务商(如小米 MiMo 真情感合成);
  • 情绪标签跟随文本:合成时根据文本中的情绪标记调整语调。

隐私与离线

语音链路默认走本地模型,不经过云端语音服务。这与 Zorv AI「设备端运行、隐私可控」的整体定位一致——你的语音数据留在手机上。

常见问题

现象处理
本地语音识别不可用本地 STT 模型约 85MB onnx,首次使用需下载 / 放置到指定目录
合成音色不符合预期在 TTS 服务商设置中切换 / 配置可用服务商

相关阅读

Zorv AI · 设备端 AI Agent · Apache-2.0 开源