跳转到主要内容
Rikka 内置了文字转语音(TTS)——将 AI 回复朗读出来,以及自动语音识别(ASR)——用麦克风语音输入消息而无需打字的支持。你可以独立配置这两项功能,从多种云端和设备端提供商中选择。设置完成后,TTS 和 ASR 可以直接在聊天界面中使用,无需离开对话。 导航到设置 → 语音以访问这两个标签页。

设置 TTS

设置 → 语音中打开 TTS 标签页。点击添加提供商并选择你要使用的提供商。填写必填字段,然后点击保存。你可以添加多个提供商,并随时在它们之间切换。要朗读消息,请点击任意助手消息气泡上出现的扬声器图标

可用的 TTS 提供商

使用 OpenAI 的神经网络 TTS API。生成自然流畅的语音,提供六种预设声音可供选择。
apiKey
string
必填
你的 OpenAI API 密钥。在 OpenAI 控制台中获取。
baseUrl
string
默认值:"https://api.openai.com/v1"
OpenAI 兼容 API 的基础 URL。如果你通过代理路由或使用第三方 OpenAI 兼容端点,请修改此项。
model
string
默认值:"gpt-4o-mini-tts"
要使用的 TTS 模型。gpt-4o-mini-tts 速度快且性价比高;换用 tts-1-hd 可获得更高保真度的输出。
voice
string
默认值:"alloy"
声音预设。OpenAI 提供 alloyechofableonyxnovashimmer
使用 Google 的 Gemini 多模态 TTS。支持多种声音,包括表现力丰富的 Gemini 2.5 系列。
apiKey
string
必填
你的 Google AI Studio API 密钥。
baseUrl
string
Gemini API 的基础 URL。
model
string
默认值:"gemini-2.5-flash-preview-tts"
用于语音合成的 Gemini 模型。
voiceName
string
默认值:"Kore"
声音名称。参考 Google AI 声音列表查看所有可用选项。
来自 MiniMax 的高质量中文及多语言 TTS。
apiKey
string
必填
你的 MiniMax API 密钥。
baseUrl
string
默认值:"https://api.minimaxi.com/v1"
MiniMax API 基础 URL。
model
string
默认值:"speech-2.6-turbo"
TTS 模型标识符。
voiceId
string
默认值:"female-shaonv"
声音 ID。在 MiniMax 控制台中浏览可用声音。
emotion
string
默认值:"calm"
合成语音的情感色调,例如 calmhappysad
speed
float
默认值:"1.0"
播放速度倍率。低于 1.0 的值会减慢语速;高于 1.0 的值会加快语速。
阿里巴巴 DashScope 的 Qwen TTS,针对中文和多语言语音进行了优化。
apiKey
string
必填
你的 DashScope API 密钥。
baseUrl
string
默认值:"https://dashscope.aliyuncs.com/api/v1"
DashScope API 基础 URL。
model
string
默认值:"qwen3-tts-flash"
TTS 模型。qwen3-tts-flash 是低延迟变体。
voice
string
默认值:"Cherry"
声音名称。查看 DashScope 文档获取完整列表。
languageType
string
默认值:"Auto"
语言提示。Auto 让模型自动检测语言。
通过 Groq 推理基础设施提供的快速 TTS,由 Orpheus 模型驱动。
apiKey
string
必填
你的 Groq API 密钥。
baseUrl
string
默认值:"https://api.groq.com/openai/v1"
Groq API 基础 URL。
model
string
默认值:"canopylabs/orpheus-v1-english"
要使用的 Orpheus TTS 模型。
voice
string
默认值:"austin"
声音预设名称。
通过 xAI 的 Grok API 提供的文字转语音服务。
apiKey
string
必填
你的 xAI API 密钥。
baseUrl
string
默认值:"https://api.x.ai/v1"
xAI API 基础 URL。
voiceId
string
默认值:"eve"
声音标识符。
language
string
默认值:"auto"
BCP-47 语言标签或 auto 以自动检测。
由小米 MiMo 服务提供的 TTS。
apiKey
string
必填
你的 MiMo API 密钥。
baseUrl
string
默认值:"https://api.xiaomimimo.com/v1"
MiMo API 基础 URL。
model
string
默认值:"mimo-v2-tts"
TTS 模型标识符。
voice
string
默认值:"mimo_default"
声音预设。
使用 Android 内置的文字转语音引擎。无需 API 密钥——完全在设备端运行,使用你在 Android 设置中安装的语音包。
speechRate
float
默认值:"1.0"
合成语音的速度。1.0 为正常速度;增大值可加快播放,减小值可放慢播放。
pitch
float
默认值:"1.0"
合成语音的音调。1.0 为所选 Android 声音的默认音调。
系统 TTS 的质量和语言支持取决于设备上安装的语音包。你可以在 Android 设置 → 无障碍 → 文字转语音输出中安装额外的语音包。

在聊天界面中使用语音

当你在每个类别中至少配置了一个提供商后,控件会直接出现在聊天界面中:

麦克风(ASR)

点击聊天输入栏中的麦克风图标开始录音。自然地说出你的消息——Rikka 会将音频流式传输到你的 ASR 提供商,并在转录出文字时实时填充文本框。松开或再次点击即可停止。

扬声器(TTS)

点击任意助手消息上的扬声器图标,让你配置的 TTS 提供商朗读消息。再次点击可在朗读中途停止。
如果你主要使用语音输入,建议将 ASR 与低延迟的 TTS 提供商搭配使用,这样整个对话可以自然流畅地进行,无需在键盘之间切换。