- 文字转语音(TTS)
- 自动语音识别(ASR)
设置 TTS
在设置 → 语音中打开 TTS 标签页。点击添加提供商并选择你要使用的提供商。填写必填字段,然后点击保存。你可以添加多个提供商,并随时在它们之间切换。要朗读消息,请点击任意助手消息气泡上出现的扬声器图标。可用的 TTS 提供商
OpenAI TTS
OpenAI TTS
使用 OpenAI 的神经网络 TTS API。生成自然流畅的语音,提供六种预设声音可供选择。
你的 OpenAI API 密钥。在 OpenAI 控制台中获取。
OpenAI 兼容 API 的基础 URL。如果你通过代理路由或使用第三方 OpenAI 兼容端点,请修改此项。
要使用的 TTS 模型。
gpt-4o-mini-tts 速度快且性价比高;换用 tts-1-hd 可获得更高保真度的输出。声音预设。OpenAI 提供
alloy、echo、fable、onyx、nova 和 shimmer。Gemini TTS
Gemini TTS
使用 Google 的 Gemini 多模态 TTS。支持多种声音,包括表现力丰富的 Gemini 2.5 系列。
你的 Google AI Studio API 密钥。
Gemini API 的基础 URL。
用于语音合成的 Gemini 模型。
声音名称。参考 Google AI 声音列表查看所有可用选项。
MiniMax TTS
MiniMax TTS
来自 MiniMax 的高质量中文及多语言 TTS。
你的 MiniMax API 密钥。
MiniMax API 基础 URL。
TTS 模型标识符。
声音 ID。在 MiniMax 控制台中浏览可用声音。
合成语音的情感色调,例如
calm、happy、sad。播放速度倍率。低于
1.0 的值会减慢语速;高于 1.0 的值会加快语速。Qwen TTS
Qwen TTS
阿里巴巴 DashScope 的 Qwen TTS,针对中文和多语言语音进行了优化。
你的 DashScope API 密钥。
DashScope API 基础 URL。
TTS 模型。
qwen3-tts-flash 是低延迟变体。声音名称。查看 DashScope 文档获取完整列表。
语言提示。
Auto 让模型自动检测语言。Groq TTS
Groq TTS
xAI TTS
xAI TTS
MiMo TTS
MiMo TTS
在聊天界面中使用语音
当你在每个类别中至少配置了一个提供商后,控件会直接出现在聊天界面中:麦克风(ASR)
点击聊天输入栏中的麦克风图标开始录音。自然地说出你的消息——Rikka 会将音频流式传输到你的 ASR 提供商,并在转录出文字时实时填充文本框。松开或再次点击即可停止。
扬声器(TTS)
点击任意助手消息上的扬声器图标,让你配置的 TTS 提供商朗读消息。再次点击可在朗读中途停止。