音色配置

挑一个你愿意长期听的声音

语音合成(TTS)

主要用于为系统提供拟人化语音播报与实时语音输出能力。

1. 应用场景

  • 消息自动朗读:聊天消息文本转语音自动播报。
  • 语音交互全流程:语音唤醒回复、实时语音通话、伴睡模式等场景的语音发声。

2. 操作路径

设置 → 模型配置 → 语音合成模型

3. 支持的服务商

目前灵枢已接入并支持以下语音服务商与协议标准:

  • 阿里云 (Aliyun TTS)
  • 小米 (Xiaomi)
  • 火山引擎 (Volcengine / 字节跳动)
  • Fish Audio
  • 灵枢 Fish 兼容协议(支持自建或兼容 Fish 协议的服务接入)

[!TIP] 前往对应服务商开放平台获取 API Key / Token 后,在配置页选择对应服务商并填入凭证即可生效。

image|48%image|48%

接下来依次介绍如何配置

小米 MiMo TTS 配置指引(免费)

小米 MiMo 语音合成目前处于免费阶段,且注册流程极简(暂无需实名认证),推荐优先接入体验。

1. 获取 API Key 步骤
  1. 注册与登录:
  2. 创建密钥:
2. 系统中配置
  • 返回系统:设置 → 模型配置 → 语音合成模型
  • 服务商选择 小米 / MiMo
  • 将复制好的密钥粘贴至 「密钥输入框」 中保存即可。

image|48%

音色模式与选择建议

系统提供 预置音色 与 音色复刻(自定义声音) 两种合成模式:

模式 特点与优势 使用建议 / 音频要求
预置音色<br>(推荐) ⚡ 响应速度极快、延迟低,稳定性高。 推荐在日常对话、实时通话等注重低延迟体验的场景下优先使用。
声音复刻 🎙️ 支持通过上传样本音频克隆专属音色。 上传音频时建议满足以下条件,以确保最佳复刻效果:<br>• 格式:支持 MP3 等常见音频格式<br>• 时长:建议音频时长 不超过 10 秒<br>• 音质:发音清晰、无背景杂音/噪点

[!TIP] 调优小建议:

  • 追求极致的对话流畅度与首包响应时间,建议首选 预置音色;
  • 复刻音色质量直接受原音频影响,录音时建议尽量贴近麦克风并处于安静环境。

火山引擎声音复刻

访问以下链接
https://console.volcengine.com/speech/new/experience/clone?projectName=default

|2560px

上传参考音频

|2560px

同意协议 点开始复刻

|2560px

复刻完成 点击箭头的地方 复制音色id

|2560px

  1. 模型配置——语音合成模型

  2. 服务商选火山引擎TTS

  3. 资源ID选声音复刻模型

  4. 音色id填写之前复制的音色id即可

  5. 复制API密钥 https://console.volcengine.com/speech/new/setting/apikeys?projectName=default 复制密钥粘贴到 api密钥 输入框

    |48%

说明: 首次开通应该会赠送10个音色槽位(意味着同时可以用 10个 自己复刻出来的音色),2w字免费语音合成额度 每个音色槽位可训练14次音色,每次训练都会覆盖前次训练的音色 免费额度用完 可购买语音包 https://console.volcengine.com/speech/new/purchase?projectName=default官方定价 28元 10w字 合成额度

|2560px

不购买也可以,开通后付费的方式 0.0003/字 RMB

|2560px

阿里云声音复刻

  1. 访问 大模型服务平台百炼控制台 创建APIKEY 保存好(没有登录会自动跳转登录页面 登录成功后会自动跳转到APIKEY页面)

    |2559px

  2. 访问 大模型服务平台百炼控制台

    |2559px

  3. 上传音频即可完成复刻

  4. 复刻完成后访问 大模型服务平台百炼控制台 即可看到已经复刻的音色,点击箭头所指复制音色ID

|1160px

将复制好的音色ID粘贴到灵枢语音合成模型 音色输入框右上角保存即可

image|48%