豆包声音克隆 1.0
录音优化
用手机或麦克风在安静环境下录制一段 10 秒到 30 秒的音频。
如果声音嘈杂,可以用剪映对音频进行简单处理:
- 只保留流畅的口播
- 响度统一
- 调整声音大小
- 音频降噪
导出 MP3 音频文件。
录音建议
录音越干净,克隆效果越稳定。尽量避免背景音乐、环境噪声、多人说话和明显回声。
克隆声音
进入声音复刻大模型:
https://console.volcengine.com/ark/region:ark+cn-beijing/tts/soundReplicate
开通试用服务,并找到声音复刻需要的三个参数。
声音ID:S_bN9jpeTw1
APP ID:41807370**
Access Token:4hLf***_cEqI1DoLh6BwCu***-**
打开本软件「音画匹配剪辑」-「声音合成」:
选择「豆包语音」-「克隆声音」,填写刚才申请的「音色 ID」。
备注:应用 ID 和 Access Token 与之前的 AI 合成配音一致。如果已经填写过,确认无误后点击保存即可。
确认保存了参数后,点击「克隆声音」
将「录音与优化」保存的 MP3 音频文件路径上传,点击「开始克隆」。
等待音频上传并完成训练。
克隆完成!点击确认
返回火山引擎声音复刻大模型网页并刷新,可以看到 训练成功。
- 可以试听音色是否满意
- 每个声音 ID 的训练次数可能有限,请上传音质较好的 MP3 文件进行训练。
- 如果需要更换主播声音,可以对同一个声音 ID 再次训练,具体限制以火山引擎页面为准。
添加多个克隆声音
费用说明
火山引擎的免费额度和声音复刻费用会随平台规则变化。第一个测试音色、多个主播音色的购买方式和可用额度,请以火山引擎控制台当前页面为准。









