豆包声音克隆 2.0
火山引擎「豆包语音」官网
豆包语音 2.0 相比原来的 1.0 版本效果更好,
价格也更划算,强烈建议切换试用。
一、录音优化
用手机或麦克风在安静环境下录制一段 10 秒到 30 秒的音频。
如果声音嘈杂,可以用剪映对音频进行简单处理:
- 只保留流畅的口播
- 响度统一
- 调整声音大小
- 音频降噪
导出 MP3 音频文件。
录音建议
录音越干净,克隆效果越稳定。尽量避免背景音乐、环境噪声、多人说话和明显回声。
二、开通设置
第一步,开通「语音合成 2.0」和「声音复刻 2.0」
语音合成 vs 声音复刻
如果你之前已经设置了 豆包 AI 配音 2.0,这一步应该已经开通完成了,可以跳过。
进入「豆包语音」的「开通管理」页面,
将大模型中的「语音合成 2.0」和「声音复刻 2.0」两个项目开通。
开通后,控制台会显示可用的试用额度(当前为 20000 字的免费额度)。免费额度、有效期和计费规则会随平台政策变化,请以页面显示为准。
语音合成 vs 声音复刻
- 语音合成 2.0:用于 AI 配音,使用官方音色将文案朗读成配音。
- 声音复刻 2.0:用于克隆自己的声音,再进行朗读配音。
如果你只需要使用官方音色配音,只开通「语音合成 2.0」即可。如果要克隆自己的声音,需要同时开通「声音复刻 2.0」。
第二步,获取 API Key
语音合成 vs 声音复刻
如果你之前已经设置了 豆包 AI 配音 2.0,这一步应该已经完成,可以跳过。
进入「豆包语音」的「API Key 管理」页面,
创建或者复制已有的一个 API Key。
97d1f7fd-6c16-43e2-9517-xxxxxx
三、克隆声音
进入「声音复刻」页面,上传录音文件进行声音克隆。
这里可以直接点击试听,也可以输入文本,进行合成试听。
克隆后的声音:
克隆效果不好
如果克隆效果不好,大多是用来克隆的原始音源质量差。录制的时候可以更有激情、声音更饱满一点,尽量在安静环境录制,也可以后期做好降噪处理。
调整好后可以重新进行克隆。每个音色可上传训练的次数以火山引擎页面显示为准(当前为 15 次)。
克隆满意后,可以对音色进行重命名(非必要),
最重要的是复制音色 ID 并保存。
我的音色ID
S_cvoK1In82
四、软件设置
在软件中完成设置,
打开「设置」-「AI 配音设置」-「+ 添加配音」-「豆包声音克隆」
将 API Key 填写到软件中
测试通过,表示完成。
五、费用参考
费用参考 计费说明--豆包语音-火山引擎。
3 元/万字,0.00003 元/字,
200 字的短视频,大约是 0.06 元(6 分钱)
平台价格可能变化,具体以官方计费页和控制台显示为准。可以按“单条文案字数 × 每字单价”粗略估算生成成本。










