跳转至

语音转文字

要对视频或音频进行处理,第一步通常是将其中的语音转成文字,也叫 ASR。

什么是 ASR?

ASR = Automatic Speech Recognition,中文全称是自动语音识别,也就是常说的语音转文字。它会把人声录音转换成可读的文本。

软件内置了一个免费开源模型用于语音转文字,也支持使用「豆包录音文件识别」在线接口进行处理。

本地语音转文字

使用本地模型无需额外设置,软件已经内置。

错误处理

如果识别出现错误,常见原因是模型或软件存放路径中含有中文。可以把软件名称和存放目录改成纯英文字母后再试。

目前软件已增加兜底处理:如果检测到中文路径,会自动缓存到用户项目文件中。


豆包录音文件识别

豆包语音(火山引擎)官网

https://console.volcengine.com/speech/new

开通录音文件识别

在火山引擎的豆包语音中,这个功能叫「录音文件识别」。

录音文件识别有不同版本,具体免费额度和计费规则以火山引擎控制台当前页面为准。

进入开通管理页面,确认并开通「录音文件识别 2.0」。

https://console.volcengine.com/speech/new/setting/activate

进入开通管理页面,确认并开通「录音文件识别 1.0」。

1.0 版本有「标准版」和「极速版」,也可以按需要一起开通。


创建 API Key

进入「API Key 管理」页面,

创建一个 API Key,并保存。

保存密钥

API Key 属于账号密钥,请及时保存,不要公开到截图、群聊或文档中。


软件设置

回到当前软件中,完成设置。

说明

语音转文字功能主要有两种使用场景:

一是 下载对标视频后提取视频文案,

二是 剪辑自己的口播视频时使用。

软件里内置了免费开源的本地模型,同时也支持豆包语音的「录音文件识别」的接口,两种方式都能选用。

如果你对识别精度要求比较高,可以选用豆包语音识别;如果只是普通剪辑,直接使用默认的本地免费模型即可。