好久没有写公众号了。
每天 vibe coding,有点上瘾。
他们说这一波 AI 来了之后,最废寝忘食的就是 30+ 的老登。
这个说法我觉得还挺准的。
很多之前只能想想的东西,现在真的可以借助 AI 做出来,所以就特别起劲。

尤其是对不会正经写程序的老登来说,以前想搞一个自己的小工具,门槛其实很高。
现在不一样了。
只要你能把需求说清楚,AI 就可以帮你做出一个小工具。
言归正传。
这半个月,我一直在开发小映视频助手里的一个新功能:口播剪辑。
为什么现在才做口播剪辑
之前小映视频助手其实没有重点去碰口播这一块。
不是不想做,而是口播自动剪辑这里有两个比较麻烦的点。

不是把语音转成文字就完事了。真正麻烦的是:剪辑点要准,同时 画面不能太单调。
难点一:气口怎么剪
就像剪映里的一键剪口播一样,你得知道哪里是停顿,哪里是重复,哪里是读错了。
这里最核心的是,口播里的每一个字都要对应到准确的时间戳。
这个事情以前很难交给 AI 直接做。
你让 AI 分析完,它返回一个结果,经常会有位置不准、文本对不上、时间戳错位的问题。
剪视频不是写文章。文章错一个字还能改,剪辑里错半秒,整体可能就错了。

难点二:口播模板
很多口播视频就是一个人在那里巴拉巴拉讲,如果从头到尾都是一个固定画面,观众很容易看累。
这个时候就需要字幕模板、画中画、配套素材、说明图这些东西,把画面丰富起来。
当然,这里说的不是那种特别精细、像“小Lin说”一样一帧一帧打磨的剪辑,而是更像“开拍”那种,可以直接套模板、快速生成一条能用的视频。

这两个点,就是口播剪辑自动化比较难的地方。
这次做了两条流程
所以这次开发口播剪辑功能时,我同步做了两个方向。

一条适合普通用户直接点点点,另一条适合喜欢折腾、想把 Codex / Claude Code / Workbuddy 这类工具接进来的用户。
流程一:软件内部 API
第一条,是在软件内部使用自己的 API 来处理。
这种方式更适合普通用户直接点点点。
口播的分析主要还是以人为判断为主,然后借助 AI 的能力去匹配素材、添加画中画、生成字幕模板,最后生成剪映草稿。
这个流程比较稳定,也比较适合不想折腾 Codex、Claude Code 这些工具的用户。
流程二:Codex + 小映
第二条,就是把 Codex 和小映视频助手结合起来。
也就是这篇文章主要要讲的流程。
这个流程里,很多人工操作都可以直接在 Codex 中完成。
比如让 GPT 帮你分析字幕语义,判断哪些句子需要处理,哪些地方是重复读了一遍,哪些地方是说错了,哪些地方可以删掉。
因为 Codex 本来就内置了浏览器,我们可以直接在 Codex 里打开小映视频助手的剪辑页面,人工确认、修改,然后继续生成剪映草稿。
这样一来,它就不只是一个“剪口播”的功能了。
它更像是把 Codex 的分析能力、生成能力、调用外部 API 的能力,和小映视频助手的视频组装能力结合起来。
Codex 可以参与的环节
- 1、用 Codex 分析口播内容,找出重复、口误和需要删减的部分。
- 2、用 Codex 给文案匹配画中画素材。
- 3、用 Codex 自带的生图能力生成说明图、表单图、插图、封面图。
- 4、调用 Pexels、Pixabay 这类免费可商用素材 API,给画面匹配 B-roll。
- 5、接入 Google 的生图模型,或者即梦 / Seedance 2.0 这类视频生成 API,生成配套视频素材。
- 6、接入 MiniMax 之类的 API,生成音乐、音效、图片或视频素材。
小映视频助手负责把这些东西装配起来:字幕模板、素材布局、画中画、封面、标题、剪映草稿。
Codex 负责更聪明的那部分:分析、判断、生成、调用工具。
我从一开始就想清楚了,不要做一个假模假式的 AI 智能体对话框,然后让用户在里面操作。

你打包一个套壳智能体,为什么不直接用 Codex、Claude Code,甚至 Workbuddy 这种成熟的智能体呢?
套壳的智能体,肯定比这些成熟工具差很多。
可能是天上和地下的区别吧。
所以后面小映视频助手的很多能力,我更倾向于结合 Skill,结合小映自己的视频模板能力,再结合最强的智能体来完成。
各做各擅长的事情,这样才是比较合适的。
Codex 适合做什么
使用 Codex 之后,口播剪辑可以做的事情就多了很多。
比如我们可以直接让它生成封面图。
也可以让它根据视频文案生成类似风格的插图。
比如你想做一条火柴人风格的视频,就可以让 Codex 生成对应素材,再交给小映视频助手装进剪映草稿里。
如果某一段文案需要解释一个流程,Codex 可以生成流程图。
如果某一段文案需要展示一个表单,它也可以生成表单截图式的说明图。
如果你想用网上的免费素材,也可以让 Codex 调 Pexels 这些素材 API,下载免费可商用的视频素材,然后匹配到文案对应的位置。
小映要做的是视频组装、剪映草稿生成、模板管理、字幕样式、素材布局这些事情。
Codex / Claude Code / Workbuddy更适合做分析文案、生成素材、调用各种 AI 能力。
两者结合起来,才能剪出一条还不错、可实际落地的口播视频。

下面就进入具体教程。
另外,如果你使用的是 Workbuddy 或 Claude Code,整体思路也是一样的。
如果你只是想用软件内置方式剪辑,可以直接下载小映视频助手,然后点击软件里的教程或帮助文档查看。
使用教程
教程部分建议
第一次使用时,建议按顺序走一遍:
安装 Skill → 处理口播 → 匹配素材 → 生成草稿。
熟悉之后,就可以根据自己的素材和工作流灵活调整。
一、安装 Skill
打开小映视频助手,在口播剪辑功能里点击「agent 协作」按钮,会打开协作弹窗。
第一次使用前,需要先完成 Skill 安装。安装完成后,后面就不需要重复安装了。


打开 Codex,把复制出来的安装提示词发送给 Codex,让它自动完成 Skill 安装。

安装后建议新建任务
Skill 安装完成后,最好新建一个 Codex 任务窗口,再开始剪辑。
当前任务有时候不会立刻识别到刚安装的 Skill,新建任务会更稳一点。
二、开始处理口播
Skill 安装完成后,打开新的 Codex 任务窗口,把口播剪辑提示词发送给 Codex,开始处理口播视频。

等待 Codex 处理完成后,它会返回一个链接。点击这个链接,就可以在 Codex 内部打开小映视频助手的剪辑窗口。
如果右侧菜单占用空间,可以点击右下角的收缩按钮,把菜单栏隐藏起来。

这里演示用的是数字人视频,原视频里没有太多需要删除的气口,所以 Codex 主要修复的是 ASR 语音转文字里的错别字。
如果是真人口播,就可以继续让 Codex 辅助判断哪些地方需要删。
真人口播常见处理项
- 1、停顿比较长的气口;
- 2、读错之后重新读的片段;
- 3、重复表达;
- 4、不需要保留的废话;
- 5、前后语义不连贯的句子。

不建议完全无脑交给 AI
比较稳的方式是:让 Codex 先分析,给出建议;然后我们在剪辑页面里人工确认。
毕竟口播剪辑最终是听感和节奏问题,AI 可以帮你省很多时间,但最后还是要过一遍。
如果想看更细的人工调整方式,可以参考小映教程文档里的删除内容、修改换行、倍速播放、删除停顿气口和手动微调这些部分。
三、匹配画中画素材
口播剪辑完成后,可以进入「素材匹配」页面,对文案进行拆分和换行。
通常一行文案对应一个素材。
拆分得越细,素材匹配就越密;拆分得越少,人物出镜画面就会保留得更多。

这里的拆分和合并,主要是为了后面匹配素材。
比如某一句话需要单独配一个说明图、产品图或视频素材,就可以把这一句话单独放在一行。

接下来就可以开始匹配素材。
这里既可以使用软件内置 API 处理,也可以直接和 Codex 对话,让 Codex 帮你完成素材匹配。
1. 已分类素材匹配
如果软件里已经完成「已分类素材」索引,就可以在 Codex 中通过对话匹配素材。

当然,也可以直接点击软件里的一键匹配按钮。
两种方式都可以,看自己的操作习惯。

等待 Codex 完成素材匹配后,刷新页面即可查看结果。

2. 未分类素材匹配
如果是没有分类的素材,可以直接把文件夹目录发给 Codex,让它分析处理。
如果这个目录之前已经分析过,它会直接进行匹配。
如果是第一次使用,它会先分析素材,会占用一些时间。

3. 使用免费可商用素材
如果已经在素材库设置中配置好 Pexels 下载 API,也可以让 Codex 联网查找合适的免费可商用素材,并自动匹配到对应文案。

Pexels 素材需要联网下载,速度会受网络环境影响。如果素材比较多,可能需要等一会儿。

生成完成后,刷新网页窗口,就可以看到 AI 下载并匹配好的素材。
什么时候适合用免费素材库?
如果文案讲的是通用知识,网上有比较多通用素材,这种方式会比较好用。

4. 使用 Codex 生成图片
Codex 自带 GPT 图片生成能力。
如果某些素材不适合直接从素材库或 Pexels 中查找,也可以让 Codex 生成更贴合文案的插图。
比如视频里需要展示图表、表单、流程、示意图、火柴人插图,就可以让 Codex 自己生成,再添加到合适的文案位置。

5. 接入其他 AI 生成素材
除了 Codex 自带的图片生成能力,也可以把常用 API 保存到软件中,用其他模型生成图片、视频或音频素材。
例如,可以使用 Google 图片生成模型生成图片,使用即梦 / Seedance 这类视频生成 API 生成视频,或者使用 MiniMax API 生成音乐、音效、图片和视频。

这里就不展开了。
平时常用哪些模型,就可以把对应 API 添加到软件中。

6. 设置素材布局
素材匹配完成后,可以在旁边选择素材与口播人物之间的画面关系。

常见的布局有几种:
- 素材出现时,人物以圆形或方形窗口显示在角落。
- 人物抠像放在角落,素材作为主要画面。
- 素材叠加到口播人物上方,用来强调某个信息点。
这个根据视频风格和素材重要程度选择就行。
四、生成字幕和剪映草稿
素材添加完成后,切换到「生成草稿」页面,开始选择口播模板。

这里可以选择一个相对复杂一点的模板。
比如左右排列字幕、中英文字幕,或者更适合知识讲解类视频的字幕样式。然后让 Codex 生成字幕内容。

生成完成后,点击链接或刷新网页,就可以看到 AI 生成的字幕。
Codex 生成的字幕通常已经比较完整,但如果有特殊词、品牌词、人名、产品名,还是建议人工检查一下。

视频标题也可以交给 Codex 辅助生成。
你可以让它提供多个选题方向,再从里面选一个最合适的。

封面也可以直接用 Codex 内置的生图能力来做。
比如生成一张小红书风格封面,或者生成一张更偏教程、知识分享、工具介绍的封面。

最后设置一个合适的倍速,然后点击「生成草稿」。



草稿生成完成后,打开剪映检查一下字幕、素材、封面、标题、画面布局和倍速是否符合预期。
最后
口播剪辑,现在还做不到那种一键全自动剪辑。
我觉得现阶段也没必要追求那种不现实的东西。
更实用的方式是:AI 帮我们分析、生成和匹配,人来做最后判断,小映视频助手负责把这些内容稳定地组装成剪映草稿。
这样既不会把事情搞得很玄学,也能真正节省剪口播的时间。

现阶段最靠谱的方式:
AI 先分析,人来确认,小映视频助手负责稳定生成剪映草稿。
后面我会继续把这个流程打磨一下。
主要还是口播模板的更新,这个是大工程。
小映视频助手内部的 API 流程,会更适合普通用户直接使用;Codex + 小映的流程,则更适合喜欢折腾、想把各种 AI 能力都接进来的人。
如果你平时也在用 Codex、Claude Code 或 Workbuddy,可以试一下这个方式。
说不定以后很多口播视频,就真的可以从“剪半天”,变成“确认几遍,然后生成草稿”了。
没有回应