我平时使用 Screen Studio 录制视频,再把停顿剪辑、专业名词校对和字幕烧录交给 Claude Code 里的自制 Skill 完成。录制和最终检查仍然由我处理,AI 主要负责中间几项重复、耗时的操作。
先看我平时录出来的效果:一段电脑录屏,右下角有一个我自己的头像。

用 Screen Studio 录制
我用的录制工具是 Screen Studio。开始录制之前,先选择录制区域,它有四种方式:
- Display:录制某一个显示屏,比如笔记本屏幕或者外接显示器;
- Window:录制某个应用的窗口,比如只录访达或者终端,切换其他应用时画面不会跟着变;
- Area:录制自己框选的一块区域;
- Device:录制手机上的内容。
选项条右边还有三个开关,分别控制是否开启摄像头、是否开启麦克风,以及是否录制系统音频。系统音频录的是电脑内部播放的声音,比如电脑在放歌,歌声会直接录进视频,而不是通过麦克风录外放。

我自己一般使用 Area。因为录制过程中我经常要切换不同的应用展示内容,只录一个窗口不够用。框选好区域之后,可以确认区域的尺寸和位置,然后点击 Start recording 开始录制。

录制过程中如果需要停下来思考,我会点暂停,回顾一下再继续。点击停止之后,左下角会出现一个预览弹窗,可以直接保存、复制、分享,双击它就进入编辑页面。

在 Screen Studio 里剪辑
编辑页面底下是视频轨道。Screen Studio 会自动根据鼠标点击生成放大缩小的效果:鼠标点哪里,画面就放大哪里。点击轨道上紫色的缩放标记,可以调整放大的倍数,也可以拖动它的起止位置,让放大持续更久。

剪辑之外,我会调整几个固定的设置。
第一个是摄像头的形状。我虽然会露脸,但希望头像区域小一点,让大家重点关注录屏内容,所以 Shape 我选择方形。

第二个是 Padding。Screen Studio 默认会给录屏加一个模拟显示屏的背景边框,但默认露出的背景太多,中间实际展示内容的区域就小了。尤其是我录的是横屏内容,大家在竖屏里看,比例会更小。我会把 Padding 调到大概 2%,只露出一点背景来提升质感,同时让中间的内容区域尽量大。

第三个是音频。我会开启 Improve microphone audio,它会处理背景噪音并提升人声质量。我的视频没有 BGM,主要是口播,电脑跑任务时的风扇声和环境噪音比较多,开启之后人声听起来会轻松一些。

处理完点击右上角的 Export 导出。我选择的格式是 MP4,质量 4K,压缩程度 Social Media,帧率 60 帧。

以前用剪映加字幕的问题
早一点的视频我不加字幕,导出之后就直接发了。后来我开始给视频加字幕,用的是剪映的 AI 自动识别,但这个过程对我来说太花时间了。
一是字幕里有很多专业名词,剪映识别得不对,我需要逐条修正。二是工程还要再导出一次,一个五六百 MB 的视频导出之后变成一点几 GB,既占电脑空间又导得慢。正常录一期视频,剪完大概 30 分钟,加上剪映这一套流程就要 50 分钟。
用 AI 完成剪辑和字幕
最近我把这整套工作流自动化了。录制还是我自己录,但后面的剪辑和加字幕都交给 AI 完成。最近几期视频底下的字幕就是 AI 加的,里面几乎没有识别错误的专业名词,我自己也不需要逐条检查。
具体做法是我在 Claude Code 里面做了一个 Skill,叫 Screen Studio Editor。调用之后它会读取我的 Screen Studio 工程文件,自己完成粗剪,我在 Screen Studio 里连停顿和气口的剪辑都不需要手动处理了。

剪辑完成之后是字幕环节,分几步:
- 调用多模态的 Gemini 识别视频画面,把里面的专业名词提取出来。如果视频的信息密度比较低,就换成抽帧的方式,从视频里抽几张图片让 Claude 识别;
- 用 Whisper 模型识别我的口播,转成文字稿;
- 结合前面提取的专业名词校对文字稿,生成字幕文件,再烧录回原始视频。
最后输出的就是带字幕的视频和一份对应的 ass 字幕文件,整个过程都是 AI 自己完成的。

这套工作流后来我做了详细分享,也把它开源了,可以查看我把剪辑录屏和加字幕的 Skill 开源了这篇文章。
