我平时使用 Screen Studio 录制视频,再把停顿剪辑、专业名词校对和字幕烧录交给 Claude Code 里的自制 Skill 完成。录制和最终检查仍然由我处理,AI 主要负责中间几项重复、耗时的操作。

先看我平时录出来的效果:一段电脑录屏,右下角有一个我自己的头像。

平时录制的视频效果,屏幕录制加右下角头像

用 Screen Studio 录制

我用的录制工具是 Screen Studio。开始录制之前,先选择录制区域,它有四种方式:

  • Display:录制某一个显示屏,比如笔记本屏幕或者外接显示器;
  • Window:录制某个应用的窗口,比如只录访达或者终端,切换其他应用时画面不会跟着变;
  • Area:录制自己框选的一块区域;
  • Device:录制手机上的内容。

选项条右边还有三个开关,分别控制是否开启摄像头、是否开启麦克风,以及是否录制系统音频。系统音频录的是电脑内部播放的声音,比如电脑在放歌,歌声会直接录进视频,而不是通过麦克风录外放。

Screen Studio 的录制选项条,包含 Display、Window、Area、Device 和摄像头、麦克风、系统音频开关

我自己一般使用 Area。因为录制过程中我经常要切换不同的应用展示内容,只录一个窗口不够用。框选好区域之后,可以确认区域的尺寸和位置,然后点击 Start recording 开始录制。

框选区域的尺寸和位置设置,下方是 Start recording 按钮

录制过程中如果需要停下来思考,我会点暂停,回顾一下再继续。点击停止之后,左下角会出现一个预览弹窗,可以直接保存、复制、分享,双击它就进入编辑页面。

停止录制后左下角的预览弹窗,包含 Save、Copy、Share、Edit 按钮

在 Screen Studio 里剪辑

编辑页面底下是视频轨道。Screen Studio 会自动根据鼠标点击生成放大缩小的效果:鼠标点哪里,画面就放大哪里。点击轨道上紫色的缩放标记,可以调整放大的倍数,也可以拖动它的起止位置,让放大持续更久。

编辑页面,轨道上的紫色缩放标记和右侧的切片编辑面板

剪辑之外,我会调整几个固定的设置。

第一个是摄像头的形状。我虽然会露脸,但希望头像区域小一点,让大家重点关注录屏内容,所以 Shape 我选择方形。

摄像头设置面板,Shape 选择 Square

第二个是 Padding。Screen Studio 默认会给录屏加一个模拟显示屏的背景边框,但默认露出的背景太多,中间实际展示内容的区域就小了。尤其是我录的是横屏内容,大家在竖屏里看,比例会更小。我会把 Padding 调到大概 2%,只露出一点背景来提升质感,同时让中间的内容区域尽量大。

背景设置面板,Padding 滑块调到 2.7%

第三个是音频。我会开启 Improve microphone audio,它会处理背景噪音并提升人声质量。我的视频没有 BGM,主要是口播,电脑跑任务时的风扇声和环境噪音比较多,开启之后人声听起来会轻松一些。

音频设置面板,Improve microphone audio 开关,说明文字是 Reduce microphone recording noise and normalize volume

处理完点击右上角的 Export 导出。我选择的格式是 MP4,质量 4K,压缩程度 Social Media,帧率 60 帧。

导出设置弹窗,60 FPS,压缩选项里选中 Social Media

以前用剪映加字幕的问题

早一点的视频我不加字幕,导出之后就直接发了。后来我开始给视频加字幕,用的是剪映的 AI 自动识别,但这个过程对我来说太花时间了。

一是字幕里有很多专业名词,剪映识别得不对,我需要逐条修正。二是工程还要再导出一次,一个五六百 MB 的视频导出之后变成一点几 GB,既占电脑空间又导得慢。正常录一期视频,剪完大概 30 分钟,加上剪映这一套流程就要 50 分钟。

用 AI 完成剪辑和字幕

最近我把这整套工作流自动化了。录制还是我自己录,但后面的剪辑和加字幕都交给 AI 完成。最近几期视频底下的字幕就是 AI 加的,里面几乎没有识别错误的专业名词,我自己也不需要逐条检查。

具体做法是我在 Claude Code 里面做了一个 Skill,叫 Screen Studio Editor。调用之后它会读取我的 Screen Studio 工程文件,自己完成粗剪,我在 Screen Studio 里连停顿和气口的剪辑都不需要手动处理了。

Claude Code 里的 Screen Studio Editor Skill 文档

剪辑完成之后是字幕环节,分几步:

  1. 调用多模态的 Gemini 识别视频画面,把里面的专业名词提取出来。如果视频的信息密度比较低,就换成抽帧的方式,从视频里抽几张图片让 Claude 识别;
  2. 用 Whisper 模型识别我的口播,转成文字稿;
  3. 结合前面提取的专业名词校对文字稿,生成字幕文件,再烧录回原始视频。

最后输出的就是带字幕的视频和一份对应的 ass 字幕文件,整个过程都是 AI 自己完成的。

输出目录里带 subtitled 后缀的视频文件和 ass 字幕文件

这套工作流后来我做了详细分享,也把它开源了,可以查看我把剪辑录屏和加字幕的 Skill 开源了这篇文章。