上一期我介绍过自己做的视频封面生成 skill:顶部一个标题,底下是类似屏幕演示的画面,可以同时生成 4:3 横版和 3:4 竖版两种比例。最近我把它开源了,叫 oil-cover,仓库在 github.com/oil-oil/oil-cover

oil-cover 生成的封面示例

安装和使用

oil-oil/oil-cover 仓库页面

最简单的安装方式是复制仓库链接,直接发给 Codex,告诉它「帮我安装一下这个 skill」,它就会把 skill 装好。

把仓库链接发给 Codex 让它安装

也可以手动把仓库克隆到 skills 目录:

# Claude Code
git clone https://github.com/oil-oil/oil-cover.git ~/.claude/skills/oil-cover

# 或 Codex
git clone https://github.com/oil-oil/oil-cover.git ~/.codex/skills/oil-cover

装完之后用斜杠命令 /oil-cover 触发,然后把视频的路径带上。在 Finder 里选中视频按 Option + Command + C 复制路径,粘贴到输入框里发出去,它就会开始生成封面。

斜杠触发 oil-cover skill

把视频路径粘贴给 skill

背后的流程

整个流程可以分成五步:抽帧、选帧、分析、生图、质检。

oil-cover 的五步流程:抽帧、选帧、分析、生图、质检

第一步是抽帧,把原始视频按每秒一帧抽出来,整段视频会变得很小。然后让一个多模态模型看完这些帧,选出其中最适合封面表现的一帧。接下来它会分析这张封面图应该怎么写生图提示词。

封面上展示的屏幕其实是美化过的。原始录屏里对话可能没有那么大,画面里可能还有我的人脸,直接截图放上去也不够清楚。既然是生图,就可以做适当的美化,这些处理都写在生图提示词里。skill 里还沉淀了一些具体的做法:标题怎么加装饰、背景渐变色怎么搭配,让成品相对好看一点。

仓库 README 里的封面示例,屏幕部分经过美化

生图完成之后,AI 还会自己检查一遍这张图片是否符合 skill 里的描述,不达标就重新生成。

两种执行模式

这个 skill 提供两种模式。

第一种是脚本模式,整个 skill 被封装成一个完整的脚本,运行过程中 Agent 不需要介入。这个模式需要配置一个 ZenMux 的 API key,ZenMux 是一个 AI 网关平台,脚本通过它调用 Gemini 3.5 Flash 来选帧,再调用 GPT Image 2 来生图。因为不依赖 Agent 自己做决策,不管用什么 Agent、对话里有多少历史上下文,执行结果都是稳定的。

ZenMux 平台首页

第二种是 Agent 自主执行模式。skill 提供一套流程和规范,由 Agent 自己一步一步执行,抽帧、分析、生图都由 Agent 完成。这个模式很适合在 Codex 里用,生图默认走 Codex 内置的 Image Gen 工具,就是斜杠命令 /image 调用的那个,背后同样是 GPT Image 2。这个模式完全不需要外部依赖,只用一个 Codex 就够了。

Codex 内置的 Image Gen 工具

第一次使用这个 skill 的时候,它会问你想用脚本模式还是 Agent 自主模式。选择会写进 ~/.oil-cover/config.json 这个配置文件,下次再调用就不会重复问了。这份配置 Claude 和 Codex 共享,两边读的是同一个默认值。

模式选择写进配置文件,之后不再询问

仓库 README 里演示的封面图都是我用这个 skill 实际生成的,基本一步到位,不需要我再手动调整。我小红书主页的很多视频也已经换上了新生成的封面。如果大家喜欢这种风格,可以安装这个 skill 试一试。

README 里实际生成的封面示例