之前我介绍过 Codex 里面的 Chrome 插件,讲了它的设计理念,以及 Codex 为什么要集成这个插件。这篇文章讲它的具体用法:从安装到执行一个自动化任务,中间每一步怎么操作。
安装插件和浏览器拓展
进入 Codex 页面之后,在左侧选择 Plugins,找到 Chrome 插件。列表里没有的话可以直接搜索;搜索也搜不到,说明 Codex 的版本需要升级,点一下 Update 升级到最新版本就能看到了。

点击插件旁边的加号,Codex 会从 OpenAI 的云端把插件拉取下来。

插件拉取完成后,还需要安装一个浏览器拓展。在插件页面点 Open,会跳转到 Chrome 应用商店,依次点击「添加至 Chrome」和「添加扩展程序」。

安装完成后回到 Codex,可以看到插件已经安装成功。插件里面包含一个默认设置,还有一个 Skill,这个 Skill 用来指导 Codex 怎么使用这个浏览器拓展。

确认拓展的连接状态
开始任务之前,先打开一个空话题,检查一下浏览器拓展的连接情况。点击 Chrome 工具栏上的 Codex 图标,显示 Connected 就是连接成功了。
如果连接不成功,可以让 Codex 自己去定位问题出在哪里,它有查看这个拓展的权限。

用 /Chrome 下达任务
在输入框里输入 /Chrome,就可以给 Codex 一个浏览器自动化任务。

我演示的任务是信息收集:把我的小红书创作后台里的内容数据全部拉下来,整理成一个表格。这里我把创作中心的 URL 直接给它,这样它不用自己去网上搜索哪个页面是对的,可以直接进入对应的创作中心。浏览器本身是已经登录好的,有登录态。

这个自动化工具的原理是:Codex 先确认页面里能看到哪些字段,然后在浏览器上自己执行滚动、点击、输入这些操作。定位页面元素有两种方式,一种是通过截图找到对应的元素,另一种是用程序把页面的网页结构拉下来分析。比如发视频的时候有一个「开启原创」的选项,它会识别页面上的文字,点击文字前面的单选框;要提交发布的时候,它会点击发布按钮,如果有二次确认,再点击弹窗上的确认按钮。
执行过程和结果
任务开始之后,可以看到被控制的标签页图标变了,多了一个小箭头标记。Codex 通过截图读取页面上的数据,再分析页面的数据结构。


执行过程中网页不需要保持在前台,我们在后台做自己的事情完全不影响它,只要不把这个页面关掉就可以了。
这次的数据抓取速度比较快,几分钟就爬完了 197 条内容,因为我这个页面的数据结构比较直观,不需要多次操作。如果要抓取的数据需要逐个点进去查看,比如每条视频的详细内容,花的时间会长一些。

表格做完之后,Codex 还会自己通过视觉识别的方式检查表格是否正常写入了。

最后生成的表格里,除了每一期内容的明细数据,它还多做了一个汇总表,比我要求的更周到一点。

两个注意点
- 使用过程中记得检查 Codex 和浏览器的连接状态,断开了任务就会失败。
- 浏览器最好用 Chrome,不要用其他浏览器。这个插件在 Codex 里面名字就叫 Chrome,用 Chrome 可以减少很多问题。
另外有两个建议。如果某个固定流程每天都要执行,可以把它做成一个 Skill,这样不用每次重复描述任务。也可以让 Codex 尝试把自动化流程做成一个程序化的脚本,而不是每次都让 AI 自己重新执行一遍。
这个插件整体的使用很简单:安装插件之后,在输入框里写 /Chrome,描述清楚任务,它就会开始操作浏览器。
