之前的视频里我介绍过 Codex 官方的 Chrome 插件,通过它可以让 Codex 自动控制浏览器完成一些任务,比如抓取小红书等平台的数据、做产品调研时收集网页信息、自动填写表单和发布视频,前端开发者也可以用它做 UI 自动化测试。
除了 Codex 官方的插件,其他 Agent 也有类似的工具,比如我之前介绍过的 Agent Browser。Codex 插件解决的是更方便地接管我们日常使用的浏览器,产品化做得更好,但执行方式没有变化:不管是 Agent Browser 还是 Codex 插件,都是通过一次一次执行命令来完成浏览器操作。实际使用中它们的效率不算高,速度偏慢,大多数时候只能丢在后台执行,复杂任务的 token 开销也比较高。
最近我发现了一个新的浏览器自动化工具 Ego Lite,它的实现思路和这两类工具都不一样。
Ego Lite 的上手过程
Ego Lite 的产品形态是一个桌面端浏览器,也可以叫它 Ego Browser。在官网(lite.ego.app)点下载按钮就能拿到安装包。

下载完成之后,它的图标是这样的:

第一次打开会有一个上手流程,把原本 Chrome 里的历史记录和个人信息全部同步过来。同步完成后打开浏览器,界面和 Chrome 基本一样,只是产品上有一些不同。
接下来打开任何一个 AI Agent,比如 Codex 或者 Claude Code。在一个空话题里按斜杠输入 Ego,就能看到 Ego Browser 的 Skill。这个 Skill 和 Agent Browser 的作用类似,负责指导 Agent 如何控制 Ego Browser 完成自动化操作。

Claude Code 里同样有这个 Skill:

整个上手过程很顺:点一个按钮完成信息同步,Skill 也自动装到了各个 Agent 里。它不像 Codex 的 Chrome 插件那样绑定某个产品,用任何 Agent 都可以操控浏览器。
实际执行一个任务
我在 Codex 里触发 Skill 之后,直接发了一句话:帮我复盘一下最近小红书的数据。
任务开始执行后,浏览器右上角会出现一个小鼠标样式的图标,旁边的数字代表后台有多少个 AI Agent 正在进行浏览器自动化操作。

点击这个图标可以打开 Space 管理界面。Space 是 Ego Lite 的核心概念:人和 AI 各自有自己的工作空间。执行任务时 Agent 跑在自己的 Space 里,人继续在原来的空间操作,互不干扰。

进入 Agent 的 Space 还能看到实时进度。如果遇到验证码或者发布视频这类必须人工确认的操作,可以点击「接管」自己处理;想停止任务就点击「终止任务」。

任务完成后,Codex 返回了完整的复盘结果,数据是它用 Ego Browser 打开创作者中心拿到的:

使用流程就这么多:安装桌面端应用,在任何一个 AI Agent 里调用它的 Skill,Agent 就能自动执行浏览器相关的操作。
Space 和标签页的区别
之前 Codex 插件和 Agent Browser 都是控制浏览器创建新的标签页,这会带来几个问题:
- 操作可能互相冲突。比如一个 Agent 在某个页面执行退出登录,另一个 Agent 正在操作相关页面,登录状态就丢了,需要重新登录。
- 同一个浏览器里一个标签页卡死,整个浏览器都会跟着卡死。
- 并行任务多的时候,标签页会非常乱,不如多个空间管理起来方便。
Space 不是打开一个新的浏览器实例,那样内存占用会比较高。它仍然在同一个浏览器里,只是自己做了一层包装,隔离的是执行任务用的 Session、LocalStorage 和 ServiceWorker 注册表。有了这个资源概念之后,多个 Agent 可以真正并行执行,浏览器的资源开销也会比跑多个浏览器实例更低;如果只是和多标签页相比,资源差别不大,但在 Space 维度管理不同任务的资源,比在标签页上管理更清楚。
用写代码代替逐条执行命令
Ego Lite 更重要的一点差别是控制浏览器的方式:Agent 是写代码来控制的。
Agent Browser 这类工具的执行方式是通过 CLI 一步一步来:先调用 CLI 获取页面上的所有元素,判断需要点击哪里,点击之后再查看页面反馈,一小步一小步地推进。如果某一步点击后反馈错误,就要重新查看页面再执行,步骤又多又碎,一旦出错整个执行链路就变得很重。
Ego Lite 是让 Agent 写一段代码,在代码里调用它封装好的内置函数。

技术上它做得更彻底:Agent 可以直接启动一个完整的 Node.js 进程作为自己的运行时,这些函数默认注入为全局函数,不需要额外引用。AI 看完页面上的元素之后,可以把后面多步操作组织成一个脚本一次执行。比如发布视频时上传文件、打开原创开关、填写标签,可以一次性写完执行,而不是填完标题再查看一次页面元素、点完开关再查看一次。
一次写一大段代码能做的事情也更多:
- 分支判断:调用失败时用 if else 走不同的处理逻辑;
- 批量操作和循环;
- 错误判断和重试;
- 组合多个工具;
- 把重复用到的元素写成变量,不用重复写命令。

之前没人这样做,主要是因为大家想更方便地兼容 AI Agent,而写 Skill 或者浏览器扩展的方式不够原生,所以一直局限于用 CLI 让 Agent 执行操作。
效率上,写代码方式的下限和 Agent Browser 这类工具一样,因为有些任务确实只能点一下、看一下地推进;但它的上限更高,尤其在复杂任务里能有更好的效率,产品化的页面也做得更完整。
如果对浏览器自动化工具有要求,不满足于 Codex 的 Chrome 插件,或者根本没办法安装 Chrome 插件,可以试试 Ego Lite,目前还是免费的。
