这期内容分享如何从零到一把 Codex 用起来。我会结合一个实际的案例,介绍 Codex 里面各种特性的用法。

在开始使用之前,先了解 Codex 和日常的 AI 对话工具有什么区别。拿豆包这类对话工具举例,我们发一条消息,它就回复一条消息。而 Codex 在给出最终响应之前,可以自己调用外部工具执行多步流程:根据上一步工具调用的结果,再决定下一步调用什么工具,直到它判断任务已经完成,才给出最终响应。Agent 通用的工具一般是文件编辑工具、命令执行工具和联网调研工具。

界面和基本设置

Codex 主界面,左侧是项目和对话列表,右侧是对话框

Codex 的页面设计比较简单。左侧是常用选项,最主要的是项目管理和对话管理。

项目就是电脑上的一个目录。有些话题需要围绕一个文件夹执行,比如我日常开发会有一个项目文件夹,做小红书的内容也希望都沉淀在一个目录里。放在一个目录里面,Codex 也能方便地找到以前做过的信息作为参考。

左下角的 Chats 是没有明确主题时的临时对话。有一点要注意:很多产品会把 Agent 模式和对话模式区分开,但 Codex 里任何对话都是 Agent 模式,都可以调用工具、编辑文件。Chats 的对话默认在 Codex 自己的目录里维护一个工作区。我比较推荐的上手方式是创建一个新项目,在项目里面工作。即便没有具体的目录,我也会让它在我的用户目录下执行。

在项目里,点击右侧的小笔图标可以基于当前目录新开一个话题;点击小本子图标可以选择已有目录创建项目。

对话框底部有几个配置选项:

  • 左侧的加号用来上传文件,图片、PPT 都可以,也可以直接拖拽进窗口。
  • 权限建议开 Full Access。目前 Agent 已经具备独立工作很长时间的能力,开启之后 Codex 执行任何操作都不需要人工逐步批准。
  • 模型推荐 GPT-5.5,额度套餐不高的话选 standard 模式,速度相比其他模型也不慢。推理程度大多数任务开 high 就够了,已知比较复杂的任务再开 extra high。

第一个任务:联网调研

Agent 比较常用的一个场景是信息调研,它可以组合联网工具和自动化工具快速收集信息。这里我让它调研我自己的名字,触发方式很简单,直接说:

使用联网调研工具,帮我搜索一下这个博主的信息。

Codex 联网调研的结果,汇总了 GitHub、B 站、少数派等平台的公开信息

从过程里可以看到 Codex 检索了哪些信源:GitHub、哔哩哔哩、CSDN 这些能公开搜索到的渠道,它都会检索;也可以像谷歌搜索一样搜索关键词,找到链接再逐个查看内容。调研完成后,它找到了我在公开平台上做过的小产品、在少数派上发的文章,整理出主要作品和内容方向。响应底部有一个 source 角标,可以快速定位这条回复汇总了哪些平台的信息。

把结果存成 Markdown 和 HTML

如果只是联网调研,Codex 和豆包的区别不大。但 Codex 具备文件编辑能力,可以把调研结果存成本地文件,方便分发或者长期留档。这里我让它把结果保存为一份 Markdown 和一份美观的 HTML。

顺便解释一下这两种格式。Markdown 是一种文本格式,后缀是 .md。和 Word 相比它更轻,源码可以直接编辑,AI 编辑 Word 文件消耗的 token 也高;和纯文本相比它表达的信息更丰富,一个井号就是标题,一个横杠就是无序列表,语法很简单。以前主要是程序员用它写文章,AI 流行之后,让 AI 写文档一般也是 Markdown 格式。

HTML 就是网页的格式,浏览器里查看页面最终都是渲染 HTML。它的好处是能呈现很丰富的视觉信息,AI 对 HTML 的了解也很深,可以轻松做出好看的演示效果。代价是消耗的 token 比较多,而且直接让 Agent 写 HTML,有时候效果还不如 Markdown 渲染出来好看。所以让 Agent 交付内容时,轻度的内容让它写 Markdown,视觉信息丰富的内容让它写 HTML。

Codex 内置的 Markdown 渲染器,直接预览生成的调研文档

同一份内容的 HTML 版本,视觉效果明显更完整

两个文件生成之后,点击交付的文件就可以在 Codex 里面打开。Markdown 文件自带渲染器,标题和表格都会渲染出来;HTML 版本明显美观很多,因为它调用了我的一个 Skill,默认配色和排版就比较清爽,信息密度也没有那么高。

侧边栏对话

输入斜杠选择 side,可以在右侧打开一个侧边栏。它顶上像浏览器标签页一样,一边是刚才的文件,一边是一个独立对话。这个独立对话继承了左侧的对话历史,在这里的对话完全不影响左边。

这个功能有两个用法:左侧在执行任务时,遇到不理解的地方可以在右侧提问;发现样式有小问题,只要和主线程不冲突,也可以让它在右侧同步修改文件,相当于并行。

侧边栏里的独立对话,正在回答 Markdown 和 HTML 的区别

要注意两个限制:侧边栏的对话会过期,左侧对话时间久了之后,可能回不到侧边栏继续聊,所以它只适合临时处理小任务;右侧发送的消息没有办法撤回和编辑,修改已发送的内容会提示 Failed to add message。

浏览器自动化

联网调研只能拿到公开搜索引擎能找到的信息。我的很多信息在小红书、抖音这类自媒体平台上,要让 Codex 拿到这些信息,就要用自动化功能。

Codex 官方的开启方式:左下角点击用户头像进入设置,左侧选择 Computer Use,右侧把 Google Chrome 打开,它就会通过 Chrome 插件连接浏览器获取信息。如果没有看到这个配置,需要先在左侧插件里搜索 Chrome 安装插件,按流程跳转到浏览器开启扩展。

Codex 设置里的 Computer Use 页面,Google Chrome 已连接

我自己一般不用官方浏览器扩展,因为它的连接经常断,自动化任务中途断联对整体流程打断很强。我用的是 Ego Lite(lite.ego.app),它本身是一个浏览器,右上角有 space 的概念:人可以在一个空间里正常操作浏览器,Agent 在后台的空间里执行自动化操作,互不干扰。安装 Ego Lite 的 Mac 应用之后,在 Codex 里输入斜杠就能看到 ego-browser 这个自带的 Skill。

Ego Lite 浏览器,右上角是各个自动化任务的工作区

这里也提一下输入框的两个常用快捷键:斜杠用来触发指令和 Skill,上面是 Codex 官方提供的指令,日常大多不需要通过斜杠触发;下面的 Skill 后面会专门讲。

执行 ego-browser 之后,我把小红书主页链接发给它,让它补充信息。可以看到浏览器右上角多出一个小红点,任务空间的名字是「补充 oil 欧呦小红书的主页信息」,它在后台查看我更具体的身份信息。任务完成后,调研报告多了一个小红书渠道。我最近大部分的创作内容都在这个平台,整个报告一下子丰富了很多,HTML 里也补充了额外的信息,交付内容的真实度明显更高。

用 image Skill 生成配图

报告写完之后,假设我想把 HTML 分享出去,需要加一些配图。一种方式是让它联网找图,更好的方式是用 AI 生图。Codex 自带了一个 image Skill,输入斜杠 image 触发,它会调用 GPT Image 2 模型生成图片,存到本地目录,然后在 HTML 或 Markdown 里引用。

这里有一个比较好的实践:生成图片时让它生成灰底或者绿色底的。因为模型没有办法原生生成透明底的内容,带绿幕的图可以用脚本把主体抠出来,得到透明底的 PNG。做好看的设计很依赖这种透明底素材。

这里我让它生成一个手绘风格的小人牵着小狗的配图,要求绿色背景,生成后把背景抠掉。

生成的绿幕图片,接下来会用脚本把背景抠掉

最终效果:抠好的插画放进了 HTML 的个人卡片里

第一次把图加进 HTML 的时候,它发现人物的头被截掉了,于是用 ego-browser 截图查看最终效果,自己调试页面的呈现。完成后,个人卡片底下多了一张抠好的插画,整个 HTML 明显比没有配图的时候精致。

image 这个 Skill 除了做配图,还有一些偏生产力的场景:做游戏时一张图可以生成很多游戏资产;做前端设计时生成定制化的图标;也可以做电商产品图和各种封面图。

子 Agent 和上下文

接下来是使用子 Agent 提升执行效率的技巧。默认情况下 Codex 不会主动调用子 Agent,这点和 Claude Code 的策略不一样。想让它调用,要在提示词里说明,比如:

帮我并行三个子 Agent,继续深挖这个博主的信息。

它会创建三个子 Agent,从不同角度切入搜索,效率相当于三倍。这里它给三个子 Agent 分配了不同渠道:一个查互联网公开信息,一个查小红书,一个查 GitHub。点击子 Agent 的名字可以查看它的执行情况,执行方式和主 Agent 一样。

对话窗口底部的上下文用量提示,显示已用 137k / 258k tokens

这里解释一下对话框里的小圆环,它展示的是当前对话的上下文用量。一个对话有最大上下文长度,这里是 258k tokens,里面包含我们发送的信息、AI 的响应、中途查看的所有文件和调用的 Skill。触达上限后会触发压缩,把当前对话精简,只保留比较重要的信息。压缩之后再对话,会丢失一部分信息。而且上下文越长,指令遵循性越差,就像人在一本厚说明书里找某个位置,比在薄册子里找要难。所以日常对话要控制上下文,不相关的问题不要放在同一个话题里问,新开一个话题。GPT-5.5 比较强,各种上下文长度下都能保持比较好的指令理解;用相对弱一点的模型时,就要更注意这个问题。

子 Agent 的另一个好处是每个子 Agent 的上下文是独立的。探索过程中走的弯路都留在子 Agent 的上下文里,最后只把正确答案返回给主 Agent,节省主 Agent 的上下文开销。

Codex 创建了三个子 Agent,分别负责公开信息、小红书和 GitHub

子 Agent 还可以自定义:写系统提示词之后,让主 Agent 每次都调用指定的子 Agent,它做的事情就更垂直。子 Agent 也可以指定模型,任务简单的话,可以分配速度更快、开销更低的模型。

三个子 Agent 探索完之后,我的信息又丰富了很多。Markdown 已经很长,几乎包含所有公开信息,底下还有参考来源;HTML 里补充了小红书主页和更多 GitHub 项目详情,几乎可以作为一份个人简历。

导出 Word 和 PPT

报告从调研到创作都完成了,但在一些传统企业里,还是需要 Word 或者 PPT 格式的输出。Codex 左侧的插件里默认安装了 Word、PDF、Excel、PPT 这类办公软件的 app,专门处理这些格式。不需要额外的连接器配置,直接说就可以:

帮我将我的 Markdown 整理为一个 Word。

把 HTML 转成 PPT 也是一句话的事。反过来,以前的 PPT 模板也可以拖拽进对话框,让它基于模板创作其中几页,再结合前面的调研和图片生成丰富整体设计。

生成的 Word 文档,Codex 自带预览器,不需要打开 WPS 或 Office

处理这类复杂任务时,Codex 经常会写 Python 脚本来完成,现在的 AI 很多时候就是通过写代码来实现复杂工作流的。生成的 Word 文件可以直接在 Codex 里预览,转换成 Word 之后看起来正式了很多。

Skill 是什么

斜杠可以触发本地的 Skill,Codex 内置了一些,最主要的一个叫 skill-creator,是用来创建 Skill 的 Skill,它告诉 Codex 怎样把一个 Skill 创建成指定的格式。

本质上 Skill 就是一个文件夹,里面至少要有一个 SKILL.md 文件。比如刚才调研了我的信息,下次想快速利用这些信息,我可以直接说:

帮我将我的个人信息做成一个 Skill,方便我下次快速查看。

它会把这些公开信息整理成一个 Skill,起个名字叫 oil-info,以后它可以直接读这份文档。

Skill 的作用主要有两个。一是提供外部知识:oil 欧呦这个名字显然不在模型的训练数据里,把信息直接提供给它,节省它自己探索的时间。二是维护工作流:比如这次我深度调研了一个用户,下次调研其他用户时我希望走一样的流程——先联网调研,再用自动化工具补充,然后写 HTML,再转成 Word。这个复杂流程不想每次重复交代,就可以创建成一个 Skill。

创建 Skill 有两个要点。第一,Skill 一般不在新对话里创建,因为新对话里它只有训练数据,没有执行过任何流程。Skill 是经验的总结,应该在执行了很长的步骤之后,让它复盘之前的经历来创建,效果才好。第二,最好在触发上下文压缩之前创建。压缩之后过往信息被精简,中途的某个步骤可能没那么具体了,这时候创建出来的 Skill 效果会打折扣。

Skill 的细节不用关心,几乎没有人会手动写 Skill,都是让 AI 创建的。它有一个机制叫渐进式加载:斜杠列表里每个 Skill 前面是名字,后面是描述。除了主动用斜杠触发,我们也可以直接用自然语言,比如让它查看 oil 的信息,它会匹配 Skill 的描述和我们的指令,匹配上就会去读里面的内容。文档里还可以写「读到这个段落时去看另一个参考文件」,它就会再去读那个文件。这就像查字典,先看目录,通过索引匹配到对应章节再读正文。这样的好处是,装了大量 Skill 时不会把所有信息都丢进上下文,只在执行对应任务时加载对应的 Skill,既节省上下文,也提升执行的准确度。