GPT 5.6 上线之后,我在 Codex 里深度使用了几天,这篇文章整理一下实践心得和使用技巧。
先说我自己的使用情况。我一般使用 5.6 Sol 模型,加上 Extra High 的思考程度。今天一天时间,我已经把周额度用了 50%。这两天 Codex 不会限制 5 小时的使用额度,所以一天之内,如果有办法消耗的话,可以把整个周的额度都用完。

不建议开 Ultra 档
第一个点是思考程度。我不太建议大家开 Ultra 模式,它有一个问题:太过度地机械化使用子 Agent 了。之前用过 Claude Code 的话会发现它的 ultra 模式也是一样,会频繁使用 Dynamic Workflow 去执行任务,经常在不太需要的时候触发各种子 Agent,来执行一些没有那么复杂的任务。

我有一次让它在一个空项目里面开始构建整个项目,它第一次看代码的时候,就直接跑一个子 Agent。整个项目都是空的,它甚至连项目里面的文件列表都没拉一下,就让一个子 Agent 探索这个项目,然后发现整个项目是空的,再把这个空的结果响应给主 Agent。这纯粹就是浪费。
不用 Goal 也能长时间稳定执行
现在不论是 Extra High 还是 Ultra 模式,Codex 的指令遵循性都很强。我们不用自己去触发 Goal,只要把任务讲清楚了,它都可以自己非常长时间地稳定执行一个任务。

我有一次让它启动三个子 Agent 去 review 代码,基于 review 的结果再优化代码。这个循环它自己执行了三四次:启动三个子 Agent,review 代码,修改代码,然后再启动三个子 Agent,直到这三个子 Agent 没有任何异议的时候,它才说完成任务了。这是我在没有设置 Goal 的情况下发生的,之前很难做到这样的效果。
另外一个调整是,这两天 Codex 的上下文从之前的 35 万左右又调回了 26 万。这个变化对我影响不算太大,但我肯定希望上下文能更长一点,这样执行任务的时候不会频繁压缩上下文。
写文案和 UX 能力的修复
GPT 5.6 修复了一个很严重的问题。之前的 Codex 很喜欢在写文案的时候,把一些要告诉我们的事情写到文案里面去,或者写到 HTML 里面去。比如我让它做一个蓝色的网站,它就会把「这是一个蓝色的网站」写到 HTML 上面,但这些内容是面向我们的,不是面向用户的。这个问题导致之前 Codex 用来做 UI 设计或者写文档的可用性很差,GPT 5.6 之后就不会再出现了。
UX 能力也比之前有大幅提升。我是前端工程师,我们在调整项目里一些已有交互的时候,以前的 GPT 5.5 的 UX 设计能力几乎是零。比如一个标签编辑框,它可以做成上面是用来添加标签、下面是用来减少标签的,我几乎没遇到过任何一个模型会这样设计交互。GPT 5.6 之后不会再出现类似的问题,它对于各种组件的使用、对于大致的 UX 有了自己的理解,不会再做出那么费解的交互设计。
UI 设计能力到了第一梯队
UI 能力比之前提升了特别多。周末的时候,我想把之前做 Skill 和做 PPT 的一些心得沉淀成一个 PPT Skill,然后让 GPT 5.6 去总结,它做出来的 PPT 效果不错。

除此以外我还做了一个新的 Skill,可以帮我们美化 GitHub 的 README 页面。下面是他写出来的 SVG,它的 UI 能力、排版能力、对配色的理解、对 SVG 的使用,都比之前有了非常强劲的提升,已经达到第一梯队了。这些都是它自己画的,我没有太多介入,以前这种效果可能都得用 Gemini 来做。

模棱两可的指令会先反馈
还有一个很重要的点,它对指令的理解比之前好很多。之前的 Codex 很喜欢在我们给一个模棱两可的指令之后直接去干活。但是现在,比如我这里问它「很多地方甚至没有内容,你觉得是哪里有问题」,像这种模棱两可的问题,以前问 Claude 的话,它可能会停下来,查好了问题告诉我们是什么问题,问我们要不要修。现在 Codex 也能做到了:这个指令执行完成之后,它就把问题反馈给我,没有直接去把这个问题修复掉。

之前的 Codex 应该不是这样做的,我只要问这种模棱两可的问题,它一定就把活直接干完了。假设我们本身的预期就是让它把问题反馈回来,这时候切了个话题,一回来发现代码已经面目全非,驾驭感就很差。现在 GPT 5.6 的驾驭感比之前 GPT 5.5 好很多。
用 README 装修 Skill 的实际效果
做了 GitHub README 装修这个 Skill 之后,我让它帮我调整以前那些 Skill 的 GitHub README,它都能够做得很好看。

像下面这种截图,虽然是我有给它参考图,但是它能够自己去调用一些浏览器的工具,把图拼起来然后再截图,再和上面的 SVG 拼在一起,做出很好看的设计效果。


不再需要 Claude 了
现在从我的角度出发,我觉得我们没有任何理由再去使用 Claude 模型。本身这个模型就很难用,风控那么严格。以前我会去使用 Claude,最主要是因为 Codex 有自己的短板:指令遵循性没有那么好,写出来的文案 AI 味比较重,而且很喜欢把要告诉我们的话写到产物里面去,再加上 UI 设计能力和 UX 设计能力也很差。现在 GPT 5.6 已经补足了所有这些问题,目前来说 Codex 加上 GPT 5.6 已经是一个非常完善的 Agent 了。等过几天 35 万上下文开出来,Codex 的使用体验还会比之前有更大的提升。
