我之前没有长期使用过 Grok。Grok 4.5 发布后,我安装了官方 CLI,在复杂系统和单文件 HTML 任务里分别测试它。最明显的结果出现在 UI 设计:短提示词就能得到完整页面,模型还能并行生成页面需要的插图。

x.ai 发布页的 DeepSWE 跑分把 Grok 4.5 和 GPT 5.5、Opus 4.8 放在接近的档位,上下文长度是 50 万。这些信息让我决定继续测试,但下面的判断都来自我在 Grok CLI 里的实际操作。

x.ai 发布页上的 Grok 4.5 DeepSWE 跑分

执行 UI 任务时,Grok CLI 会先在终端里整理设计方案,再继续生成代码和图片。

Grok CLI 在终端里输出设计方案

UI 设计能力的实际表现

我只给了很短的提示词,它就生成了一个很长的单文件 HTML 页面。页面结构完整,排版也比我平时从 Codex 得到的结果更大胆。

Grok 生成的第一个人文感单 HTML 页面

我还让它完成了第二个,这一个更偏艺术感一些。注意页面里的这些图片,它们不是联网搜索到的,而是 Grok 自己调用图片生成工具生成的。

Grok 生成的第二个艺术感画廊页面

在这两次生成里,Grok 4.5 的原生 UI 设计表现好于我之前使用 Gemini 3.1 Pro 的结果,也明显超过 Codex。这个判断只覆盖短提示词生成单文件 HTML 的场景。

设计之外的实际表现

它的日常编程能力可以完成我的测试任务,但输出文案带有明显的翻译腔。方案本身能够读懂,直接交付给读者的文案则需要再整理。

图片生成速度是另一个明显差别。我在 Codex 里使用 imagegen 时,生成一张图片通常要等待较长时间,连续生成还可能触发上下文压缩。在 Grok 里,图片可以并行生成;一次生成 20 张图片时,大约一分钟就能完成。它的图像质量不一定优于 GPT Image 2,但速度更适合需要多张配图的页面任务。

模型的输出速度也很快,我的体感比 Codex 的 Fast 模式更快。我使用过的模型里,Composer 2.5 输出更快,但 Grok 4.5 在这次任务里完成的内容更复杂。

实测:三分钟生成狼人杀落地页

为了把前面的体感落到一个完整任务上,我让 Grok 官方 CLI 生成一个狼人杀落地页。输入的提示词很短:

帮我做一个狼人杀的落地页,我要求你做的非常有设计感,而且里面你要使用你的图片生成工具补充一些好看的插图。风格是比较复古的。

在 Grok CLI 里输入狼人杀落地页的提示词

开始执行后,它并行调用了 4 个图片生成工具。第一批插图完成后,又补了 3 张装饰图。

Grok CLI 并行调用 4 个图片生成工具

从执行顺序看,图片生成没有成为这个任务的等待瓶颈。

Grok 补生成的 3 张装饰性插图

整个任务用了 3 分钟,包括图片生成和 HTML 实现。首屏已经形成复古的视觉方向,并且使用了刚才生成的插图。

狼人杀落地页的首屏

继续往下滚动,页面使用层叠排版连接不同模块,没有退回常见的等宽卡片列表。

落地页里的层叠排版效果

这些插图都来自同一条页面提示词,没有逐张补充要求。

落地页里的插图和模块细节

我会怎么使用 Grok 4.5

这次测试以后,我会优先把需要探索视觉方向、同时需要多张插图的单文件 HTML 交给 Grok 4.5。它在短提示词下完成了页面结构、排版和图片生成,3 分钟的完整任务也验证了速度优势。

它的边界同样清楚:文案有翻译腔,图片质量不一定优于 GPT Image 2,这次也没有验证它在长期维护复杂前端项目时的稳定性。因此,我对它的结论集中在原生 UI 探索和快速生成带图页面,不扩展到所有编程任务。