2026 年 8 月 13 日,DeepSeek 和 Grok 同时发布了几项更新:DeepSeek-V4-Pro 推出正式版,DeepSeek 自己的 Agent 工具 DeepSeek Harness 开源;另一边,Grok 4.6 也正式发布。

我当天查看了 V4-Pro 的更新和各项指标,在本地安装了 DeepSeek Harness,也把日常任务切换到 Grok 4.6 连续使用了一天。这几项更新带来的感受并不一样:V4-Pro 和 Harness 更像一套刚开始成型的第一方 Agent 方案,还需要继续观察;Grok 4.6 的变化则已经可以直接反映在日常任务里。

DeepSeek 开始补上自己的 Agent 工具

DeepSeek-V4-Pro 正式版这次主要增强了 Agent 能力。根据 DeepSeek 官方说明,新版本可以按任务选择不同的推理强度,原生支持 OpenAI Responses API,并针对 Codex 提供了快速配置方式。

从官方公布的指标来看,0813 正式版在多项 Agent 和编码评测中都比预览版有明显提高。官方还特别说明,部分 Code Agent 任务使用即将发布的 DeepSeek Harness 最小模式完成测试。

DeepSeek-V4-Pro 0813 正式版与预览版的指标对比

因为当天还没有在长任务里完整测试 V4-Pro,我暂时不下具体的使用结论。相比模型本身的分数,我更关注的是 DeepSeek 同时开源了 DeepSeek Harness。这意味着 DeepSeek 开始自己处理模型和 Agent 框架之间的配合问题。

刚开源时的 DeepSeek Harness 仓库

DeepSeek Harness 目前处于开发者预览阶段,采用 MIT 许可证。官方把它定义为一个采用「一切皆插件」架构的开源 Agent Harness。它通过本地 Web UI 工作,最简单的启动命令是:

npx @deepseek-ai/dsh web

启动之后,默认访问地址是 http://127.0.0.1:3080。进入设置页面填写 DeepSeek API Key,再选择一个本地工作区,就可以新建会话。

我在本地启动的 DeepSeek Harness 预览版界面

刚安装完成时,我最初的顾虑是网页形态可能会限制它能完成的操作。不过仔细查看官方文档和本地运行机制之后,这个判断需要补充一层:它虽然通过浏览器呈现界面,但服务实际运行在本地,可以读取和修改工作区文件、执行终端命令、拆分任务并维护执行计划;遇到涉及系统权限的操作,也会按照当前配置的策略弹出确认。

它目前最值得观察的地方,是第一方适配。我们以前把 DeepSeek 接入第三方 Agent 框架时,模型、工具调用、视觉输入和任务循环通常由不同组件拼接处理。现在由 DeepSeek 自己维护 Harness,后续就能专门针对 V4 的推理机制和工具调用持续优化。

不过这些能力当前仍然处于预览阶段,官方也明确提醒后续可能出现不兼容的接口改动。我已经在本地完成安装与 API Key 配置,由于还没有经过更长周期的真实项目验证,先保留对其独立执行能力的判断。

Grok 4.6 的变化已经能直接感受到

Grok 4.5 我之前一直在使用,它的优点很直接:执行速度快,大多数中小任务都可以很快完成。但问题也很明显,有时会急着开始处理,没有充分查看已有材料,任务循环和完成后的检查也偏少。

当天我把不少日常任务切换到 Grok 4.6,最直观的体验是它比 4.5 细致了许多。执行的回合通常更长,会多查看一些上下文,在任务结束前也会主动增加检查步骤。响应依然很快,但处理过程不再像以前那样仓促。

从官方公布的指标来看,Grok 4.6 在多项 Agent 和编码评测中都超过了 4.5。不过指标只能反映测试集上的得分,我在实际任务里感受到的关键改进,正是来自更充分的任务循环和执行检查。

Grok 4.6 与 Grok 4.5 等模型的官方指标对比

另一项明显的变化是中文文本质量。

以前用 Grok 4.5 生成中文文案时,经常带有很重的翻译腔。用于前端开发时,界面代码可能已经完成编写,但页面标题、按钮和说明文字通常还得重新整理。Grok 4.6 的中文表达自然了不少,对话内容和生成的 UI 文案都更容易直接阅读。

它目前还没有达到我心里很强的写作水平,不过已经比 4.5 实用许多。对于日常编码、前端修改、资料整理和一些中小型任务,它在速度、检查强度和输出可读性之间取得了更合适的平衡。

根据 xAI 的模型页面 说明,Grok 4.6 支持 500K 上下文、图片和文本输入、函数调用与结构化输出。API 价格是每百万输入 Token 2 美元、每百万输出 Token 6 美元。结合当天的使用速度,我认为它的性价比依然不错。

在我自己的日常任务里,Grok 4.6 目前比 GPT-5.6 Sol 更顺手。GPT-5.6 Sol 的执行过程更谨慎,但响应速度偏慢;Grok 4.6 则依然保留了较快的执行速度,同时减少了 4.5 那种过于仓促的处理方式。这个判断只针对我当天完成的编码和内容任务,不代表所有场景的统一排名。

我暂时仍然以 Codex 作为主 Agent

DeepSeek 有了自己的 Harness,并不意味着现有工作流一定要整体迁移。

我平时仍然习惯在 Codex 里处理主要任务,再把 DeepSeek、Grok 或其他模型作为子 Agent 调度。主 Agent 负责理解项目、拆解任务和整合结果,其他模型负责它们各自擅长的部分。这样既能保留习惯的工作方式,也方便按任务类型切换模型。

为了让 DeepSeek 更容易接入,我之前整理并开源了工具:codex-deepseek-subagent。它支持 DeepSeek V4 Flash 和 V4 Pro,可以把 DeepSeek 配置成 Codex 的原生子 Agent,并且会在配置后校验实际派发到的模型。

支持 DeepSeek V4 Flash 和 V4 Pro 的 Codex 子 Agent 工具

全局安装命令是:

npx skills add oil-oil/codex-deepseek-subagent -g -y

安装后重启 Codex 桌面应用,新建任务并输入「帮我把 DeepSeek 配置成 Codex 的原生子 Agent」,再按提示选择 V4 Flash 或 V4 Pro。配置完成以后,就可以直接让 DeepSeek 子 Agent 检查项目或处理文本类任务。

如果想完整体验 DeepSeek 官方的第一方 Agent 方案,可以先在本地安装 Harness,接受预览版可能持续调整的边界。如果已有成熟稳定的 Codex 工作流,把 DeepSeek 配置成子 Agent 会省去很多改动成本。至于 Grok 4.6,它已经具备直接放进日常任务里的实用度,后续我会继续观察它在更长任务和前端项目中的表现。