之前的视频里我分享过 WorkBuddy 加混元 Hy3 Preview 的实测效果,当时的感受是:混元 Hy3 Preview 性价比很高,能够满足日常非开发类任务,而且速度快,对话的感觉很好。

最近混元 Hy3 正式上线了,目前在 WorkBuddy 里面可以直接使用,还有两周的免费体验。

WorkBuddy 界面,输入框可以选择 Hy3 模型

我自己的理解是,第一方 Agent 通常会针对自家模型的特性设计工具和提示词,模型训练也可能配合 Agent 的使用方式。为了验证混元 Hy3 在 WorkBuddy 里的实际表现,我测试了原型设计、项目实现、深度调研和大文件编辑。

狼人杀原型图

第一个测试是让混元 Hy3 设计原型图。我只给了一段很短的提示词,让它设计一个狼人杀的原型。

它的整体响应速度很快,token 输出速度也很快。因为 WorkBuddy 知道我在做原型,它把每一个页面的功能直接平铺成一张图,每个页面都有一个手机套壳,整体是比较复古的风格。从游戏最开始的页面,到登录,再到游戏里面的每一个流程,它都铺出来了,我觉得设计得还不错。

狼人杀原型设计总览,18 个界面平铺展示

这是一个很长的 HTML,每一个细节的功能点都考虑到了,每个功能模块都有展示。

原型里游戏阶段的页面,包括守卫行动和天亮公布死讯

除此以外,它还单独创建了一个 HTML,把局内较长的对话场景放了进去。

单独实现的对话流程 HTML,包含发言和投票结果

基于原型实现完整游戏

基于这个原型,我让它直接把整个项目实现出来,提示词同样很简短,就是让它基于原型图把游戏做出来。

它实际上去接了一个真正的 AI 模型:我给了它一个 API Key,让它自己去接混元 Hy3 的模型,用混元来做 AI 玩家。点击进入游戏,我抽到了平民卡,然后开始游戏。

实现出来的可玩版本,说明 AI 玩家由混元 Hy3 实时驱动

游戏里实际接入了 AI,界面会显示正在思考中,然后展示这些 AI 玩家的实时发言。它把这个游戏的主要流程实现成了可以运行的版本。

游戏开始,AI 玩家正在思考

白天发言阶段,AI 玩家轮流发言

深度调研专家生成个人网站

第二个测试是用混元 Hy3 制作个人网站,主要观察 WorkBuddy 的信息调研和页面设计能力。

WorkBuddy 里面有一个专家团,我在专家团里找了一个深度调研专家,让它帮我调研信息,最终写出了我的个人网站。

深度调研专家完成任务,右侧是生成的个人网站

网站里的配图也是混元直接生成的。混元具有图片生成能力,它有多模态的模型,图片识别则是通过 MCP 来实现的。

个人网站首屏,配图为混元生成

把显示比例缩小之后可以看到,左侧还有一个很长的目录栏。整个调研报告非常详细,算是我在测试了不同 Agent 之后,生成效果特别好的一个报告。整个 HTML 不仅有深度,也有广度,从我的身份画像,到创作哲学,到人设剖析,它把我之前的过往经历全部都分析出来了。我自己看完的感觉是,它生成的内容挺准确的,文案风格也写得很好,没有很重的 AI 味。而且它没有把调研期间的原始数据写进文档,全都是面向读者的内容。多轮对话之后,它依然给出了一份准确的、可以直接面向读者的报告。

个人网站带左侧目录栏,下面是身份画像章节

大文件编辑的稳定性

这个 HTML 在我看来应该有大几千行。我使用这类工具时,遇到过模型没有读完较长的 HTML,导致编辑工具执行失败,后续反复编辑仍然无法完成的情况。

混元 Hy3 这次编辑大文件的过程比较稳定。遇到内置编辑工具处理不了的问题,它会自己编写 Python 脚本继续处理,最后完成了这个 HTML 的修改。

积分和费用

目前混元每天都在送通用积分,积分可以用来使用 WorkBuddy 里面的任何模型。混元 Hy3 目前是免费的,即便之后付费,它的消耗比例也特别低。

WorkBuddy 的积分面板,每天可以领取通用积分

这轮测试覆盖了原型设计、可玩版本实现、联网调研、个人网站生成和大文件编辑。混元 Hy3 在 WorkBuddy 里的响应速度、长任务执行和工具调整都比较稳定,积分消耗也低。测试范围没有覆盖更复杂的后端工程,因此这里的结论只适用于这几类实际完成的任务。