腾讯混元Hy3在真实工作场景盲测中均分优于GLM5.1,推理、智能体、长上下文任务比肩参数规模大2至5倍的旗舰模型。多案例实测显示,Hy3在代码生成、物理交互、游戏开发等任务中表现稳定,综合排名领先。
最近腾讯的混元 Hy3 正式上线,WorkBuddy 直接就能免费用上,不少人已经在排队体验了。
Hy3 是 4 月底发布的 Hy3 preview 升级版,这次升级带来了不少变化。
长期稳定更新的攒劲资源: >>>点此立即查看<<<
在真实工作场景的模型盲测中,Hy3 的均分表现优于 GLM 5.1,尤其在推理、智能体、长上下文等任务上,更是比肩国内外更大尺寸的旗舰模型——后者的参数规模往往是 Hy3 的 2 到 5 倍。

既然 Hy3 的宣传说能比肩更大尺寸的旗舰模型,实测又比 GLM 5.1 强,那自然得按照这个标准来测一测。
从参数量上看,GLM 5.1 和 DeepSeek-V4-Pro 都比 Hy3 高,而 DeepSeek-V4-Flash 则与 Hy3 相近。把它们放在一起横向对比,结果会如何?
是骡子是马,拉出来溜溜就知道了。
01. 模型实测
提示词:
做一个 AI 模型横评 Dashboard。
内容包括:
- 1.顶部展示 4 个模型:hy3、GLM 5.1、DeepSeek V4 Pro、DeepSeek V4 Flash。
- 2.中间是评分矩阵:代码、推理、写作、视觉、速度、稳定性。
- 3.右侧展示当前选中模型的优缺点。
- 4.底部展示测试 case 运行记录。
设计要求:
- 1.不要做营销落地页。
- 2.要像专业 SaaS 工具,信息密度高但不乱。
- 3.支持桌面和手机。
- 4.有真实交互:切换模型、筛选测试类型、排序分数。
- 5.不要使用大渐变背景、玻璃拟态、空洞装饰。
Hy3:

Hy3 的完成度相当高,信息架构给人一种真实横评工具的感觉。顶部 KPI、4 个模型卡、评分矩阵、右侧模型详情、雷达图、维度明细、优缺点、规格区、测试记录和筛选功能,一个都没落下。唯一的小瑕疵是桌面中段左侧有一块明显的空白区域,导致页面浏览节奏有些不均匀。
DeepSeek-V4-Pro:

DeepSeek-V4-Pro 的结构很清晰,做了一个 6 维度 × 4 模型的评分矩阵,选中列、筛选按钮、测试历史表都能正常工作。但整体设计辨识度偏弱,看起来更像一个“标准白底 SaaS 表格 demo”。矩阵区域有大块空白,页面密度控制得不够好。细节上缺少模型画像、规格和图形化能力面板,记忆点不足。
DeepSeek-V4-Flash:

DeepSeek-V4-Flash 的卡片、条形图、表格都很稳,视觉上很克制,没有乱用装饰元素。不过,所谓的“评分矩阵”只展示了当前选中模型的 6 个维度,并不是真正的四模型横向对比矩阵。信息层级相对较少,更像一个模型详情页加上记录表,而不是一个完整的横评工作台。
GLM 5.1:

GLM 5.1 的页面没能跑起来。浏览器报了“Invalid or unexpected token”的错误,模型卡片、矩阵、详情、测试记录全都没渲染出来,只剩下一个暗色外壳和空表头。
本 case 排名:Hy3 > DeepSeek-V4-Pro > DeepSeek-V4-Flash > GLM 5.1
提示词:
做一个 3D 小球迷宫。
要求:
- 使用 Three.js。
- 画面中有一个倾斜迷宫板和一个小球。
- 通过键盘方向键控制迷宫板倾斜。
- 小球会根据倾斜方向滚动。
- 有墙体、终点、失败洞口。
- 到达终点显示通关时间。
- 掉进洞口后重置。
- 要有基础物理效果,不能只是改坐标假装滚动。
Hy3:
Hy3 的表现非常稳定,本地自带 three.min.js 就能直接跑。物理实现很清晰,有倾斜板、滚动小球、墙体碰撞、洞口掉落重置、终点、计时、掉落次数,还支持移动端 D-pad 操作。按键后球的位置和计时都有明显变化,体验很扎实。
DeepSeek-V4-Pro:
DeepSeek-V4-Pro 的思路很高级,用了 React Three Fiber + Rapier 物理引擎,构建也能通过,说明开发者知道该用物理引擎。但实际玩起来问题不小,左右重力逻辑是混乱的——板子翘起来,球却往高处跑,这显然不对。
DeepSeek-V4-Flash:
DeepSeek-V4-Flash 有 canvas、有迷宫、有计时、有洞口和通关弹窗,基本功能都齐了。但游戏系统还是偏薄:洞口数量少、HUD 信息少,而且同样存在左右重力逻辑混乱的问题,板子翘起来球却往高处跑。
GLM 5.1:
GLM 5.1 的完成度很高,画面里有完整的迷宫、墙体、多个失败洞口、终点、阴影、HUD、最佳时间显示,支持 WASD/方向键、R 键重开,甚至还有鼠标视角旋转。但遗憾的是,上下左右的重力逻辑都是混乱的,板子翘起来球依然往高处跑。
本 case 排名:Hy3 > GLM 5.1 > DeepSeek-V4-Pro > DeepSeek-V4-Flash
提示词:
做一个迷你塔防游戏。
要求:
- 地图上有固定路径,敌人沿路径移动。
- 玩家可以在空地放置炮塔。
- 炮塔自动攻击范围内最近的敌人。
- 敌人死亡掉金币。
- 每一波敌人数量和速度增加。
- 有生命值、金币、波次、暂停、重新开始。
- 炮塔至少有两种:单体高伤、范围低伤。
- 游戏要能平衡到至少玩 5 波。
Hy3:
Hy3 提供了三种塔:箭塔、炮塔、冰塔,覆盖了单体、AOE 和减速效果。还支持出售返还、暂停、重开以及波次状态显示。UI 清晰,敌人血条、路径、塔位反馈都做得很好,像一个完整的小游戏原型。
DeepSeek-V4-Pro:
DeepSeek-V4-Pro 的 React/Vite 版本,放塔和 5 波流程都可以用。但整体更像一个基础 Demo,只有两种塔,没有日志、出售、减速或敌人类型变化,视觉也比较简单。
DeepSeek-V4-Flash:
DeepSeek-V4-Flash 的单文件完成度不错,能放塔、开波、击杀返钱,还有事件提示和塔属性面板。短板在于只有两种塔,敌人和策略深度一般,界面观感偏弱。
GLM 5.1:
GLM 5.1 的游戏结构很产品化:10 波、两种塔、多敌人类型、速度按钮、事件日志、右侧商店信息都很完整。但画面偏暗,战斗反馈不够直观;塔类型少,也没有出售或升级功能。
本 case 排名:Hy3 > GLM 5.1 > DeepSeek-V4-Flash > DeepSeek-V4-Pro
提示词:
下面这段 Python 代码用于找出数组中和为 target 的两个数下标,但有 bug。请指出 bug、给出修复代码,并补充 3 个测试用例。
def two_sum(nums, target):
seen = {}
for i, n in enumerate(nums):
if target – n in seen:
return [i, seen[n]]
seen[n] = i
return []
Hy3:

Hy3 对标准用例的解释很清楚,能指出 [2,7,11,15] 会引发 KeyError,修复代码正确,测试覆盖了基本、重复和无解的情况。不过,对“只有 n == target – n 才正确”的表述略有些绝对,如果严格要求返回顺序为 [0,1],[3,3] 时原代码也可能是反的。
DeepSeek-V4-Pro:

DeepSeek-V4-Pro 的修复和测试都是对的,4 个用例覆盖也全。但解释中说 seen[n] 可能是“当前数字 n 的索引,即 i 本身”,这不太严谨,因为 seen[n] = i 发生在判断之后,通常还没写入。
DeepSeek-V4-Flash:

DeepSeek-V4-Flash 明显犯了错误,把问题误判成“返回顺序反了”,但仍然写 seen[n],没有改成 seen[target – n]。标准用例 [2,7,11,15], target=9 仍会 KeyError,给出的测试用例自己都跑不过。
GLM 5.1:

GLM 5.1 准确抓住了核心问题:判断的是 target – n in seen,所以返回必须取 seen[target – n]。还补充了 seen[n] 可能 KeyError 或命中旧重复值,解释很严谨。修复代码和测试用例都正确。
本 case 排名:GLM 5.1 > Hy3 > DeepSeek-V4-Pro > DeepSeek-V4-Flash
提示词:
请把下面这段话改成更自然的公众号正文,不要像 AI 写的。
原文:
在人工智能快速发展的今天,Agent 已经不再只是一个技术概念,而是正在成为改变生产力的重要工具。对于普通人来说,理解 Agent 的意义非常重要,因为它不仅能够提升工作效率,还能够帮助我们重新思考人与机器的关系。
Hy3:

Hy3 的审稿意识很强,能准确指出原文里的 AI 腔来源,改写后的内容也有公众号开头的抓力。
DeepSeek-V4-Pro:

DeepSeek-V4-Pro 的改写很干净,短、直接、不油腻。但信息量偏少,把 Agent 写成了普通效率工具,少了“主动执行、多步骤任务、人机分工变化”这些关键点。
DeepSeek-V4-Flash:

DeepSeek-V4-Flash 虽然比原文口语化,但还保留了明显的模板痕迹:比如“不只是……”、“实打实地……”、“工作效率翻倍”、“重新想想……人和机器之间,到底谁该听谁的”这类句子,标题党味有点重。
GLM 5.1:

GLM 5.1 的改写很具体,有场景感。它不只说“提升效率”,而是写到订机票、整理文档、盯进度、报表、邮件、资料归档这些具体的事情,读者能立刻理解 Agent 的用处。语气也比较自然,没有太多模板句。小问题是“与其……不如……”用了两次。
本 case 排名:GLM 5.1 > Hy3 > DeepSeek-V4-Pro > DeepSeek-V4-Flash
提示词:请用 JSON 输出,不要 Markdown,不要解释。
任务:给一家 AI 编程工具设计 5 条中文广告语。
约束:
- 1. 每条不超过 16 个汉字。
- 2. 不能出现“效率”“智能”“未来”三个词。
- 3. 每条都要包含一个动词。
- 4. JSON 字段为 slogans,值为字符串数组。
Hy3:

Hy3 的 JSON 格式规范,字段正确,正好 5 条,全是中文短句,没有英文、空格或多余解释。
DeepSeek-V4-Pro:

DeepSeek-V4-Pro 的 JSON 合规,文案更有画面感,但有几条偏长,比如“开口说需求,代码自己长”和“把想法丢进去就行”都超过了字数限制。
DeepSeek-V4-Flash:

DeepSeek-V4-Flash 的格式没问题,但约束遵循最弱。用了“bug”、“AI”这样的英文单词;像“改完bug直接上线”、“一人一AI撑起全栈”这类表述也比较夸张,更像宣传话术。
GLM 5.1:

GLM 5.1 也很稳,5 条都很短,节奏统一。但同样用了“Bug”这个英文单词,略微扣分。
本 case 排名:Hy3 > DeepSeek-V4-Pro > GLM 5.1 > DeepSeek-V4-Flash
提示词:下面函数已经在线上跑了两年,现在要支持优惠券、会员折扣、区域税率。请设计重构方案。
function calcTotal(items, user) {
let total = 0
for (const item of items) {
total += item.price * item.count
}
if (user.vip) total *= 0.9
total *= 1.06
return Math.round(total * 100) / 100
}
要求:
- 1. 不要过度设计。
- 2. 保留可测试性。
- 3. 给出 TypeScript 代码。
- 4. 给出单元测试样例。
- 5. 说明哪些逻辑应该配置化。
Hy3:

Hy3 的拆分方案很清晰,纯函数、配置对象、税率、会员折扣、优惠券的边界都讲得很清楚,工程判断很稳。
DeepSeek-V4-Pro:

DeepSeek-V4-Pro 的落地很扎实,测试覆盖广,零依赖即可运行。扣分点在于把 User 改成了 membership,如果原线上是 vip 字段,会有兼容风险。
DeepSeek-V4-Flash:

DeepSeek-V4-Flash 的思路方向对:常量配置化、计算顺序固化,没搞复杂的策略模式。但实现问题最多:优惠券先于会员折扣,且会员折扣按 subtotal 扣,组合券时容易和业务直觉不一致;固定券没有最终兜底,叠加多券可能算成负数,整体像一版草稿。
GLM 5.1:

GLM 5.1 的设计讲得很好:配置注入、迁移节奏、哪些不要过度设计都说到了。尤其是“先用旧硬编码配置回归,再接运营后台”的思路,非常贴近真实工程处理。扣分点是代码片段有小瑕疵,pricing.ts 没展示从 types.ts 导入类型,测试里 DiscountPolicy/TaxPolicy 也没导入,直接复制不一定能跑。
提示词:
我有一张销售表,字段如下:
日期、销售员、城市、产品、销售额、成本、客户类型。
请设计一个 Excel 分析模板,要求:
- 自动计算毛利、毛利率。
- 按月份、城市、销售员生成透视分析。
- 找出毛利率低于 15% 的订单。
- 生成一个管理层看板。
- 给出需要使用的公式、透视表字段配置、图表类型。
Hy3:

Hy3 真实交付了 .xlsx 文件,并且有生成脚本、公式列、条件格式、自动汇总、KPI 和 3 张图表。虽然没有真正创建 Excel 透视表,但给出了透视字段说明,实用性很强。
DeepSeek-V4-Pro:

DeepSeek-V4-Pro 的结构清楚,6 张 Sheet 的设计很完整,KPI 公式和 FILTER 低毛利清单比较可落地。毛利率在透视表里用“毛利 / 销售额”的计算字段,这种方式很严谨。
DeepSeek-V4-Flash:

DeepSeek-V4-Flash 的方案有基本框架,但公式细节问题不少:低毛利标记没有防除零,COUNTIF(I:I,<0.15) 少了引号,透视表毛利率的建议也不够准确。
GLM 5.1:

GLM 5.1 的方案非常接近实际 Excel 搭建流程。超级表、透视表、低毛利预警、切片器、时间轴、阈值放到设置单元格,这些都很实用。但部分公式写法偏说明性质,比如直接写“=总毛利/总销售额”,不够精确。
本 case 排名:Hy3 > GLM 5.1 > DeepSeek-V4-Pro > DeepSeek-V4-Flash
提示词:
基于以下假设做一个 DCF 估值。
2026 年自由现金流 1200 万,之后 4 年增长率分别为 18%、15%、12%、8%。永续增长率 3%,WACC 10%。净债务 2000 万,流通股 1000 万股。
请计算:
Hy3:

Hy3 的折现口径正确:2026–2030 五年现金流按 t=1..5 折现,2030 年末终值也折现 5 年,基准每股 21.95 元是准确的,还实际生成了 HTML 报告和计算脚本。
DeepSeek-V4-Pro:

DeepSeek-V4-Pro 也有本地脚本,但核心口径错了:把 2026 年 1,200 万 FCF 漏掉了,只从 2027 年开始折现;终值也只折现了 4 年,所以估值被抬高到 23.14 元。
DeepSeek-V4-Flash:

DeepSeek-V4-Flash 和 DeepSeek-V4-Pro 犯了同一个 DCF 口径错误:漏掉 2026 年现金流,终值折现期少一年。但比 DeepSeek-V4-Pro 差的是没有本地文件,解释也更简短。
GLM 5.1:

GLM 5.1 的计算和口径都很严谨,明确写了估值日、年末现金流约定、终值折现 5 年,敏感性 5×5 也完整。结论里的终值占比、交叉验证提醒都体现了金融建模意识,可惜没有生成本地交付文件。
本 case 排名:Hy3 > GLM 5.1 > DeepSeek-V4-Pro > DeepSeek-V4-Flash
02. 测试总结
从测试结果来看,Hy3 的宣传确实很实在,整体表现优于 GLM 5.1,甚至比 DeepSeek-V4-Pro 还要强一些,这一点比较意外。
Hy3 在前端、塔防、约束遵循、代码重构、Excel 自动化、DCF 这些测试中全部拿下第一。它的强项在于能交付:生成文件、跑出页面、把需求拆解成真实产物。
GLM 5.1 在代码调试、中文写作、DCF 口径这些需要判断力的题上表现很强,解释严谨,金融建模意识也好。
DeepSeek V4 Pro 更像一个中规中矩的工程型选手,结构化能力不错,代码重构里还真的跑通了 20 个测试。
DeepSeek V4 Flash 适合轻量任务。单文件页面、小型 Demo、快速草稿还可以,但一到需要严谨推理、约束遵循、复杂业务口径,就有点力不从心了。

03. 一些分享
测下来,对 Hy3 的印象挺明确:日常工作里真的可以拿来干活了。
需要说明的是,这次测试用的是 WorkBuddy。腾讯自家的 Agent 接自家的模型,多少会有一些适配加成,这很正常。但不管怎么说,最后跑出来的结果摆在那里:页面能跑、文件能交、复杂任务也能拆得住,整体完成度确实不错。
更关键的是,现在在 WorkBuddy 里用 Hy3 还不用花钱,可以免费用两周。对经常跑代码、做页面、写分析的人来说,这基本等于先省下半个月 Token 费。后面如果接 API,价格也不算贵,甚至比 DeepSeek-V4-Pro 还低一点。
还有一个值得关注的点:Hy3 已经接进了腾讯不少产品,比如元宝、微信读书这些。刚好这些也是平时会用的工具。
从数据来看,Hy3 在 7 月 8 日上午 10 点左右算力消耗冲到峰值,后面还出现排队,下午排队率一度超过 50%。这说明一件事:觉得它好用的,应该不止一个人。
这次测完,Hy3 会被放进日常工作备选里,希望国产模型越做越好。
侠游戏发布此文仅为了传递信息,不代表侠游戏网站认同其观点或证实其描述