腾讯混元 Hy3 实测 – 与 GLM 5.1、DeepSeek V4 Pro 横向对比

腾讯近期发布的混元 Hy3 模型,在 WorkBuddy 平台上线后,引发了广泛关注,甚至一度出现排队抢用的情况。Hy3 作为 4 月底发布的 Hy3 preview 的升级版本,其宣称的效果令人期待。
根据官方宣传,Hy3 在真实工作场景的模型盲测中,平均得分超越了 GLM 5.1,在推理、智能体、长上下文等复杂任务上,其表现甚至能与国内外参数规模大出 2-5 倍的旗舰模型相媲美。基于这一宣传,我们展开了一系列实测,旨在检验 Hy3 的实际能力。
为了进行全面横评,我们选择了参数量大于 Hy3 的 GLM 5.1 和 DeepSeek-V4-Pro,以及参数量与之相近的 DeepSeek-V4-Flash。我们将通过一系列具体场景的测试,来揭示这些模型的真实表现。
模型实测
场景一:前端设计
提示词:
请设计一个 AI 模型横评 Dashboard。
内容要求:
- 1. 顶部展示 Hy3、GLM 5.1、DeepSeek V4 Pro、DeepSeek V4 Flash 四个模型。
- 2. 中部为评分矩阵,包含代码、推理、写作、视觉、速度、稳定性等维度。
- 3. 右侧显示当前选中模型的优缺点。
- 4. 底部记录测试 case 的运行情况。
设计准则:
- 1. 避免营销落地页风格。
- 2. 追求专业 SaaS 工具的观感,信息密度高但不杂乱。
- 3. 兼容桌面和手机端。
- 4. 具备真实交互功能:模型切换、测试类型筛选、分数排序。
- 避免使用大面积渐变背景、玻璃拟态或空洞的装饰元素。
Hy3 的表现:
Hy3 在此场景下展现了出色的完成度,其信息架构最贴近真实评测工具的设想。页面顶部集成了关键指标,四个模型卡片清晰呈现,评分矩阵、模型详情、雷达图、维度细分、优缺点分析、规格区以及测试记录和筛选功能一应俱全。不过,在桌面视图的中部左侧,存在一块较为明显的空白区域,影响了页面的浏览节奏。
DeepSeek-V4-Pro 的表现:
DeepSeek-V4-Pro 的整体结构清晰,构建了包含 6 个维度和 4 个模型的评分矩阵。选中列、筛选按钮和测试历史表格均可正常运行。然而,其设计辨识度略显不足,整体风格更像一个“标准白底 SaaS 表格演示”。矩阵区域存在大片空白,页面信息密度控制不佳。此外,在细节方面,缺失了模型画像、规格信息以及图形化能力面板,记忆点不够突出。
DeepSeek-V4-Flash 的表现:
DeepSeek-V4-Flash 在卡片、条形图和表格的呈现上表现稳健,视觉设计克制,未滥用装饰元素。然而,其所谓的“评分矩阵”仅展示了当前选中模型的 6 个维度,而非真正的四模型横向对比矩阵。信息层级相对较少,更像一个模型详情页与记录表的结合,未能完全达到完整横评工作台的标准。
GLM 5.1 的表现:
GLM 5.1 在此场景下未能成功运行。浏览器报错显示“Invalid or unexpected token”,导致模型卡片、矩阵、详情及测试记录等所有元素均未渲染,页面仅显示了暗色外壳和空表头。
本场景排名:Hy3 > DeepSeek-V4-Pro > DeepSeek-V4-Flash > GLM 5.1
场景二:3D 物理交互
提示词:
请创建一个 3D 小球迷宫。
要求:
- 使用 Three.js 技术栈。
- 画面中包含一个倾斜的迷宫板和一个小球。
- 通过键盘方向键控制迷宫板的倾斜角度。
- 小球的滚动方向应随迷宫板的倾斜而变化。
- 设置有墙体、终点和失败的掉落洞口。
- 成功到达终点时,显示通关时间。
- 小球掉落洞口后,游戏应重置。
- 实现基础的物理效果,避免仅通过坐标修改来模拟滚动。
Hy3 的表现:
Hy3 在此场景下表现极其稳定,本地集成了 three.min.js,可直接运行。物理效果实现清晰,包含了倾斜板、滚动小球、墙体碰撞检测、洞口掉落重置、终点设置以及计时功能。此外,还支持移动端的 D-pad 操作。按键操作后,小球的位置和计时均有明显的变化。
DeepSeek-V4-Pro 的表现:
DeepSeek-V4-Pro 的实现思路颇具创意,引入了 React Three Fiber 和 Rapier,搭建过程也较为完整,显示了其对物理引擎的理解。然而,实际游玩过程中存在较大问题:左右重力的逻辑混乱,导致板子倾斜时小球反而向高处滚动。
DeepSeek-V4-Flash 的表现:
DeepSeek-V4-Flash 成功实现了 Canvas 渲染、迷宫结构、计时功能、掉落洞口以及通关弹窗。但其游戏系统的深度仍显不足:洞口数量较少,HUD 信息不够丰富,左右重力逻辑同样存在混乱,小球会向高处滚动。
GLM 5.1 的表现:
GLM 5.1 实现了较高的完成度,画面中包含了完整的迷宫、墙体、多个失败洞口、终点、阴影效果、HUD 信息、最佳时间记录、WASD/方向键控制、R 键重开以及鼠标视角旋转功能。然而,上下左右的重力逻辑均存在混乱,小球会向高处滚动。
本场景排名:Hy3 > GLM 5.1 > DeepSeek-V4-Pro > DeepSeek-V4-Flash
场景三:塔防游戏
提示词:
请开发一款迷你塔防游戏。
要求:
- 地图上存在固定路径,敌人沿路径移动。
- 玩家可在指定空地上部署炮塔。
- 炮塔自动攻击范围内最近的敌人。
- 敌人死亡后掉落金币。
- 每波敌人数量和速度递增。
- 包含生命值、金币、波次、暂停和重新开始功能。
- 炮塔至少包含两种类型:单体高伤和范围低伤。
- 游戏应设计得能平衡到至少进行 5 波。
Hy3 的表现:
Hy3 提供了三种类型的炮塔:箭塔(单体高伤)、炮塔(范围低伤)和冰塔(减速),基本满足了要求。游戏还包含出售返还、暂停、重开、波次状态显示等功能。UI 设计清晰,敌人血条、路径指示、炮塔位反馈都做得很好,整体更像一个完整的小游戏原型。
DeepSeek-V4-Pro 的表现:
DeepSeek-V4-Pro 的 React/Vite 版本在部署炮塔和进行 5 波流程方面可用。但整体更像一个基础的演示 Demo:仅提供两种炮塔,缺少日志、出售、减速、敌人类型变化等功能,视觉效果也较为简单。
DeepSeek-V4-Flash 的表现:
DeepSeek-V4-Flash 在单文件完成度上表现不错,能够实现炮塔部署、开始波次、击杀返钱,并带有提示和炮塔属性面板。然而,其短板在于仅提供两种炮塔,敌人种类和策略深度一般,界面观感也有待提升。
GLM 5.1 的表现:
GLM 5.1 构建的游戏结构较为产品化:包含 10 波敌人、两种炮塔、多种敌人类型、速度调节按钮、日志以及右侧完整的商店信息。然而,画面风格偏暗,战斗反馈不够直观;炮塔类型较少,缺少出售或升级功能。
本场景排名:Hy3 > GLM 5.1 > DeepSeek-V4-Flash > DeepSeek-V4-Pro
场景四:代码调试
提示词:
以下 Python 代码旨在找出数组中和为 target 的两个数的下标,但存在 bug。请指出 bug,提供修复代码,并补充 3 个测试用例。
def two_sum(nums, target):
seen = {}
for i, n in enumerate(nums):
if target – n in seen:
return [i, seen[n]]
seen[n] = i
return []
Hy3 的表现:
Hy3 提供了清晰的标准用例解释,指出了当 `nums = [2,7,11,15]` 且 `target = 9` 时会出现 `KeyError`。修复代码正确,并提供了覆盖基本、重复和无解情况的测试用例。不过,对于“只有 n == target – n 才正确”的表述略显绝对,原始代码如果严格要求返回 `[0,1]`,在 `[3,3]` 的情况下返回顺序也可能颠倒。
DeepSeek-V4-Pro 的表现:
DeepSeek-V4-Pro 的修复方案和测试用例均正确,覆盖了 4 个场景。但其解释中提到 `seen[n]` 可能是“当前数字 n 的索引,即 i 本身”,这一说法不够严谨,因为 `seen[n] = i` 的操作发生在判断之后,此时 `seen` 中存储的 `n` 的索引通常不是当前的 `i`。
DeepSeek-V4-Flash 的表现:
DeepSeek-V4-Flash 的分析存在明显错误,将问题误判为“返回顺序反了”,但仍旧使用了 `seen[n]` 而非 `seen[target – n]`。在标准用例 `nums = [2,7,11,15]`,`target = 9` 的情况下,它仍然会触发 `KeyError`,并且给出的测试用例自身也无法通过。
GLM 5.1 的表现:
GLM 5.1 精准地抓住了核心问题:判断条件是 `target – n in seen`,因此返回值必须是 `seen[target – n]`。它还补充说明了 `seen[n]` 可能出现的 `KeyError` 或命中旧的重复值情况,解释非常严谨。修复代码和测试用例也均正确。
本场景排名:GLM 5.1 > Hy3 > DeepSeek-V4-Pro > DeepSeek-V4-Flash
场景五:中文写作
提示词:
请将以下这段话改写成更自然的公众号正文风格,避免 AI 写作痕迹。
原文:
在人工智能快速发展的今天,Agent 已经不再只是一个技术概念,而是正在成为改变生产力的重要工具。对于普通人来说,理解 Agent 的意义非常重要,因为它不仅能够提升工作效率,还能够帮助我们重新思考人与机器的关系。
Hy3 的表现:
Hy3 展现了较强的审稿意识,能够准确识别原文中 AI 腔调的来源,并进行了有效的改写。改写后的文章开头具有公众号文章常见的吸引力。
DeepSeek-V4-Pro 的表现:
DeepSeek-V4-Pro 的改写风格干净、简洁、直接,不拖泥带水。但信息量偏少,将 Agent 简单描述为“普通效率工具”,忽略了“主动执行、多步骤任务、人机分工变化”等关键信息。
DeepSeek-V4-Flash 的表现:
DeepSeek-V4-Flash 的改写虽然比原文更口语化,但仍保留了明显的模板化痕迹,例如“不只是……、实打实地……、工作效率翻倍”等。其结尾“人和机器之间,到底谁该听谁的”带有较强的标题格。
GLM 5.1 的表现:
GLM 5.1 的改写具体且富有场景感,它没有仅仅停留在“提升效率”的层面,而是具体描述了如订机票、整理文档、盯进度、制作报表、处理邮件、资料归档等应用场景,使读者能够迅速理解 Agent 的实际用途。语言风格也较为自然,模板句较少。唯一的小瑕疵是“与其……不如……”句式重复使用了两次。
本场景排名:GLM 5.1 > Hy3 > DeepSeek-V4-Pro > DeepSeek-V4-Flash
场景六:约束遵循
提示词:请以 JSON 格式输出,不要使用 Markdown,不要添加解释。
任务:为一家 AI 编程工具设计 5 条中文广告语。
约束条件:
- 1. 每条广告语不超过 16 个汉字。
- 2. 禁止使用“效率”“智能”“未来”这三个词。
- 3. 每条广告语必须包含一个动词。
- 4. JSON 输出的字段名为 slogans,值为字符串数组。
Hy3 的表现:
Hy3 生成的 JSON 格式规范,字段正确,恰好生成了 5 条广告语。所有广告语均为中文短句,不含英文、空格或多余解释。
DeepSeek-V4-Pro 的表现:
DeepSeek-V4-Pro 的 JSON 输出符合规范,文案更具画面感。但部分广告语略显超长,例如:“开口说需求,代码自己长”、“把想法丢进去就行”。
DeepSeek-V4-Flash 的表现:
DeepSeek-V4-Flash 的格式没有问题,但对约束条件的遵循最弱。使用了“bug”、“AI”等英文词汇。其广告语“改完 bug 直接上线”、“一人一 AI 撑起全栈”等表述过于夸张,更像宣传口号。
GLM 5.1 的表现:
GLM 5.1 表现稳定,生成的 5 条广告语均简短且节奏统一。但使用了“Bug”这个英文单词。
本场景排名:Hy3 > DeepSeek-V4-Pro > GLM 5.1 > DeepSeek-V4-Flash
场景七:代码重构
提示词:以下函数已在线上运行两年,现需支持优惠券、会员折扣和区域税率。请设计重构方案。
function calcTotal(items, user) {
let total = 0
for (const item of items) {
total += item.price * item.count
}
if (user.vip) total *= 0.9
total *= 1.06
return Math.round(total * 100) / 100
}
要求:
- 1. 避免过度设计。
- 2. 保持代码的可测试性。
- 3. 提供 TypeScript 代码实现。
- 4. 给出单元测试样例。
- 5. 说明哪些逻辑应进行配置化处理。
Hy3 的表现:
Hy3 成功地将原始函数拆分为纯函数,并引入了配置对象。其对税率、会员折扣和优惠券的边界划分讲解清晰,工程判断稳健。
DeepSeek-V4-Pro 的表现:
DeepSeek-V4-Pro 的方案落地扎实,测试覆盖广泛,并提供了零依赖可运行的代码。扣分点在于将 `user.vip` 改为了 `membership`,如果线上原字段为 `vip`,可能存在兼容性风险。
DeepSeek-V4-Flash 的表现:
DeepSeek-V4-Flash 的思路方向正确,将常量配置化,计算顺序固定,避免了策略模式的过度引入。然而,其实现存在较多问题:优惠券在会员折扣之前应用,且会员折扣基于小计金额扣除,这在叠加使用优惠券时可能与业务直觉不符。此外,固定券缺少最终的兜底逻辑,叠加多张券可能导致总金额为负数,整体像一个初版草稿。
GLM 5.1 的表现:
GLM 5.1 在设计理念上表现出色,它详细阐述了配置注入、迁移节奏以及避免过度设计的原则,特别强调了“先用旧硬编码配置回归,再对接运营后台”的实际工程处理方式。扣分点在于代码片段存在一些小瑕疵,例如 `pricing.ts` 未显示从 `types.ts` 导入类型,测试中的 `DiscountPolicy` 和 `TaxPolicy` 也未导入,直接复制可能无法运行。
场景八:Excel 自动化
提示词:
我有一张销售表,包含字段:日期、销售员、城市、产品、销售额、成本、客户类型。
请设计一个 Excel 分析模板,要求:
- 自动计算毛利和毛利率。
- 按月份、城市、销售员生成透视分析。
- 找出毛利率低于 15% 的订单。
- 生成一个管理层看板。
- 提供所需公式、透视表字段配置和图表类型建议。
Hy3 的表现:
Hy3 实际交付了一个 .xlsx 文件,并附带了生成脚本、公式列表、条件格式、自动汇总以及 KPI 和 3 张图表。虽然未直接创建 Excel 透视表,但提供了详细的透视字段说明。
DeepSeek-V4-Pro 的表现:
DeepSeek-V4-Pro 的设计结构清晰,包含 6 张工作表。KPI 公式和 FILTER 低毛利清单的方案具有较强的落地性。在透视表中,使用“毛利 / 销售额”的计算字段来计算毛利率,显得非常严谨。
DeepSeek-V4-Flash 的表现:
DeepSeek-V4-Flash 提供的方案具备基本框架,但公式细节存在较多问题。例如,低毛利标记未考虑防除零错误,COUNTIF(I:I,<0.15) 少了引号。透视表中关于毛利率的建议也不够准确。
GLM 5.1 的表现:
GLM 5.1 的方案非常接近实际 Excel 搭建流程。它包含了超级表、透视表、低毛利预警、切片器、时间轴以及将阈值移至设置单元格等实用功能。但部分公式写法更偏向说明性质,例如“=总毛利/总销售额”。
本场景排名:Hy3 > GLM 5.1 > DeepSeek-V4-Pro > DeepSeek-V4-Flash
场景九:DCF 估值
提示词:
基于以下假设,请进行 DCF 估值。
2026 年现金流为 1200 万,之后 4 年增长率分别为 18%、15%、12%、8%。永续增长率为 3%,WACC 为 10%。净债务为 2000 万,流通股为 1000 万股。
请计算:
- 显性期现金流现值。
- 终值。
- 企业价值。
- 股权价值。
- 每股价值。
- 进行 WACC 9%-11% 和永续增长率 2%-4% 的敏感性分析。
Hy3 的表现:
Hy3 的折现口径正确:2026-2030 年的五年现金流按 t=1 到 t=5 进行折现,2030 年末的终值也折现了 5 年。计算出的每股价值为 21.95 元,并且实际生成了 HTML 报告和计算脚本。
DeepSeek-V4-Pro 的表现:
DeepSeek-V4-Pro 提供了本地脚本,但核心口径存在错误:漏掉了 2026 年 1200 万的现金流,仅从 2027 年开始折现;终值也只折现了 4 年,因此估值被抬高至 23.14 元。
DeepSeek-V4-Flash 的表现:
DeepSeek-V4-Flash 与 DeepSeek-V4-Pro 犯了相同的 DCF 口径错误:漏掉了 2026 年的现金流,终值折现期也少了一年。相较于 DeepSeek-V4-Pro,其不足之处在于没有提供本地文件,且解释更为简略。
GLM 5.1 的表现:
GLM 5.1 在计算和口径方面严谨准确,明确指出了估值日、年末现金流约定以及终值折现 5 年。敏感性分析也完成了 5×5 的完整覆盖。结论中对终值占比以及交叉验证的提醒,体现了其金融建模的专业意识。可惜的是,未能生成本地交付文件。
本场景排名:Hy3 > GLM 5.1 > DeepSeek-V4-Pro > DeepSeek-V4-Flash
测试结果总结
从本次测试结果来看,Hy3 的宣传内容相当实在。整体表现确实优于 GLM 5.1,并且令人惊喜的是,其表现也略微领先于 DeepSeek-V4-Pro。
Hy3 在前端设计、塔防游戏、约束遵循、代码重构、Excel 自动化以及 DCF 估值等多个场景中都取得了第一名。其突出优势在于能够“交付”:它能够生成文件、运行页面、并将复杂需求转化为实际可用的产物。
GLM 5.1 在需要判断力的场景中表现出色,如代码调试、中文写作和 DCF 口径分析。它的解释严谨,金融建模意识较强。
DeepSeek V4 Pro 更像一个中规中矩的工程型选手,具备良好的结构化能力。在代码重构场景中,它甚至成功通过了 20 个测试用例。
DeepSeek V4 Flash 更适合执行轻量级任务。对于单文件页面、小型 Demo 或快速草稿,它能够胜任。但一旦涉及到严谨的推理、约束遵循或复杂的业务逻辑,其表现就显得稍显不足。
一些心得分享
经过本次测试,我对 Hy3 的定位有了清晰的认识:它已经能够胜任日常工作中的许多任务。需要说明的是,本次测试是通过 WorkBuddy 完成的。腾讯自家的 Agent 工具与腾讯自家的模型相结合,可能存在一定的适配优化。然而,最终的测试结果摆在那里:页面能够运行,文件能够交付,复杂的任务也能有效拆解,整体完成度确实令人印象深刻。
更重要的是,目前在 WorkBuddy 上使用 Hy3 仍是免费的,用户可以免费体验两周。对于经常需要编写代码、制作页面或进行数据分析的专业人士来说,这相当于节省了近半个月的 Token 费用。即使后续接入 API,其价格也相对合理,甚至比 DeepSeek-V4-Pro 还要略低一些。
另一个令人期待的方面是,Hy3 已被集成到腾讯旗下的多款产品中,例如元宝和微信读书,这些也恰好是常使用的工具。
我注意到 Hy3 在 7 月 8 日上午 10 点左右,算力消耗达到了峰值,随后出现了排队现象,下午的排队率一度超过 50%。这充分说明,认为它表现出色的用户,绝非我一人。
在本次测试结束后,我将把 Hy3 加入到我的日常工作备选工具列表中,并对国产模型的持续进步充满期待。


