首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >770B 参数、1M 上下文,混元 Hy4 preview 为生产力而生

770B 参数、1M 上下文,混元 Hy4 preview 为生产力而生

原创
作者头像
克劳德2048
发布2026-09-01 11:00:00
发布2026-09-01 11:00:00
1840
举报

摘要

混元 Hy4 preview 总参数 770B、激活参数 49B、上下文长度 1M,定位"为生产力而生"。本文详解其 MoE 架构、软件工程、办公分析与科学研究三大能力跃升,以及编码全球第 6、专家盲测 2.99 分等实测表现,并说明 WorkBuddy 限时免费体验安排。

一、从参数规格看 Hy4 preview:770B 总参数、1M 上下文

8 月 28 日,腾讯混元正式发布并开源新一代大语言模型 Hy4 preview。从命名看,preview 意味着它是一次提前亮相的预览版本——早于此前市场预期的 9 月,延续了自 Hy3 preview 以来约两个月一次的大版本迭代节奏。

先看核心规格:

  • 总参数量 770B(7700 亿):决定模型的知识容量与能力上限。
  • 激活参数 49B(490 亿):单次推理实际参与的参数量,决定推理成本与速度。
  • 上下文长度 1M(100 万 token):一次可处理约百万 token 的长文本或大型代码库。
  • 架构:快慢思考融合的 MoE(混合专家)架构,在能力与推理效率之间取得平衡。

这组数字的关键不在"大",而在"大而不笨"。770B 的总参数提供了足够的能力储备,而 49B 的激活参数让实际推理不必为全部参数买单——这正是 MoE 稀疏激活设计的价值:用更低的推理成本,调用更大的能力池。1M 的上下文则让整本手册、整套代码库、成堆的论文可以一次性喂进模型,不必反复切分。

相比前代 Hy3(总参数 295B、激活参数 21B、上下文 256K),Hy4 preview 在模型尺寸、上下文长度和数据规模上都有显著扩展。这种扩展的直接结果,是模型在真实生产力任务上的能力跃升。

二、为生产力而生:和腾讯内部专家共建的训练数据

Hy4 preview 的定位是"为生产力而生"。它的能力不是靠纸面跑分堆出来的,而是通过与腾讯内部软件工程、游戏、金融、安全等领域顶尖专家的高质量数据共建,在与 WorkBuddy 等产品的深度协同(Co-Design)中打磨出来的。

这意味着模型的训练数据直接来自真实的业务场景:工程师的实际开发流程、游戏开发者的原型搭建、金融分析师的数据处理、安全专家的研判逻辑。模型学到的不是抽象的"答题技巧",而是真实工作中如何理解需求、规划步骤、调试验证、交付结果。

一个能说明这一点的细节是:Hy4 preview 在自身研发的全链路中就发挥了价值——它首次参与了训练方法、数据策略、评估体系和底层算子的自动优化。模型提出方案、运行实验、根据结果继续迭代,实验产生的代码、日志和反馈进入下一轮探索,形成了初步的递归自我改进闭环。连训练自己的方法都能参与优化,说明它在复杂任务上的自主能力已经走到了一个新的台阶。

三、软件工程:长程开发任务的理解、规划、调试与验证

在三大生产力场景中,软件工程是 Hy4 preview 提升最直观的一个。

官方披露,Hy4 preview 在软件工程场景下增强了长程开发任务的理解、规划、调试与验证能力,并进一步提升了前端开发的视觉审美和交互质量。具体表现为:

  • 长程任务驾驭:可以连续推进耗时较长的开发任务,理解并驾驭大型代码库,协同调用终端工具完成构建与调试。
  • 前端全链路生成:通过 MCP 接入,实现对话式从零构建游戏 Demo、互动漫画,开发者能通过多轮交互持续完善复杂项目。
  • 视觉与交互质量:更准确地理解页面、脚本、交互需求,组件生成、样式修改、自动 Debug 表现更稳定。

编码能力的提升有明确的榜单佐证。在 CodeArena WebDev 全球排行榜上,Hy4 preview 跃升至第 6 位,而上一代 Hy3 仅排名第 28 位——这是一次跨档位的进步。在 Terminal-Bench 2.1 上达到 85.4(Hy3 为 70.8),DeepSWE 软件工程基准上达到 64.3(Hy3 为 28.0),后者较前代提升超过一倍。

对 WorkBuddy 用户来说,这种能力提升的直接感受是:从"说清需求"到"跑出一个能用的结果",中间需要来回解释和手动修补的环节明显减少。

四、办公分析与科学研究:从信息处理到文档交付

办公分析和科学研究是另外两个重点突破的生产力场景。

办公分析场景下,Hy4 preview 显著提升了复杂办公环境理解和金融分析能力,着重优化了数据分析、跨文件协作,能够完成从信息处理到文档、表格与演示文稿交付的完整流程。也就是说,模型不只是"读懂"数据,而是能把分析结果直接落成一份可交付的表格、报告或 PPT。

科学研究场景下,模型显著提升了复杂科研问题的理解、推理与求解能力,在 AI 研发、分子动力学模拟、凝聚态物理、基础数学等各类场景中均有长足进步。1M 的超长上下文在这里尤其关键——它让模型可以综合大量网页、PDF、论文与数据材料,完成行业研究、科研分析与资料整理。

这两个场景的共同点是"输入海量、输出结构化"。Hy4 preview 的价值在于把"读得多"和"写得成"打通:既能吞下百万 token 的原始材料,又能把它们组织成可直接使用的交付物。

五、实测数据:专家盲测 2.99 分,对标一线开源模型

能力到底处于什么水平?一组来自人工盲测的数据给出了参考。

在一项由 163 名专家参与的 203 个任务盲测中,Hy4 preview 的平均得分为 2.99 分(满分 4 分),略高于 GLM-5.3 的 2.92 分和 Kimi K3 的 2.94 分。这是一项贴近真实工程任务的横向评测,三款模型处于同一梯队,Hy4 preview 在其中略占优势。

需要注意的是,官方也坦诚指出 Hy4 preview 目前仍存在的已知问题:复杂任务中的长思考倾向与过度自我验证倾向。这说明它仍有继续优化的空间,在部分高难度任务上可能出现"想太多"的情况,需要用户在实际使用中结合任务类型加以引导。

综合来看,Hy4 preview 在编码、办公、科研三大生产力场景上已经稳居开源模型第一梯队,尤其在软件工程这类长程任务上的进步最为突出。

六、在 WorkBuddy 里免费体验:限免至 9 月 10 日

Hy4 preview 已在 WorkBuddy 国内版首发接入,并同步开启限时免费体验,截止时间为 2026 年 9 月 10 日 23:59。用户在客户端对话框右上角的模型选择菜单中即可切换到 Hy4 preview,无需额外配置。

免费期内有两点需要留意:

  • 每日免费额度有限:因资源有限,平台为每位用户分配了每日免费额度,触发限频后页面会提示重置恢复时间。
  • 多模态任务走积分:Hy4 preview 是大语言模型,暂不具备图像、视频等多模态生成能力。在 WorkBuddy 里发起生图、视频等多模态任务时,系统会自动切换到其他多模态模型执行,该部分按正常规则消耗积分,不占用 Hy4 preview 的免费额度。

如果在使用中遇到排队(上线初期调用量激增时可能出现),可以切换到限免延长至 9 月 30 日的 Hy3 继续,或把非紧急任务错峰到晚间 23:00 至次日 8:00 执行。

从 8 月 28 日到 9 月 10 日这两周,是零成本体验这款 770B 旗舰的窗口期。对经常用 WorkBuddy 做复杂推理、长程开发、办公分析的用户,不妨趁免费期把它的实际表现跑一遍。


想了解更多关于 WorkBuddy 的功能详情与最新活动,欢迎访问 腾讯云 WorkBuddy 活动页

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

目录
  • 摘要:
  • 一、从参数规格看 Hy4 preview:770B 总参数、1M 上下文
  • 二、为生产力而生:和腾讯内部专家共建的训练数据
  • 三、软件工程:长程开发任务的理解、规划、调试与验证
  • 四、办公分析与科学研究:从信息处理到文档交付
  • 五、实测数据:专家盲测 2.99 分,对标一线开源模型
  • 六、在 WorkBuddy 里免费体验:限免至 9 月 10 日
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档