今天打开 WorkBuddy,模型列表里多了一个 Hy4 preview,和 Hy3 一样挂着"限时免费"标签。
Hy4 preview 是腾讯混元的新旗舰模型,2026 年 8 月 28 日发布,WorkBuddy、CodeBuddy、元宝、ima 同步上线。
![]()
Hy4 preview 简介
Hy4 preview 采用 MoE 架构,总参数 770B,激活 49B。Hugging Face 文件页显示 780B,是算上了内置的 MTP 投机解码层(10B 总参 / 0.7B 激活),官方口径用 770B,指 backbone。上下文 1M tokens,词表 120832,License Apache 2.0。
架构细节:
78 层,第 1 层 dense FFN,其余 77 层 MoE
每层 256 路由专家 + 1 共享专家,每 token 激活 top-8 路由 + 1 共享
Hidden size 6144,4 条残差流用 iHC
Attention 用 Gated DSA + IndexCache 跨层稀疏索引复用
跟上代 Hy3 比:295B/21B、256K 上下文,涨到 770B/49B、1M 上下文。迭代节奏从 2026 年 2 月重建预训练与强化学习基础设施算起,平均两个月一个大版本,腾讯首席 AI 科学家姚顺雨主导。
官方定性是"稳居开源模型第一梯队",也明说这是早期版本,"预训练和后训练均仍有较大的提升空间",Hy4 下一版近期陆续上线。
跑分与盲测怎么看
官方给 Hy4 preview 列了 12 项 benchmark:Terminal Bench 2.1、DeepSWE、ProgramBench、SWE Atlas Refactoring、ALE-CLI、Toolathlon-Verified、APEX-Agents (pass@1)、PostTrainBench、OneMillionBench (with tools)、BioMysteryBench、Humanity's Last Exam (text-only)、HorizonMath (pass@4)。对比阵营是 Hy3、Qwen 3.8 Max、DeepSeek V4 Pro 0813、GPT 5.6 Sol、GLM 5.3、Kimi K3、Claude Opus 5。
只有 4 项分数能从公开文字报道里确认:
Benchmark | Hy4 preview | Hy3 |
Terminal Bench 2.1 | 85.4 | 70.8 |
DeepSWE | 64.3 | 28.0 |
Toolathlon-Verified | 74.1 | — |
APEX-Agents (pass@1) | 37.1 | — |
DeepSWE 从 28.0 到 64.3,翻倍还多。Terminal Bench 2.1 涨了 14.6 分。APEX-Agents 37.1,Kimi K3 是 37.2,差 0.1。
前提是:这 12 项跑分全部是腾讯自述。发布当天没有 Artificial Analysis 收录,没有 HF Open LLM Leaderboard 数据,也没有社区独立实测,第三方媒体基本都是通稿转载。"85.4 超越 DeepSeek V4 Pro、与 Claude Opus 5 持平"这句也是腾讯新闻转述官方图,属于二手。
腾讯新闻的观察角度我觉得比绝对分数更有参考价值:12 项放一起看,Hy4 preview 没有一项垫底,而它 770B/49B 的规模在同台第一梯队里算小的。
内部盲测是另一组数据:163 名内部专家、203 个工程任务,在 WorkBuddy 环境里盲测,Hy4 preview 均分 2.99/4.00。对 GLM 5.3 的 2.92(胜 46.8% / 平 12.8% / 负 40.4%),对 Kimi K3 的 2.94(胜 51.2% / 平 7.9% / 负 40.9%)。这是腾讯自己组织、自己产品环境下的自评,优势幅度不大,官方用词是"略优于"。
它参与了自己
端到端吞吐相较基线 +31.8%,4K–256K 上下文、1–64 并发下都有稳定收益。分场景看,prefill 侧 +3%+7%,decode 侧 +44%+69%。这些优化是模型自己定位推理系统瓶颈、自己提方案跑出来的。
再往上一层,Hy4 preview 首次参与了自身的研发全链路,训练方法、数据策略、评估体系、底层算子的自动优化。它自己提方案、跑实验、看结果继续迭代,官方称形成了"初步的递归自我改进闭环"。闭环到底有多深不好判断,但 decode 侧 40% 以上的增益是实打实跑出来的。
科学场景是同一套打法:
分子动力学(配合 Hyra):32,512 原子磷脂双分子层 SO3LR,在已高度优化的 JAX 实现上再提速 2.0×,达 54.9 ms/step,单张高端 GPU 可容纳 30 万原子
低温量子输运器件设计:自主完成量子散射求解器构建、五势垒结构稳健优化、独立含时演化验证,高能阻带平均泄漏率从 48.2% 降到 4.8%,还生成了一个支持调参的交互式模拟器
三维 Blaschke–Lebesgue 问题(百年经典几何难题):体积下界从 0.380799 推进到 0.41104,Meissner 四面体猜想上界 0.41986,只剩约 2% 的 gap。完整证明在 Hyra-results 仓库
前端工程类放的几个案例里,古建筑数字孪生网站那条约束最苛刻:Three.js r184 + GLTFLoader + DRACOLoader + OrbitControls,7 个 GLB 模型(故宫、布达拉宫、黄鹤楼、天坛、长城、福建土楼、莫高窟),明确禁止用占位几何体和网络图片替代,三栏布局 296px / 自适应 / 336px,配色宣纸 #F7F2E5 配靛蓝 #22406A,宋体,验收标准是"安静、理性、东方、博物馆化"。审美难量化,能按这套约束交付,说明设计意图的解析是到位的。
其余还有程序化 3D 微缩小镇、《鹅来》横向互动漫画网页(原生 WebGL,滚动驱动相机沿 X 轴推进)、通过 MCP 接入 Unreal 5 做射击游戏 Demo、用团结引擎做第三人称企鹅冒险游戏。
腾讯新闻苏扬的实测是目前唯一一份准第三方材料。他用一句很粗的 prompt 让它做谷歌财报页,17 分钟后交付了结构清晰的汇总页,数据来源自己找到 SEC 和谷歌 IR 资料包,中途会判断信源可靠性、交叉验证、跑工具校验数据后再写代码。他的评价是"同时承担了研究员和前端工程师的角色"。
同一篇实测也给了边界:企鹅岛 3D 小游戏画面卡通、符合小游戏调性,但做不到 3A,"让现阶段的模型做 3A,预期反而过高了"。
Hy4 preview 怎么用上
WorkBuddy 和 CodeBuddy 是两个独立产品,各有国内版和国际版:CodeBuddy 管写代码(codebuddy.cn / codebuddy.ai,IDE、插件、CLI 三端),WorkBuddy 管办公(workbuddy.cn / workbuddy.ai)。元宝、ima 同步上线,在线体验入口是 https://aistudio.tencent.com/。
免费期到 2026 年 9 月 10 日 23:59,官方给的理由是收集用户反馈。这个日期是 WorkBuddy 侧的口径,CodeBuddy 官方只说同步开展两周限时免费,没单独给截止日期。免费期内每天有额度上限,触顶后消耗积分,繁忙时要排队。
WorkBuddy 的模型列表里能直接选到 Hy4 preview,标签写着"限时免费",同列还有 Hy3(限时 2 折)、GLM-5.2、Kimi K3 等。具体菜单路径官方没写,以你客户端实际显示为准。
API 价格两边报价换算后是自洽的:
渠道 | 输入 | 输出 |
腾讯官方(国内) | 6 元/百万 tokens(命中缓存 0.3 元) | 18 元/百万 tokens |
OpenRouter(截至 2026-08-28) | $0.834/M | $2.501/M |
OpenRouter 模型 ID 是 tencent/hy4-preview,上下文标 1.05M。腾讯云 TokenHub 也上了:https://console.cloud.tencent.com/tokenhub/models/detail?modelId=hy4-preview
自部署的门槛不低。vLLM / SGLang 都还没有现成支持,需要从源码编译,而且至少 8 卡:
```bash # vLLM 从源码编译后启动(8 卡 FP8) vllm serve tencent/Hy4-preview-FP8 \ --tensor-parallel-size 8 ```
770B BF16 权重约 1.5TB,FP8 约 770GB,FP8 版也要 8 卡才跑得动。量化可以用配套的 AngelSlim。
开源地址:
Hugging Face:https://huggingface.co/tencent/Hy4-preview
ModelScope、GitCode 同步
GitHub 仓库 2026-08-27 创建,发布首日 42 stars。这只是首日快照,说明不了太多。
注意事项
慢热这点官方自己承认,"复杂任务的长思考和过度自我验证倾向"被列进了已知问题。苏扬的实测标签是"聪明且慢热",眼看要出结果了,模型还要再验证一轮,交付时长偏长,等待过程煎熬。
自部署用户可以关掉深度思考直出,这个参数是 GitHub README 里翻出来的:
```python
response = client.chat.completions.create(
model="hy4-preview",
messages=[{"role": "user", "content": "..."}],
temperature=0.9,
top_p=1.0,
extra_body={"chat_template_kwargs": {"reasoning_effort": "no_think"}}
)
```官方推荐 temperature=0.9、top_p=1.0,reasoning 默认 "high"。要速度就传 no_think,要质量保留默认。
多模态目前缺失。官方说明写得很直接:「Hy4 preview 和 Hy3 均为大语言模型,暂不具备多模态能力」。拿它跑视频、图像这类生成任务时会切到其他多模态模型,因此照常消耗积分。
目前所有性能数据都是腾讯自述,过两天 Artificial Analysis 或社区实测出来,结论可能有出入。
免费期到 9 月 10 日,每天限量,想试趁早。前端和工程类任务可以先拿手上正在做的活试试水,看表现如何。
未经允许不得转载:w3h5前端开发资源网 » Hy4 preview 发布:770B MoE 开源,WorkBuddy 限时两周免费用
w3h5前端开发资源网