腾讯混元团队于 2026 年 8 月 28 日发布新一代大语言模型 Hy4 preview,并同步开源模型权重。该模型总参数量为 7700 亿,每个 token 实际激活 490 亿,上下文窗口超过 100 万 token。许可证为 Apache 2.0,商用等场景的限制很少。

7700 亿参数中每次只跑 490 亿

Hy4 preview 采用混合专家(MoE)架构。模型内部排布着大量小型专家网络,根据输入只启动其中一部分。因此总参数虽有 7700 亿,处理每个 token 时真正参与计算的只有 490 亿。

主干共 78 层,第一层使用常规的稠密 FFN,其余 77 层替换为 MoE。每个 MoE 层包含 256 个路由专家和 1 个共享专家,每个 token 激活得分最高的 8 个路由专家以及共享专家。隐藏层维度为 6144,词表规模为 120832。

注意力部分借鉴了 DeepSeek 与 GLM 的研究,采用 Gated DSA(Gated DeepSeek Sparse Attention),并配合可跨层复用稀疏索引的 IndexCache。这些设计都是为了让 100 万 token 的上下文长度在算力上可行。此外模型还内置了用于投机解码的 MTP 层(总参数 100 亿,激活 7 亿),同时发布了 FP8 量化版本 Hy4 preview-FP8。

163 位内部专家参与的盲测评估

腾讯把这款模型定位为面向实际工作,而非面向榜单。训练数据由内部的软件工程师、游戏开发者、金融分析师、安全人员等专家共同构建。

为了检验效果,163 位内部专家针对 203 项工程任务进行了盲测对比。结果 Hy4 preview 平均得分 2.99 分(满分 4 分),略高于 GLM 5.3 的 2.92 分和 Kimi K3 的 2.94 分。对阵 GLM 5.3 的胜负分布为胜率 46.8%、平局 12.8%、负 40.4%;对阵 Kimi K3 为胜率 51.2%、平局 7.9%、负 40.9%。从数字看更接近险胜,而非碾压。

已公开的基准成绩包括 GPQA Diamond 92.3、SWE-bench Pro 65.7、SWE-bench Multilingual 解决率 82.9、Deep SWE 64.3、SkillsBench v1.1 62.9。

模型自己参与了训练与推理的优化

此次发布中最引人注目的,是 Hy4 preview 参与了自身的研发流程。在训练方法、数据策略、评估框架以及底层算子的自动优化上,模型首次介入其中。模型提出方案、跑实验,再根据结果给出下一轮设想,产出的代码、日志与反馈又流入下一轮探索。腾讯称这形成了早期阶段的递归式自我改进循环。

推理侧同样如此。模型分析了自身所运行的推理系统的瓶颈,对算子融合与通信优化等环节进行了多轮改造。最终,端到端吞吐量相比基线提升 31.8%,且在不同上下文长度与并发量下改善都保持一致。

不过腾讯也坦承这仍是未完成的版本。发布时已知的问题包括:处理复杂任务时思考时间超出必要程度,以及过度校验自身输出的倾向。团队表示会延续上一代 Hy3 的做法,先发布、再收集问题反馈。

在哪里跑,以及价格如何

权重在 Hugging Face、ModelScope、GitCode、CNB 四处分发。本地部署方面提供了 vLLM 与 SGLang 的官方镜像,并各自附有专门的配方文档。vLLM 的推荐配置是把 FP8 版本分布到 8 张 GPU 上。

docker run --gpus all -p 8000:8000 --ipc=host \
  vllm/vllm-openai:hy4-preview tencent/Hy4-preview-FP8 \
  --tensor-parallel-size 8 \
  --attention-backend FLASHMLA_SPARSE \
  --served-model-name hy4-preview

不想自己准备 GPU 的话,可以直接通过 WorkBuddy、CodeBuddy、元宝、ima 等腾讯产品试用。WorkBuddy 与 CodeBuddy 在发布后两周内免费开放。上一代 Hy3 在这两个平台上的免费使用也延长至 9 月 30 日。

API 可经由腾讯云 TokenHub 与 OpenRouter 调用。每百万 token 的价格为输入 0.834 美元(约 130 日元)、输出 2.501 美元(约 400 日元)、缓存命中 0.042 美元(约 7 日元)。对于 7700 亿参数级别的模型来说,这个定价相当克制。

※1 美元 = 159 日元

总结

Hy4 preview 是总参数 7700 亿、激活 490 亿的 MoE 模型,以 Apache 2.0 开放了 100 万 token 的上下文能力。内部盲测中它小幅胜过 GLM 5.3 与 Kimi K3,而模型参与自身训练与推理优化、把吞吐量提升 31.8% 这一点尤其值得关注。腾讯强调这只是预览版本,Hy4 系列的后续模型也将很快推出。

※缩略图为 AI 生成的示意图。