Tencent 混元團隊於 2026 年 8 月 28 日發表新世代大型語言模型 Hy4 preview,並同步開源模型權重。總參數量為 7700 億,每個 token 實際啟用 490 億,可處理的脈絡長度超過 100 萬 token。授權採 Apache 2.0,商用等情境的限制相當少。
7700 億參數中每次只運作 490 億
Hy4 preview 採用混合專家(MoE)架構。模型內部排列著大量小型專家網路,會依輸入只啟動其中一部分。因此總參數雖有 7700 億,處理每個 token 時真正參與運算的只有 490 億。
主幹共 78 層,第一層使用一般的稠密 FFN,其餘 77 層改為 MoE。每個 MoE 層包含 256 個路由專家與 1 個共享專家,每個 token 會啟用得分最高的 8 個路由專家以及共享專家。隱藏層維度為 6144,詞彙表規模為 120832。
注意力機制參考了 DeepSeek 與 GLM 的研究,採用 Gated DSA(Gated DeepSeek Sparse Attention),並搭配可跨層重複使用稀疏索引的 IndexCache。這些設計都是為了讓 100 萬 token 的脈絡長度在運算量上可行。此外還內建了用於推測解碼的 MTP 層(總參數 100 億、啟用 7 億),並同時釋出 FP8 量化版本 Hy4 preview-FP8。
163 位內部專家參與的盲測評估
Tencent 將這款模型定位為面向實際工作,而非面向排行榜。訓練資料是與內部的軟體工程師、遊戲開發者、金融分析師、資安人員等專家共同建構的。
為了檢驗成效,163 位內部專家針對 203 項工程任務進行盲測比對。結果 Hy4 preview 平均得分 2.99 分(滿分 4 分),略高於 GLM 5.3 的 2.92 分與 Kimi K3 的 2.94 分。對上 GLM 5.3 的勝負分布為勝率 46.8%、平手 12.8%、負 40.4%;對上 Kimi K3 則是勝率 51.2%、平手 7.9%、負 40.9%。從數字來看,比較接近險勝而非壓倒性領先。
已公開的基準成績包括 GPQA Diamond 92.3、SWE-bench Pro 65.7、SWE-bench Multilingual 解決率 82.9、Deep SWE 64.3、SkillsBench v1.1 62.9。
模型自己參與了訓練與推論的最佳化
這次發表最引人注目的,是 Hy4 preview 參與了自身的研發流程。在訓練方法、資料策略、評估架構以及底層運算子的自動最佳化上,模型首次介入其中。模型提出方案、執行實驗,再依結果提出下一輪構想,產出的程式碼、紀錄與回饋又流入下一輪探索。Tencent 稱這形成了早期階段的遞迴式自我改進迴圈。
推論端也是同樣的情況。模型分析了自身運作的推論系統瓶頸,對運算子融合與通訊最佳化等環節進行多輪調整。最終,端對端吞吐量相較基準提升 31.8%,且在不同脈絡長度與並行數下改善都保持一致。
不過 Tencent 也坦言這仍是未完成的版本。發表時已知的問題包括:處理複雜任務時思考時間超出必要程度,以及過度驗證自身產出的傾向。團隊表示會延續上一代 Hy3 的做法,先釋出、再蒐集問題回饋。
可以在哪裡執行,以及價格
權重在 Hugging Face、ModelScope、GitCode、CNB 四處發布。自行部署方面備有 vLLM 與 SGLang 的官方映像檔,並各自附上專屬的設定範例。vLLM 的建議配置是把 FP8 版本分散到 8 張 GPU 上。
docker run --gpus all -p 8000:8000 --ipc=host \
vllm/vllm-openai:hy4-preview tencent/Hy4-preview-FP8 \
--tensor-parallel-size 8 \
--attention-backend FLASHMLA_SPARSE \
--served-model-name hy4-preview
不想自行準備 GPU 的話,可以直接透過 WorkBuddy、CodeBuddy、元寶、ima 等 Tencent 產品試用。WorkBuddy 與 CodeBuddy 在發表後兩週內免費開放。上一代 Hy3 在這兩個平台上的免費使用也延長至 9 月 30 日。
API 可經由 Tencent Cloud TokenHub 與 OpenRouter 呼叫。每百萬 token 的價格為輸入 0.834 美元(約 130 日圓)、輸出 2.501 美元(約 400 日圓)、快取命中 0.042 美元(約 7 日圓)。以 7700 億參數等級的模型而言,這樣的定價相當克制。
※1 美元 = 159 日圓
總結
Hy4 preview 是總參數 7700 億、啟用 490 億的 MoE 模型,以 Apache 2.0 釋出了 100 萬 token 的脈絡能力。內部盲測中它小幅勝過 GLM 5.3 與 Kimi K3,而模型參與自身訓練與推論最佳化、把吞吐量提升 31.8% 這一點尤其值得注意。Tencent 強調這只是預覽版本,Hy4 系列的後續模型也將很快推出。
※縮圖為 AI 生成的示意圖。
