沙烏地阿拉伯的人工智慧公司 HUMAIN 於 2026 年 9 月 3 日,在利雅德舉行的 LEAP 大會上發表了專攻阿拉伯語的大型語言模型 humain-m3。參數量為 4,280 億,實際負責開發的則是中國的 MiniMax。將本國語言的前沿模型建構在中國技術基礎之上,這項選擇格外引人注目。
不從零自行打造的判斷
humain-m3 建立在 MiniMax 公開的 MiniMax-M3 系譜之上。由 HUMAIN 提出需求、MiniMax 負責實際開發,並在此基礎上追加預訓練了超過 1 兆個 token 的阿拉伯語原生內容。基礎權重與架構都來自中國。
國家級的人工智慧投入,通常意味著從頭打造基礎模型。HUMAIN 繞過了這一步。以公開可取得的強力基礎模型為起點,把資源集中投入本國語言資料與後續訓練,用採購而非時間來縮短與前沿之間的距離。
HUMAIN 是沙烏地公共投資基金(PIF)旗下的企業,主張從資料中心、雲端平台、模型到產業解決方案垂直整合。在阿拉伯語模型方面,公司已擁有自行開發的 ALLAM 系列。這次發表與該系列並行推進,同時明顯拓寬了引進外部技術的路線。
七項基準平均 89.37 分
在 HUMAIN 自行進行的評測中,humain-m3 預覽版檢查點在七項公開阿拉伯語基準上的平均成績為 89.37 分。公司列出的比較對象包括 GPT-5.6 SOL 的 87.30 分、Opus 5 的 87.34 分,以及作為基礎的 MiniMax M3 的 80.34 分。HUMAIN 表示該模型在其中五項位居第一。
細項如下:衡量阿拉伯語基礎理解的 AlGhafa 為 86.45 分,考察阿拉伯語原生廣泛知識的 ArabicMMLU 為 90.70 分,學術考試形式的 Arabic EXAMS 為 67.67 分,語言運用能力的 MadinahQA 為 95.44 分,真實性方面的 AraTrust 為 97.53 分,檢索增強生成的 ALRAGE 為 94.63 分,翻譯版 MMLU 則為 93.20 分。
值得留意的是與基礎模型 MiniMax M3 之間的落差。平均提升了 9 分,代表阿拉伯語的後續訓練直接反映在成績上。換個角度說,這 9 分正是 HUMAIN 的貢獻。
不過這些數據都是 HUMAIN 自行測量預覽版檢查點所得。目前尚未出現第三方的複測,且 Arabic EXAMS 的 67.67 分明顯低於其他項目,因此視為仍待外部驗證的階段較為妥當。
以代理人為前提的設計
架構採用混合專家(MoE,也就是每次輸入只啟動部分專家網路的方式),總參數 4,280 億當中,每個 token 實際啟動的是 230 億。HUMAIN 將其描述為專為代理人設計的原生多模態 MoE。
文字、影像與影片從訓練的第一步就被共同處理,模型據稱支援長影片理解與原生的螢幕操作。公司主張它能在阿拉伯語與英語兩種語言下,完成包含工具呼叫與電腦操作在內的長時程代理人作業。
思考模式提供三種:常時開啟、自動調整、關閉。是否在推論上花費時間成為可依用途選擇的設定,讓回應速度與成本能在實務環境中調整。
可在 HUMAIN Node 試用,權重公開目標訂在下個月
humain-m3 以研究預覽的形式,在該公司的模型存取平台 HUMAIN Node 上開放。既可以在無程式碼的 playground 中直接試用,也可以透過相容 OpenAI 的 API 端點呼叫。
存取權限分為數個層級。建立帳號後即可提出使用申請。有限預覽層會套用針對沙烏地的對齊防護,思考與串流輸出關閉,延遲略高。進入研究預覽層之後,可以使用啟用思考與串流輸出的完整檢查點,延遲也更低。
HUMAIN 將預覽期定位為在正式開放前,與早期使用者一同驗證模型在各阿拉伯語方言上的能力、安全性與對齊程度的階段,並表示收到的回饋會反映到後續的檢查點。
據稱 HUMAIN Node 上已經匯集超過 100 個模型,可用同一組 API 金鑰與帳單跨模型使用,支援依團隊與專案設定支出上限,並可在全球、沙烏地境內、主權託管三種方式中選擇。humain-m3 是該平台上首個對預覽使用者開放的模型。
關於權重,公司也做了說明。在安全訓練與對齊完成後,計畫以 MiniMax Community License 的形式公開,目前的目標時間為下個月。原本就開放的基礎,將在深度學習阿拉伯語之後再次回到開放狀態。
總結
humain-m3 是以前沿模型填補阿拉伯語圈空白的一次嘗試,其特徵在於選擇了中國的開放基礎作為手段。HUMAIN 執行長 Tareq Amin 表示,阿拉伯語的使用者多達數億人,在人工智慧的最前線卻仍明顯缺席,這次發表正是針對這一點的投資。由於基準數據皆為自評,模型的真實實力還得等下個月權重公開後的外部驗證。
