サウジアラビアのAI企業HUMAINが2026年9月3日、リヤドで開催中のLEAPで、アラビア語に特化した大規模言語モデル「humain-m3」を発表しました。パラメータ数は4,280億で、開発を請け負ったのは中国のMiniMaxです。自国語のフロンティアモデルを、中国製の土台の上に築くという選択が目を引きます。
自前でゼロから作らないという判断
humain-m3は、MiniMaxが公開している「MiniMax-M3」の系譜を土台にしています。HUMAINが仕様を発注し、MiniMaxが実際の開発を担当するという分担で、そこにアラビア語ネイティブのコンテンツ1兆トークン超を追加で事前学習させました。ベースの重みも設計も、出どころは中国というわけです。
国家規模のAI投資というと、基盤モデルを一から自前で組み上げる話になりがちです。HUMAINはそこを迂回しました。公開されている強力なベースモデルを起点にして、自国語のデータと後段の学習に資源を集中させる。フロンティアに追いつくまでの距離を、時間ではなく調達で詰めにいく形です。
HUMAINはサウジアラビアの公共投資基金(PIF)傘下の企業で、データセンターからクラウド基盤、モデル、業務ソリューションまでを縦に揃えることを掲げています。アラビア語モデルとしては、すでに自社で「ALLAM」ファミリーを持っています。今回はそれと並行して、外部の技術を取り込む線を太くした格好です。
7つのベンチマークで平均89.37パーセント
HUMAINの評価では、公開されているアラビア語ベンチマーク7種の平均で、humain-m3のプレビュー版が89.37パーセントを記録しました。同社が比較対象に挙げたのは、GPT-5.6 SOLの87.30パーセント、Opus 5の87.34パーセント、そして土台となったMiniMax M3の80.34パーセントです。7つのうち5つで首位に立ったとしています。
内訳は次のとおりです。アラビア語の基礎的な理解を測るAlGhafaが86.45パーセント、アラビア語ネイティブの広範な知識を問うArabicMMLUが90.70パーセント、学術試験形式のArabic EXAMSが67.67パーセント、言語運用能力を測るMadinahQAが95.44パーセント、真実性を測るAraTrustが97.53パーセント、検索拡張生成のALRAGEが94.63パーセント、翻訳版MMLUが93.20パーセントとなっています。
注目したいのは、土台のMiniMax M3との差です。平均で9ポイント上乗せされており、アラビア語データによる後段の学習がそのまま効いていることになります。逆に言えば、この9ポイントがHUMAINの寄与分ということでもあります。
ただし、これらの数値はいずれもHUMAIN自身がプレビュー版のチェックポイントを測ったものです。第三者による追試は今のところ出ておらず、学術試験形式のArabic EXAMSが67.67パーセントと他の項目より明確に低い点も含めて、外部の検証待ちという段階だと見ておくのが妥当です。
エージェントを前提にした設計
アーキテクチャは混合エキスパート(MoE、入力ごとに一部の専門家ネットワークだけを動かす方式)で、総パラメータ4,280億のうち、1トークンあたりに実際に動くのは230億です。HUMAINはこれを、エージェント向けに設計されたネイティブマルチモーダルのMoEだと説明しています。
学習の初期段階からテキストと画像、動画を同時に扱っており、長い動画の理解や画面操作にも対応するとされています。アラビア語と英語の両方で、道具の呼び出しやコンピュータ操作を含む長丁場のエージェント作業をこなせるという主張です。
思考モードは3種類が用意されました。常時オン、状況に応じて切り替える適応型、そしてオフです。推論に時間をかけるかどうかを用途ごとに選べる設計で、応答速度とコストを現場で調整できるようにしています。
試せるのはHUMAIN Node、重み公開は来月を目標
humain-m3は、HUMAINが運営するモデル提供基盤「HUMAIN Node」上でリサーチプレビューとして公開されました。ノーコードのプレイグラウンドで触ることもできますし、OpenAI互換のAPIエンドポイント経由で呼び出すこともできます。
アクセスは段階分けされています。アカウントを作るとまず利用申請ができるようになり、限定プレビュー層ではサウジアラビア向けのアライメント制御が適用された状態で、思考モードとストリーミングがオフ、遅延はやや大きくなります。リサーチプレビュー層に進むと、思考とストリーミングが有効な完全版のチェックポイントを、より低い遅延で使えます。
HUMAINはこのプレビュー期間を、一般提供の前にアラビア語の各方言にわたる能力と安全性、アライメントを初期利用者と一緒に検証する期間だと位置づけています。寄せられたフィードバックは次のチェックポイントに反映するとしています。
HUMAIN Nodeにはすでに100を超えるモデルが並んでいるとされ、単一のAPIキーと請求で使い分けられること、チームやプロジェクト単位で支出上限を設けられること、そしてホスティング先をグローバル、サウジアラビア国内、ソブリンの3択から選べることが特徴として挙げられています。humain-m3は、この基盤でプレビュー利用者に開かれた最初のモデルにあたります。
重みの公開についても言及がありました。安全性の学習とアライメントが完了した時点で、MiniMax Community Licenseのもとで公開する予定で、現時点の目標は来月とされています。土台がオープンなモデルだったものが、アラビア語を厚く学習した状態で再びオープンに戻る流れです。
まとめ
humain-m3は、アラビア語という言語圏の空白をフロンティアモデルで埋めにいく試みであり、その手段として中国製のオープンな土台を選んだ点に特徴があります。HUMAINのTareq Amin最高経営責任者は、数億人が話す言語でありながらAIの最前線では著しく手薄なままだと述べ、そこへの投資だと位置づけました。ベンチマークの数値は自社評価にとどまるため、実力の見極めは来月に予定される重み公開後の外部検証を待つことになります。
