沙特人工智能公司 HUMAIN 于 2026 年 9 月 3 日在利雅得举行的 LEAP 大会上,发布了面向阿拉伯语的大语言模型 humain-m3。该模型参数量为 4280 亿,实际承担开发工作的是中国的 MiniMax。把本国语言的前沿模型建立在中国技术底座之上,这一选择格外引人注意。

不从零开始自研的判断

humain-m3 基于 MiniMax 公开的 MiniMax-M3 谱系构建。HUMAIN 提出需求,MiniMax 负责实际开发,并在此基础上追加预训练了超过 1 万亿 token 的阿拉伯语原生内容。底座权重与架构均来自中国。

国家级的人工智能投入,通常意味着从零搭建基础模型。HUMAIN 绕开了这一步。以公开可得的强力基础模型为起点,把资源集中投向本国语言数据与后训练,用采购而非时间来缩短与前沿的距离。

HUMAIN 是沙特公共投资基金(PIF)旗下企业,主张打通数据中心、云平台、模型到行业解决方案的完整链条。在阿拉伯语模型方面,公司已有自研的 ALLAM 系列。此次发布与该系列并行推进,同时明显拓宽了引入外部技术的通道。

七项基准平均 89.37 分

在 HUMAIN 自己的评测中,humain-m3 预览版检查点在七项公开阿拉伯语基准上的平均成绩为 89.37 分。公司列出的对比对象包括 GPT-5.6 SOL 的 87.30 分、Opus 5 的 87.34 分,以及作为底座的 MiniMax M3 的 80.34 分。HUMAIN 表示该模型在其中五项上位列第一。

具体来看:衡量阿拉伯语核心理解能力的 AlGhafa 为 86.45 分,考察阿拉伯语原生广博知识的 ArabicMMLU 为 90.70 分,学术考试形式的 Arabic EXAMS 为 67.67 分,语言运用能力的 MadinahQA 为 95.44 分,真实性方面的 AraTrust 为 97.53 分,检索增强生成的 ALRAGE 为 94.63 分,翻译版 MMLU 为 93.20 分。

值得关注的是与底座 MiniMax M3 之间的差距。平均提升了 9 分,说明阿拉伯语后训练直接体现在了结果上。反过来说,这 9 分正是 HUMAIN 的贡献部分。

不过这些数据都是 HUMAIN 自行测量预览版检查点得出的。目前尚无第三方复现,且 Arabic EXAMS 的 67.67 分明显低于其他项目,因此把它看作有待外部验证的阶段更为妥当。

面向智能体的设计

架构采用混合专家(MoE,即针对每次输入只激活部分专家网络的方式),总参数 4280 亿中,每个 token 实际激活 230 亿。HUMAIN 将其描述为面向智能体设计的原生多模态 MoE。

文本、图像与视频从训练第一步起就被联合处理,模型据称支持长视频理解与原生的屏幕操作。公司主张它能够在阿拉伯语和英语两种语言下,完成包含工具调用与计算机操作在内的长周期智能体任务。

思考模式提供三种:常开、自适应、关闭。是否在推理上花费时间成为按场景可选的设置,便于在实际部署中调节响应速度与成本。

通过 HUMAIN Node 试用,权重公开目标定在下月

humain-m3 以研究预览的形式,在公司的模型接入平台 HUMAIN Node 上开放。既可以在无代码的 playground 中直接体验,也可以通过兼容 OpenAI 的 API 端点调用。

访问权限分为若干层级。创建账户后即可提交使用申请。有限预览层会应用面向沙特的对齐防护,思考与流式输出关闭,延迟略高。进入研究预览层后,可以使用开启思考与流式输出的完整检查点,延迟也更低。

HUMAIN 将预览期定位为在正式开放前,与早期用户一同验证模型在各阿拉伯语方言上的能力、安全性与对齐水平的阶段,收集到的反馈将反映到后续检查点中。

据称 HUMAIN Node 上已汇集超过 100 个模型,可用同一套 API 密钥与账单跨模型使用,支持按团队与项目设置支出上限,并可在全球、沙特境内、主权托管三种方式中选择。humain-m3 是该平台上首个面向预览用户开放的模型。

关于权重,公司也作了说明。在安全训练与对齐完成后,计划以 MiniMax Community License 的形式公开,目前的目标时间为下个月。原本就开源的底座,将在深度学习阿拉伯语之后再次回到开放状态。

总结

humain-m3 是以前沿模型填补阿拉伯语世界空白的一次尝试,其特点在于选择了中国的开源底座作为实现手段。HUMAIN 首席执行官 Tareq Amin 表示,阿拉伯语的使用者多达数亿,但在人工智能前沿仍严重缺席,此次发布正是针对这一点的投入。由于基准数据均为自评,模型的真实实力还需等待下月权重公开后的外部验证。