Alibaba 的模型研发团队 Qwen 于日本时间 2026 年 8 月 26 日公开了开放权重的 AI 模型「Qwen3.8-Flash-Next」。该模型总参数量为 1250 亿,但每个 token 实际激活的只有 60 亿,并且提前搭载了面向下一代「Qwen4」的 4 项新机制。权重已可从 Hugging Face 和 ModelScope 下载。

总参数 1250 亿,实际运行的只有 60 亿

Qwen3.8-Flash-Next 是一款除文本外还能处理图像与视频的 MoE(Mixture-of-Experts,混合专家)模型。MoE 把模型内部拆成许多分工不同的小网络,每次输入只启动需要的部分,从而压低计算量。「125B-A6B」的写法表示总参数 1250 亿、激活参数 60 亿。

除主体之外,模型还带有 510 亿参数规模的 N-gram 嵌入。上下文长度默认为 26 万 2144 个 token,扩展后最高可达 100 万 token。

与 Opus 4.6 及 27B 版本的对比

在 Qwen 公布的基准测试结果中,与 Anthropic 的「Claude Opus 4.6(Max)」相比,衡量软件开发能力的 SWE-bench Pro 为 62.5%(Opus 4.6 为 53.4%),面向长时间办公任务的 CoWorkBench 为 73.9%(对方 68.2%),职务任务基准 JobBench 为 55.7%(对方 36.6%),三项均领先。

与自家总参数 3970 亿的上位模型「Qwen3.7-Plus」相比,多个项目同样占优,而训练成本据称仅为约九分之一。

更值得关注的是与本地 AI 常用的「Qwen3.8-27B」的对比。27B 是 270 亿参数全部参与运算的 Dense(稠密)型模型,而 Qwen3.8-Flash-Next 只运行 60 亿。即便如此,在语言与视觉合计 22 个项目中达到同等或更优,其中 21 项胜出。SWE-bench Pro 为 62.5% 对 61.7%,差距不大;但 JobBench 为 55.7% 对 33.4%,差距明显。

需要说明的是,这些数字均由 Qwen 自行公布,并非第三方独立验证的结果,解读时应留意这一前提。

提前落地的 4 项 Qwen4 新机制

Qwen 将激活参数如此之少仍能取得高分的原因归结为 4 项设计改动。

第一是注意力机制(决定关注上下文中哪些部分的机制)的结构。每 4 层由 3 层负责压缩并记住上下文的「Gated DeltaNet」与 1 层只挑选重要区块回读的「Qwen Sparse Attention」组合而成。在缓存命中率 90%、输入 100 万 token 的条件下,预填充处理量达到 Qwen3.7-Plus 的 8.6 倍。

第二是「Gated Residual」,把各层输入直通到深层的通路由 1 条增加到 4 条,并用门控动态调节每条通路的读写量。早期信息在传到深层时不易被稀释,训练也更稳定。

第三就是前面提到的 N-gram 嵌入。它是一张根据前若干个 token 的排列查取对应向量的参照表,独立于主体,规模为 510 亿参数。由于只是查表,每个 token 的计算量几乎没有增加。

第四是提升训练时参数更新效率的新方法「Muon」,用更少的步骤完成训练。训练成本降到约九分之一,正是得益于此。

510 亿参数能放进内存的意义

对在本地跑模型的人来说,关键在于 N-gram 嵌入的 510 亿参数可以放在内存而不是显存里。通常显存装不下的参数需要每次从内存传输到 GPU,速度会大幅下降。以 8GB 显卡运行 35B 级模型而受到关注的运行环境「FreeToken」也跨过了这道门槛,但那是以 NVIDIA 显卡为前提的运行环境侧优化。

Qwen3.8-Flash-Next 则是从模型侧就按照「放在内存里预读」的前提设计的,因此不受特定 GPU 环境的限制。Qwen 列出的服务器端可用环境包括推理框架「SGLang」「vLLM」「TokenSpeed」。本地端也提到了「llama.cpp」的支持,但预读是否已经实现目前尚不清楚。

授权条款与商用版价格

授权采用「Qwen Community License 1.0」,原则上包含商用在内均免费。不过,从事 MaaS 业务,或提供以 AI 编程、办公辅助为主要用途的产品时,需要另行签约。此外,月活跃用户超过 1 亿,或月营收超过 2000 万美元(约 32 亿日元)的产品,需在 UI 上标注模型名称。

对应的商用版「Qwen3.8-Flash」预计将很快通过 QwenCloud 的 API 提供。价格公布为每 100 万 token 输入 0.16 美元(约 25 日元)、输出 0.47 美元(约 75 日元)。

※1 美元 = 159 日元

总结

Qwen3.8-Flash-Next 相当于把下一代 Qwen4 的设计提前放了出来。要点在于:以 60 亿激活参数的轻量配置拿到了 Opus 4.6 级别的分数,并把沉重的部分甩给内存,从而摆脱对特定 GPU 的依赖。如果 llama.cpp 的预读支持落定,能在自己电脑上运行的模型选择还会进一步增加。