阿里巴巴旗下的Qwen团队于8月3日开放了旗舰大语言模型「Qwen3.8-Max」。总参数量达到2.4万亿,但更值得关注的不是规模本身,而是它在没有任何人工干预的情况下连续写了16天代码这一运行时长。该模型及其小型版本的权重将于下周公开,开源化的节奏又快了一步。
2.4万亿中真正参与运算的是950亿
Qwen3.8-Max采用MoE(混合专家)架构,每生成一个token只调用所需的专家网络。总参数为2.4万亿,但推理时激活的参数约为950亿。目的是在保留超大模型知识容量的同时,压低每次响应的计算量与延迟。
上下文规模最大可达100万token,其中常规模式下最大输入约99.1万token,开启思考模式时约98.3万token,最大输出为13.1万token。除文本外还能原生理解图像和视频,从截图直接搭建网站这类用法也在设计范围内。
从空文件夹开始,16天无人看管
Qwen团队最想强调的能力,是在无人介入的前提下持续进行软件开发。从空文件夹起步、约16天的完全自主运行结束后,对应仓库累积了265次提交、127个拉取请求和151个Issue。这不是一次性的代码生成,而是持续两周以上自行发现问题、修改并扩展功能的过程。
作为对比,上一代Qwen3.7-Max被讨论的自主运行时长还停留在35小时量级,这一次直接跨了一个数量级。
先复现论文,再超越原方法
研究任务的验证结果也已公开。题目是一篇关于从大语言模型训练数据中挑选「模型最难判断的样本」的论文。交给Qwen3.8-Max的只有论文和GPU,数据处理、训练、评估所需的代码和实验环境都必须从零搭建。
整个过程耗时约125小时,写出约7600行代码,操作次数超过1100次,在GPU上完成33次训练。最初约37小时复现了论文的6项主要结果,剩余约88小时则反复执行「提出假设、实现、跑实验、分析、再尝试」的循环,共4轮、验证了18项改进方案。最终它得出了自有的样本选择方法,把数学基准AIME24从复现值49.58%提升到52.29%,高出2.71个百分点。
它还与人类正面较量过。在阿里云举办的多模态对话意图识别竞赛中,该模型在24小时内自主搭建了分类系统,通过45次提交把准确率从0.600提高到0.853,在526支参赛队伍中超过458支,进入前13%[1]。
365天电商运营模拟中资金增长4.16倍
为了检验模型能否从经验中学习,团队还基于阿里巴巴旗下淘宝和天猫的匿名化数据,进行了365天的电商运营模拟。10万元(约230万日元)的初始资金增长到41万6252元(约960万日元),回报率为4.16倍,比第二名GLM 5.2高出38%,比上一代Qwen3.7-Max高出152%。
有意思的是增长的原因:在超过2000次的往来交涉中,它逐步调整了与同一批供应商的谈判方式,持续压低了进货价格。能否根据以往的交互重新组织策略,看来正是长周期任务拉开差距的地方。
基准测试中的强项与短板泾渭分明
从公开成绩看,强弱分布相当清晰。Terminal-Bench 2.1取得86.6,超过Claude Fable 5和Claude Opus 4.8的84.6,但未达到GPT-5.6 Sol的88.8。衡量论文复现能力的PaperBench为93.0,指令遵循的IFBench为82.8,两项均高于Claude Fable 5。
反过来,SWE-bench Pro为67.7、FrontierSWE为73.5,均不及Claude Fable 5;Humanity's Last Exam停在43.6,Toolathlon Verified为72.5。修改既有代码和复杂的工具调用仍是差距所在。与上一代相比,DeepSWE 1.1从21.6升到56.6,JobBench从31.3升到53.4。图像与文档处理方面,RealWorldQA为88.0,MMMU-Pro为82.3,OmniDocBench 1.5为92.1。
Qwen团队表示,通过同时扩大强化学习环境与算力规模,内部与公开基准的分数取得了持续而一致的提升[1]。
价格,以及下周的权重公开
Qwen3.8-Max可通过Qwen Chat和阿里云Model Studio等渠道使用。API价格为输入每100万token 2美元(约310日元)、输出每100万token 6美元(约940日元)、已缓存输入每100万token 0.25美元(约40日元)。模型支持函数调用、结构化输出、批处理、前缀续写和微调,通过Responses API还能使用代码执行、网页搜索、网页信息抽取、图像搜索等内置工具。
下周,Qwen3.8-Max本体以及270亿参数的「Qwen3.8-27B」权重预计将一并公开。自行部署2.4万亿参数的模型需要数据中心级环境,而270亿参数版在普通GPU环境中就比较现实。加上Moonshot AI刚刚公开了2.8万亿参数的「Kimi K3」,以开放权重形式推出前沿级模型的竞争短期内还会继续。
※1美元=157日元,1元=23日元(截至2026年8月5日)
总结
Qwen3.8-Max是一款MoE架构的多模态模型,2.4万亿参数中激活950亿,可处理最多100万token的上下文。16天无人值守开发、耗时125小时的论文复现与改进、365天电商运营取得4.16倍回报,这些结果都被用来衡量持续完成工作的能力,而非单次响应的质量。基准测试显示它在修改既有代码和复杂工具调用上仍有课题,但下周的权重公开能否让这一级别的模型落到普通用户手中,才是接下来的看点。
参考链接
- [1] Qwen 官方博客:Qwen3.8-Max https://qwen.ai/blog?id=qwen3.8
- [2] QwenCloud 模型页面:Qwen3.8-Max https://www.qwencloud.com/models/qwen3.8-max
