DeepSeek 发布了轻量级大语言模型 DeepSeek-V4-Flash-0731,将其从预览版升级为正式版。模型总参数 284B、推理时激活 13B、上下文长度 100 万 token 的结构保持不变,改动只发生在后训练阶段。即便如此,智能体相关基准测试的成绩已经超过更大规模的 V4-Pro 预览版。权重以 MIT 许可证开放。

※1 美元 = 157 日元(截至 2026 年 8 月 1 日)

架构未动,重做的是后训练

这次更新首先要注意的是模型骨架没有改动。DeepSeek 在模型卡中明确写道,架构与规模同预览版一致,性能提升来自重新进行的后训练,而不是新的设计。

V4-Flash 是一个总参数 284B 的 MoE(混合专家)模型,每个 token 只激活 13B。每个 MoE 层包含 1 个共享专家和 256 个路由专家,中间维度为 2048,每个 token 触发 6 个路由专家。前 3 个 MoE 层则采用哈希路由。

注意力机制为混合结构,结合了压缩稀疏注意力(CSA)与高压缩注意力(HCA)。常规残差连接被流形约束超连接(mHC)取代,扩展系数为 4,Sinkhorn-Knopp 迭代 20 次。预训练使用超过 32 万亿 token,优化器为 Muon。

另外,Hugging Face 上的仓库显示参数量为 304B。这是因为在 284B 基座之上还附带了投机解码草稿模块 DSpark,模型本体并没有变大。

智能体指标反超更高一级模型的预览版

提升最明显的是编程与智能体领域。在评估终端操作的 Terminal Bench 2.1 上,成绩从预览版的 61.8 跃升至 82.7。更高一级的 V4-Pro 预览版为 72.1,也就是说轻量版反超了大模型。

面向软件开发任务的 DeepSWE 变化更大,从 7.3 提升到 54.4,改善超过 7 倍。此外 DeepSeek 还给出了内部测试集 DSBench-FullStack 68.7、DSBench-Hard 59.6 的数据。

第三方评价也在上行。基准汇总网站 Artificial Analysis 将 V4-Flash-0731 的 Intelligence Index 定为 50,比此前的 V4-Flash 高出 10 分。

不过直接照单全收公布的数值并不稳妥。DeepSeek 自己注明,代码智能体类任务是在其 DeepSeek Harness 的最小模式下运行的,而该 harness 尚未公开。智能体评测结果会随 harness 的实现而变动,最好按照要在自己环境中重新测量的前提来看待。

输出单价约为高阶模型的三分之一

API 价格维持不变,性价比相当突出。deepseek-v4-flash 的输入在缓存未命中时为每 100 万 token 0.14 美元(约 22 日元),缓存命中时为 0.0028 美元(约 0.4 日元);输出为每 100 万 token 0.28 美元(约 44 日元)。并发上限设为 2,500。

作为对照,高阶的 deepseek-v4-pro 输出为每 100 万 token 0.87 美元(约 137 日元)。V4-Flash 的输出单价约为其三分之一。智能体循环会大量消耗输出 token,这一差距会直接体现在运行成本上。对于没有 GPU 预算的独立开发者和企业内部平台团队来说,这是一个可以放开手脚跑智能体的价位。

在接口层面,deepseek-v4-flash 已原生支持 Responses API 格式,并完成了对 Codex 的适配。而 V4-Pro 的 API 以及 App 版和网页版模型这次没有更新。

自建部署需要 100GB 以上内存

权重采用 MIT 许可证且无需申请权限,商用私有化部署的条件已经具备。但硬件门槛完全是另一回事。

虽然每个 token 只激活 13B,256 个专家却全部常驻内存。vLLM 给出的推荐配置是在搭载 4 张 GB300 的单节点上提供服务。如果走量化路线,Unsloth 的动态 GGUF 中无损 8 位版为 162GB、3 位版为 103GB,需要 RAM 与显存合计约 110GB。

因此自建部署现实可行的对象,只有拥有推理集群的中大型企业,或者能准备一台高配工作站并接受激进量化的场景。这不是可以在笔记本电脑上随手跑起来的模型。

落地前值得先了解的细节

接入时容易卡住的地方也有几处。首先,这个模型没有 Jinja 格式的对话模板。DeepSeek 改为附带 encoding/ 文件夹,提供 encode_messages 和 parse_message_from_completion_text 两个函数。依赖模板的既有代码需要改写。

推理深度通过 reasoning_effort 控制,可选 low、high、max 三档。在 high 与 max 下,输出最长可达 384K token。采样方面官方建议智能体用途使用温度 1.0、top_p 0.95,其他场景两者均为 1.0。

启用随附的 DSpark 只需在 vLLM 端传入 1 个参数。

--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'

DSpark 论文称,在总吞吐量相当的条件下,与 MTP-1 基线相比单用户生成速度快 60% 至 85%。这直接关系到使用者的体感速度,自建部署时值得一开始就打开。

总结

DeepSeek-V4-Flash-0731 没有改动设计,只重做了后训练,就把智能体与编程成绩大幅拉高。输出单价约为高阶版本的三分之一,权重也以 MIT 许可证开放。另一方面,公布的分数是厂商自己在未公开 harness 上测得的,自建部署还需要 100GB 以上内存。若考虑引入,不妨先用自己的任务跑一轮评测。

参考链接