中国的 DeepSeek 于 2026 年 4 月 24 日以预览版形式发布了新款大语言模型「DeepSeek V4」。该模型总参数量为 1.6 万亿,采用只调用所需部分的混合专家(MoE)架构。DeepSeek 在以允许商用的 MIT 许可证开放权重的同时,把 API 价格压到了顶级闭源模型的约六分之一。上下文长度默认可达 100 万 token,目前已可通过 Hugging Face 和 DeepSeek 的 API 使用。这是继 V3 之后时隔 484 天推出的重磅模型,已有人称其为「第二次 DeepSeek 时刻」。
以效率取胜,前沿级性能落入更低价位
此次发布最先显现的影响是价格。较高端的 DeepSeek V4-Pro 通过 API 定价为:每 100 万输入 token 0.435 美元(约 71 日元),每 100 万输出 token 0.87 美元(约 143 日元)。若命中缓存,输入价格可降至 0.003625 美元(约 0.6 日元)。
轻量版 V4-Flash 更便宜,每 100 万输入 token 0.14 美元(约 23 日元),每 100 万输出 token 0.28 美元(约 46 日元)。按官方价目表比较,相对于顶级闭源模型 Gemini 3.1 Pro(20 万 token 以内的提示,每 100 万输入 token 2.00 美元、输出 12.00 美元),V4-Pro 的输入约为其五分之一、输出约为其十四分之一。具体差距取决于输入与输出的比例,但整体大致落在顶级档位的六分之一上下。这并不会让智能瞬间免费,但那些此前「因太贵而放弃自动化」的任务,确实有了更大的落地空间。
逼近顶级,但并非全面胜出
从基准成绩看,作为开放权重模型,V4 明显高出一头。在考察高难度信息检索的 BrowseComp 上,V4-Pro 取得 83.4%,逼近顶级闭源模型。在考察研究生级理科知识的 GPQA Diamond 上为 90.1%,在模拟软件开发的 SWE-Bench Pro 上为 55.4%,在衡量工具协同的 MCP Atlas 上达到 73.6%。
不过,在多数可直接比较的指标上,美国厂商最新的顶级模型仍处于领先。DeepSeek V4 的价值,与其说是「拿下所有第一」,不如说在于「已逼近前沿,却大幅便宜,而且权重公开」。评测公司 Vals AI 在其自有的编程评测中,把 V4 列为「开放权重模型第一名,而且优势并不小」。
支撑 100 万 token 的新机制
V4 的技术亮点,是让默认 100 万 token 的长上下文能够以现实的成本运行。DeepSeek 采用了一种混合式注意力:把压缩输入维度的 Compressed Sparse Attention(CSA)与强力压缩长程依赖内存占用的 Heavily Compressed Attention(HCA)结合起来。其结果是,即便在 100 万 token 下运行,V4-Pro 相比上一代 V3.2 也只需使用 10% 的 KV 缓存和 27% 的单 token 推理算力。
为了稳定训练 1.6 万亿参数,DeepSeek 用一种名为 Manifold-Constrained Hyper-Connections(mHC)的连接方式取代了常规残差连接,目的是加粗跨层的信号流动,同时避免训练中途崩溃。训练使用了 Muon 优化器,并在超过 32 万亿 token 的高质量数据上完成预训练。得益于 MoE 架构,1.6 万亿参数中每次实际参与计算的只有 490 亿个,从而压低了算力需求。推理提供三挡可切换模式:快速作答的「Non-think」、进行逻辑推演的「Think High」,以及把推理推到极限的「Think Max」。
兼顾摆脱英伟达依赖的开放式分发
与模型本身同样受关注的,是配套软件。DeepSeek 透露,它把用于把专家分散运行的 Expert Parallelism 机制,放在英伟达以外的华为 Ascend NPU 上做了验证。据称在非英伟达平台上实现了 1.50 至 1.73 倍的加速,勾勒出一条不易受西方 GPU 供应链和出口管制影响的部署路径。不过 DeepSeek 也表示,V4 本身的训练同时使用了正规授权的英伟达 GPU。
同时,DeepSeek 还开源了据称能把延迟敏感型任务最多加速 1.96 倍的 MegaMoE 内核。许可证是业界最宽松的 MIT,允许免费修改、再分发和商用。该模型与 Claude Code、OpenClaw、OpenCode 等面向开发者的智能体开箱即用地对接,便于嵌入现有工具链。
旧模型今日退役,100 万 token 成为标准
DeepSeek 也在加速淘汰旧世代。原有的 deepseek-chat 与 deepseek-reasoner 接口已于 2026 年 7 月 24 日 15:59(UTC)完全关闭,全部流量转由 V4-Flash 承接。这近乎是一份宣告:100 万 token 支持已成为全部服务的默认前提。
整体来看,这是一次在价格与开放两方面同时发力的主张——用架构上的巧思逼近前沿性能,而非一味堆算力。对那些靠闭源模型收取高额费用的厂商而言,仅凭性能已越来越难以解释其溢价。
*1 美元 = 164 日元(截至 2026 年 7 月 24 日)
参考:DeepSeek API Docs: Models & Pricing/DeepSeek-V4 Preview Release/Gemini Developer API pricing
总结
DeepSeek V4 是迄今最大规模的开放许可模型之一,以 MIT 许可证提供 1.6 万亿参数的 MoE 与 100 万 token 上下文。它在逼近顶级闭源模型的同时——例如在 BrowseComp 上取得 83.4%——把 API 单价压到了对方的约六分之一。从在华为 Ascend NPU 上的验证,到内核的开源,这都像是一步把主动权拉向「便宜且开放」一侧的棋。旧接口已于今日关闭,100 万 token 正成为新的标准。
