DeepSeek 于 9 月 8 日面向开发者限时开放了 DeepSeek V4.1 Flash 的中间版本。这是 V4 系列自 4 月推出以来最大的结构调整,核心在于把图像和语音的处理并入模型本体,而不再依赖外挂的扩展包。官方并未将其定位为正式发布,开放窗口在 9 月 10 日关闭。
从扩展包走向模型内部
这并不是 DeepSeek 第一次涉足多模态。8 月 21 日,在文本模型上叠加视觉扩展包的 V4-Flash-Vision-Exp 就已经上线 API,主要面向描述图片、识别截图中的文字、分析图表这类用途。
V4.1 Flash 改变的是搭建方式本身。视觉能力不再事后接入,而是把多模态处理写进模型结构,让文本、图像、语音输入在同一层面被处理。DeepSeek 表示,这个中间版本能力更强、生成更快、成本更低。
发布场合同样说明了性质。消息通过官方交流群发出,而不是社交账号,这更像是为下一代正式模型做的铺垫,而非产品发布。
调用只需改一个模型名
尝试的门槛被压得很低。已经在用 API 的开发者无需改动 base_url,只要替换模型名即可调用。
model = "deepseek-v4.1-flash-expires-on-0910"
无需申请内测资格,计费也与现有的 deepseek-v4-flash 保持一致。限制在于每个账号最多 20 并发,这个额度不足以承载正式业务流量。
模型名末尾的日期就是期限,该版本会在 9 月 10 日自动下线。官方尚未公布技术规格、跑分数据和单独定价,因此可参考的依据只有实际调用后的体感。
速度数据由第三方先行给出
在官方没有给出数字的情况下,开发者社区先一步分享了实测结果。已披露的数值包括首个 token 返回约 178 毫秒、持续生成约每秒 355 token,峰值超过每秒 365 token。有测试显示,生成 1,500 token 规模的代码用时 4.40 秒,内置的思考阶段约 1.1 秒完成。
同一组测试中,上位的 V4 Pro 为每秒 63 token、首 token 耗时 766 毫秒,差距相当明显。也有用户报告每秒 300 到 600 token 的区间,但有观点认为这可能是为内测单独部署环境的速度。这些都不是 DeepSeek 认可的官方数据,正式版能否达到同样水平目前还无法判断。
真正被追问的是「Flash 能否替代 Pro」
这次开放中最值得注意的,是 DeepSeek 同时发放的问卷内容:中间版本的 V4.1 Flash 能否全面替换线上运行的 V4 Pro。
Flash 一直是优先速度与价格的下位档位,Pro 则是优先能力的上位档位。如今官方自己来验证下位档位能否承担上位档位的工作。如果成立,开发者的选型逻辑就会从「要快选 Flash、要准选 Pro」转向「先试试 Flash 够不够」。在智能体连续执行、代码批量生成这类调用次数直接决定成本的场景中,这个差别尤其明显。
反过来看,20 并发的限制和仅约两天的开放期,本身就是为收集反馈而设的条件。DeepSeek 想测的并不是速度纪录,而是在 Flash 的价格区间里究竟能撑起多少实际业务。
总结
V4.1 Flash 是把原本外挂的多模态能力并入模型本体的中间版本,仅在 9 月 10 日前向开发者开放。接入只需替换模型名、计费保持不变,而 20 并发上限与短暂窗口则清楚表明,目的在于收集反馈而非投入生产。在官方跑分尚未公布之前,速度数据目前只宜当作参考值。真正的看点在于 DeepSeek 试图用 Flash 档位去拿下 Pro 的领域,答案要等到正式版发布才会揭晓。
