9月10日,深度求索正式发布 DeepSeek V4.1 Flash,并在网页端、App 和 API 同步上线。官方称,这是其全新模型结构系列中的最小尺寸模型,原生支持多模态视觉理解;据官方转述多方测试,该模型在性能、费用、速度、总用时等指标上已全面超过前代旗舰 DeepSeek V4 Pro。官方先表示计划有序下线 V4 Pro,后又宣布继续提供 V4 Pro 的 API 服务。对用户而言,更值得关注的是:一个更小的模型,是否真的接住了旗舰的定位,以及价格、缓存和生态接入带来哪些实际变化。
V4.1 Flash 是一个 552B 参数的 MoE(混合专家)模型,采用全新的 Causal-Encoder-Decoder 结构。与通常对称的模型不同,其输入侧激活约 8B 参数,输出侧激活约 16B 参数。官方称,这使其在保持大模型容量的同时,降低了实际推理成本。DeepSeek 还表示,模型采用了新的预训练方式,并经过更大规模的强化学习后训练。上述参数和结构已在官方公告中披露;更完整的基准分项和技术细节,以随权重一同发布的技术报告为准。
官方 API 更新日志披露了一组基准分数:GPQA Diamond 90.9,Humanity’s Last Exam 36.8(纯文本子集39.1),Codeforces Rating 3471,DeepSWE v1.1 74.2,CyberGym 88.1,Automation-Bench 54.8,以及 Terminal-Bench 3.0 30.0。官方据此说“经多方测试”全面超越 V4 Pro,但公告没有同时给出 V4 Pro 的逐项对比表,因此这一结论更像是官方对测试结果的定性归纳,而不是可供逐项核验的同榜数据。
已有第三方或媒体整理的对照更接近局部结果。腾讯新闻的一篇分析引用官方图表后提出,V4.1 Flash 在软件工程、网络安全和自动化任务的部分基准上较强,但并非全面占优:例如 Terminal-Bench 3.0 的 30.0 分,低于 Claude Opus 5 的 43.3 分和 GPT-5.6 Sol 的 34.4 分;在 GPQA Diamond、ProgramBench 等项目上,也与顶级闭源模型存在差距。这说明“全面超越 V4 Pro”与“所有指标都达到最强”不是同一件事。
在资源占用上,官方英文公告明确表示,与上一代相比,V4.1 Flash 的 KV Cache 所需资源为:HBM 需求降至 1/4,SSD 存储需求降至 1/8。部分中文资料将此转述为“KV Cache 压缩到八分之一”,不够准确。准确的表述是:对上一代的 HBM 需求为四分之一,SSD 需求为八分之一。百度百科等第三方词条还提到,相比初代模型,KV Cache 已缩小约 437 倍;该数字未被官方公告直接确认。这类缓存压缩可显著降低长上下文和 Agent 类任务的缓存成本。
与新模型同步,DeepSeek 于 9月10日12时起执行新的 API 定价,并继续采用峰谷定价,空闲时段价格为高峰时段的一半。据上海证券报报道的官方价格,中文计价下,每百万 Token 输入缓存未命中在空闲时段为 1 元、高峰为 2 元;输出在空闲时段为 4 元、高峰为 8 元;输入缓存命中在空闲时段为 0.02 元、高峰为 0.04 元。该报道还称,此前高峰时段每百万输出 Token,V4 Flash 收费 9 元、V4 Pro 收费 27 元,新的高峰时段输出价格降至 8 元。也有第三方根据 DeepSeek 英文价格页计算,美元计价下空闲时段输入未命中约 0.15 美元、输出约 0.6 美元。价格下降主要在缓存命中和空闲时段体现,而缓存能否命中,取决于提示词是否稳定复用。
在生态接入方面,官方公告列出的是合作伙伴及产品:腾讯 WorkBuddy、CodeBuddy 和 OpenCode 现已全量接入 V4.1 Flash。另有报道提到,腾讯云 TokenHub、ima、Marvis、CodeBuddy 等同步接入,但这部分范围在官方公告中并未逐项列出,不宜概括为“腾讯全量接入”。可以确认的是,这批接入集中于腾讯云和 AI 编码、智能体类产品,不是对腾讯全线产品的统一切换。
关于流传的“性能超过 Kimi K3 等主流模型”,现有公开材料尚不能支撑这一总体判断。Medium 的一篇对比文章称,V4.1 Flash 尚未被独立评分;Kimi K3 在 BrowseComp、DeepSearchQA 等长周期研究类任务上仍处于领先,而 V4.1 Flash 在 AutomationBench 等自动化任务上领先。OrcaRouter 的对比侧重于价格、速度和部分任务成本,估算 DeepSeek V4.1 Flash 的每 Token 成本远低于 Kimi K3,但没有给出完整性能同榜;LLM Stats 的共享基准中,V4.1 Flash 在 5 项中占优,Kimi K3 在 3 项中占优,综合指数 Kimi K3 略高。因此,目前只能说 V4.1 Flash 在部分基准和价格上显示优势,不宜得出“已全面超过 Kimi K3”的结论。
另一个需要注意的变化是 V4 Pro 的安排。官方公告称计划在 9月14日12时后将 V4 Pro 的请求路由至 V4.1 Flash;但同日的 API 更新日志又称,决定在 9月14日后继续提供 V4 Pro 的 API 调用服务,计费方式保持不变。这意味着官方对 V4 Pro 的下线安排或在发布后有所调整,用户是否仍能主动选择 V4 Pro,需要以 API 控制台或后续通知为准。
总体而言,V4.1 Flash 的发布事实清楚:它是一款更小、资源占用更低、定价下调并已接入主要开发工具的新模型;官方关于“全面超越 V4 Pro”的说法有其基准依据,但以官方自报和未公开的对比表为限。至于与 Kimi K3 等外部旗舰的横向比较,目前只有局部第三方数据,尚不能代替独立评测结论。
本文来自大风号,仅代表大风号自媒体观点。