DeepSeek,V4系列迎重大升级
财联社 2026-08-02 20:23:48
DeepSeek-V4系列模型迎来重大升级。抢在7月最后一天(31日),DeepSeek-V4-Flash正式版上线。

根据官方消息,DeepSeek-V4-Flash正式版的模型架构、大小与预览版相同,即MoE(混合专家)架构、2840亿总参数、130亿激活参数、1M上下文,在此基础上,正式版仅重新进行了后训练,Agent能力便大幅增强,基准测试得分远超V4-Pro-Preview。

官方性能对比的是国产编程代表GLM-5.2及美国的Opus 4.8。DeepSeek-V4-Flash正式版的整体性能超过了GLM-5.2,逼近Opus 4.8。相比对标模型,V4 Flash只是个小参数模型,GLM-5.2总参数高达7440亿,激活参数为400亿,均远高于V4 Flash。

具体来看官方给出的9项Agent基准测试得分,在考察终端操作能力的Terminal Bench2.1上,DeepSeek-V4-Flash正式版的得分从61.8涨到了82.7;在代码仓库理解与修改任务NL2Repo、DeepSWE上,分别得分54.2和54.4,而其前身Flash Preview在DeepSWE项目上的得分仅为7.3。
另外,其指向网络安全任务的Cybergym得分为76.7,反映工具调用能力的Toolathlon-Verified达到70.3。
在更综合的智能体评测中,DeepSeek-V4-Flash正式版在Agent Last Exam和 Automation Bench Public上的得分分别为25.2和25.1,这两个项目都是2026年新推出、面向AI智能体的现实任务评测基准,用来检验大模型Agent能不能真正完成真实工作,区别于MMLU、Humanity's Last Exam这类纯问答测试。
在内部全栈开发测试DSBench-FullStack与高难度编码测试DSBench-Hard上,得分则达到68.7和59.6。多项指标远超今年4月上线的V4-Pro预览版。
新版本上线后,Artificial Analysis和Arena.ai两大AI评测平台同步更新了该模型的基准测试结果。
Artificial Analysis智能指数显示,DeepSeek-V4-Flash获得50分,比4月发布的Flash版本高出10分,仅比OpenAI的GPT-5.6 Luna(51分)低1分。该平台发文称,即使OpenAI将GPT-5.6 Luna的价格下调了80%,DeepSeek-V4-Flash正式版在其自有API上的单任务成本仍然比GPT-5.6 Luna低约60%。
Arena.ai的报告称,DeepSeek-V4-Flash正式版以1586分的成绩重塑了Frontend Code Arena跑分榜单。每MToken的价格为0.14美元/0.28美元,是同类产品中性价比最高的。
申万宏源证券最新研报称,DeepSeek-V4-Flash继续展现国产模型超高性价比;国联民生证券称,DeepSeek-V4-Flash轻量模型追平旗舰性能,利好AI应用产业链。
责任编辑:金雪
