DeepSeek V4 Flash正式版深度评测:130亿激活参数的Agent性能之王

2026-08-05 | AI Tools Hub
8.2 / 10
AI Tools Hub 综合评分

2026年7月31日,DeepSeek悄然在API更新日志中宣布DeepSeek-V4-Flash-0731正式版上线公测。没有发布会,没有直播,但这个"廉价版"模型却在Agent能力上碾压了三个月前的V4-Pro预览版,社区评测大爆发。本文从8个维度全面评测DeepSeek V4 Flash正式版。

一、模型概况

DeepSeek V4 Flash正式版采用MoE架构,总参数量2840亿,激活参数仅130亿,支持100万token上下文,可切换思考/非思考模式。与4月24日发布的预览版相比,架构和尺寸完全一致,仅重新进行了后训练。开发者无需改代码,继续用deepseek-v4-flash模型名调用即可自动切换。

二、8维度评分

维度评分说明
Agent能力9.0DeepSWE从7.3飙升至54.4,暴涨6倍+,接近Opus 4.8
编程能力8.5Terminal Bench 2.1得分82.7,超过GLM-5.2的81.0
推理能力8.0Artificial Analysis智能指数50分,比预览版高10分
中文理解9.0国产模型中文语境理解能力领先
性价比10.0缓存命中0.2元/百万tokens,Claude的1/90
上下文9.0100万token上下文,长文档处理无忧
生态兼容7.5仅限API,App/网页端/V4-Pro API未变化
工具调用8.5Toolathlon Verified 70.3,工具调用综合能力强

三、核心亮点:Agent能力暴涨

最大亮点是DeepSWE(评估AI Agent在真实、长周期、多步骤编程任务中的自主解决能力)从预览版的7.3分飙升至54.4分,暴涨超过6倍。在Terminal Bench 2.1(评估AI Agent在Linux终端环境中自主规划、执行多步命令行任务及错误恢复能力)中,Flash正式版得分82.7,高于V4-Pro-Preview的72.1和GLM-5.2的81.0,逼近Opus-4.8的85.0。

评测项目V4 Flash正式版V4 Pro预览版提升幅度
Terminal Bench 2.182.772.1+10.6
Cybergym76.7-新上榜
Toolathlon Verified70.3-新上榜
NL2Repo54.2-新上榜
DeepSWE54.47.3+47.1(6.5倍)
DSBench-FullStack68.7-新上榜
DSBench-Hard59.6-新上榜
Agent Last Exam25.215.8+9.4

四、性价比分析:Claude的1/90

DeepSeek V4 Flash正式版的价格极具冲击力:

对比Claude Fable 5(输入$3/百万tokens、输出$15/百万tokens),V4 Flash的成本仅为Claude的约1/90。开发者实测:V4 Flash+Hermes完成一个任务约40秒,花费不到0.01元;GPT-5.6 Sol+Codex完成同一任务1分47秒,花费约0.03元。虽然Codex输出质量更高,但V4 Flash的交付已达可用水平。

五、Artificial Analysis智能指数表现

在Artificial Analysis Intelligence Index中,V4 Flash-0731(最高推理档位)拿下50分,比4月发布的V4 Flash预览版高10分,比V4 Pro预览版高6分。虽然与GPT-5.6 Luna(51分)还有1分差距,但考虑到成本差距(V4 Flash每次测试平均3美分 vs Claude Fable 5的$3.15),性价比极高。

在OpenRouter全球调用量榜单中,DeepSeek V4系列持续位居前列,中国大模型包揽全球调用量前六,DeepSeek是核心贡献者。

六、开发者实测反馈

开发者孙涛(8月1日)反馈:"在国内模型里,它比GLM 5.2会好一些,但是比GPT 5.6其实还差一些。"这一定位非常清晰:V4 Flash不是要挑战顶级闭源模型,而是以极低价格提供接近顶级的能力。

社区评测中,"鹈鹕骑自行车"SVG测试成为社区新基准,V4 Flash在生成复杂SVG图形方面表现稳定。HuggingFace上线167GB开源权重,有人在一加13手机上跑满血版,进一步验证了MoE架构的灵活性。

七、不足与局限

  1. 仅限API:App、网页端、V4-Pro API均未变化,普通用户体验和昨天一模一样
  2. V4-Pro正式版仍未上线:官方表示"尽快发布",预计8月初
  3. 复杂任务质量仍逊于顶级模型:开发者反馈在复杂场景下输出质量不如GPT-5.6
  4. App端体验未升级:普通用户无法感知这次升级

八、竞品对比

模型智能指数每次测试成本Agent能力
DeepSeek V4 Flash 073150$0.03DeepSWE 54.4
GPT-5.6 Luna51较高-
Claude Fable 566+$3.15-
Kimi K357$0.86-
GLM-5.251-Terminal Bench 81.0

总结

DeepSeek V4 Flash正式版以8.2/10的综合评分,证明了"廉价版"也能打硬仗。130亿激活参数、0.2元/百万tokens的缓存价格、Agent能力暴涨6倍——这三个数字让它成为2026年下半年最值得开发者关注的模型。如果你是API开发者,V4 Flash正式版是目前性价比最高的选择,没有之一。

想对比更多模型?查看我们的AI模型实时排行榜,或阅读Qwen3.8-Max深度解析。也推荐了解Seedance 2.5评测MiniMax H3评测