2026年7月31日,DeepSeek悄然在API更新日志中宣布DeepSeek-V4-Flash-0731正式版上线公测。没有发布会,没有直播,但这个"廉价版"模型却在Agent能力上碾压了三个月前的V4-Pro预览版,社区评测大爆发。本文从8个维度全面评测DeepSeek V4 Flash正式版。
DeepSeek V4 Flash正式版采用MoE架构,总参数量2840亿,激活参数仅130亿,支持100万token上下文,可切换思考/非思考模式。与4月24日发布的预览版相比,架构和尺寸完全一致,仅重新进行了后训练。开发者无需改代码,继续用deepseek-v4-flash模型名调用即可自动切换。
| 维度 | 评分 | 说明 |
|---|---|---|
| Agent能力 | 9.0 | DeepSWE从7.3飙升至54.4,暴涨6倍+,接近Opus 4.8 |
| 编程能力 | 8.5 | Terminal Bench 2.1得分82.7,超过GLM-5.2的81.0 |
| 推理能力 | 8.0 | Artificial Analysis智能指数50分,比预览版高10分 |
| 中文理解 | 9.0 | 国产模型中文语境理解能力领先 |
| 性价比 | 10.0 | 缓存命中0.2元/百万tokens,Claude的1/90 |
| 上下文 | 9.0 | 100万token上下文,长文档处理无忧 |
| 生态兼容 | 7.5 | 仅限API,App/网页端/V4-Pro API未变化 |
| 工具调用 | 8.5 | Toolathlon Verified 70.3,工具调用综合能力强 |
最大亮点是DeepSWE(评估AI Agent在真实、长周期、多步骤编程任务中的自主解决能力)从预览版的7.3分飙升至54.4分,暴涨超过6倍。在Terminal Bench 2.1(评估AI Agent在Linux终端环境中自主规划、执行多步命令行任务及错误恢复能力)中,Flash正式版得分82.7,高于V4-Pro-Preview的72.1和GLM-5.2的81.0,逼近Opus-4.8的85.0。
| 评测项目 | V4 Flash正式版 | V4 Pro预览版 | 提升幅度 |
|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 72.1 | +10.6 |
| Cybergym | 76.7 | - | 新上榜 |
| Toolathlon Verified | 70.3 | - | 新上榜 |
| NL2Repo | 54.2 | - | 新上榜 |
| DeepSWE | 54.4 | 7.3 | +47.1(6.5倍) |
| DSBench-FullStack | 68.7 | - | 新上榜 |
| DSBench-Hard | 59.6 | - | 新上榜 |
| Agent Last Exam | 25.2 | 15.8 | +9.4 |
DeepSeek V4 Flash正式版的价格极具冲击力:
对比Claude Fable 5(输入$3/百万tokens、输出$15/百万tokens),V4 Flash的成本仅为Claude的约1/90。开发者实测:V4 Flash+Hermes完成一个任务约40秒,花费不到0.01元;GPT-5.6 Sol+Codex完成同一任务1分47秒,花费约0.03元。虽然Codex输出质量更高,但V4 Flash的交付已达可用水平。
在Artificial Analysis Intelligence Index中,V4 Flash-0731(最高推理档位)拿下50分,比4月发布的V4 Flash预览版高10分,比V4 Pro预览版高6分。虽然与GPT-5.6 Luna(51分)还有1分差距,但考虑到成本差距(V4 Flash每次测试平均3美分 vs Claude Fable 5的$3.15),性价比极高。
在OpenRouter全球调用量榜单中,DeepSeek V4系列持续位居前列,中国大模型包揽全球调用量前六,DeepSeek是核心贡献者。
开发者孙涛(8月1日)反馈:"在国内模型里,它比GLM 5.2会好一些,但是比GPT 5.6其实还差一些。"这一定位非常清晰:V4 Flash不是要挑战顶级闭源模型,而是以极低价格提供接近顶级的能力。
社区评测中,"鹈鹕骑自行车"SVG测试成为社区新基准,V4 Flash在生成复杂SVG图形方面表现稳定。HuggingFace上线167GB开源权重,有人在一加13手机上跑满血版,进一步验证了MoE架构的灵活性。
| 模型 | 智能指数 | 每次测试成本 | Agent能力 |
|---|---|---|---|
| DeepSeek V4 Flash 0731 | 50 | $0.03 | DeepSWE 54.4 |
| GPT-5.6 Luna | 51 | 较高 | - |
| Claude Fable 5 | 66+ | $3.15 | - |
| Kimi K3 | 57 | $0.86 | - |
| GLM-5.2 | 51 | - | Terminal Bench 81.0 |
DeepSeek V4 Flash正式版以8.2/10的综合评分,证明了"廉价版"也能打硬仗。130亿激活参数、0.2元/百万tokens的缓存价格、Agent能力暴涨6倍——这三个数字让它成为2026年下半年最值得开发者关注的模型。如果你是API开发者,V4 Flash正式版是目前性价比最高的选择,没有之一。
想对比更多模型?查看我们的AI模型实时排行榜,或阅读Qwen3.8-Max深度解析。也推荐了解Seedance 2.5评测和MiniMax H3评测。