7月31日,DeepSeek通过API文档发布日志,正式宣布DeepSeek-V4-Flash正式版API上线公测。官方同步公布了9项基准测试的完整成绩。
核心Agent基准测试成绩如下:
| 基准测试 | 得分 | 说明 |
|---|---|---|
| Terminal Bench 2.1 | 82.7 | 终端操作与命令行任务执行 |
| Cybergym | 76.7 | 网络安全攻防模拟 |
| Toolathlon verified | 70.3 | 工具调用综合测试 |
| DSBench-FullStack | 68.7 | 内部全栈开发测试 |
| DSBench-Hard | 59.6 | 内部Coding Agent难题测试 |
| NL2Repo | 54.2 | 代码仓库理解与生成 |
| DeepSWE | 54.4 | 软件工程任务 |
| Agent Last Exam | 25.2 | Agent综合能力测评 |
| Automation Bench Public | 25.1 | 自动化测试 |
关键看点:Flash跑分碾压自家Pro预览版。 V4-Flash正式版在Terminal Bench 2.1上拿下82.7分,而三个月前发布的V4-Pro预览版在Terminal Bench 2.0上仅得67.9分。虽然两个版本测试集不完全相同,但一个激活参数仅130亿的轻量模型,在Agent能力上逼近甚至超越了激活参数490亿的Pro预览版。
模型底座未变,仅重新后训练。 DeepSeek官方在更新日志中明确表示,“DeepSeek-V4-Flash-0731的模型结构、尺寸与预览版保持一致,仅重新进行了后训练”。这恰恰说明,在Agent能力这条赛道上,后训练策略的优化空间可能比单纯堆参数更具杠杆效应。
工程适配同步升级。 正式版V4-Flash原生支持Responses API格式,并针对性适配了Codex,开发者可直接将其接入VS Code、Codex CLI或ChatGPT桌面端。
本次升级仅限V4-Flash API,DeepSeek-V4-Pro API及App/Web端模型暂未更改,V4-Pro正式版将尽快发布。
