DeepSeek-V4-Flash正式版跑分出炉:轻量模型干翻自家旗舰预览版

7月31日,DeepSeek通过API文档发布日志,正式宣布DeepSeek-V4-Flash正式版API上线公测。官方同步公布了9项基准测试的完整成绩

核心Agent基准测试成绩如下

基准测试 得分 说明
Terminal Bench 2.1 82.7 终端操作与命令行任务执行
Cybergym 76.7 网络安全攻防模拟
Toolathlon verified 70.3 工具调用综合测试
DSBench-FullStack 68.7 内部全栈开发测试
DSBench-Hard 59.6 内部Coding Agent难题测试
NL2Repo 54.2 代码仓库理解与生成
DeepSWE 54.4 软件工程任务
Agent Last Exam 25.2 Agent综合能力测评
Automation Bench Public 25.1 自动化测试

关键看点:Flash跑分碾压自家Pro预览版。 V4-Flash正式版在Terminal Bench 2.1上拿下82.7分,而三个月前发布的V4-Pro预览版在Terminal Bench 2.0上仅得67.9分。虽然两个版本测试集不完全相同,但一个激活参数仅130亿的轻量模型,在Agent能力上逼近甚至超越了激活参数490亿的Pro预览版

模型底座未变,仅重新后训练。 DeepSeek官方在更新日志中明确表示,“DeepSeek-V4-Flash-0731的模型结构、尺寸与预览版保持一致,仅重新进行了后训练。这恰恰说明,在Agent能力这条赛道上,后训练策略的优化空间可能比单纯堆参数更具杠杆效应

工程适配同步升级。 正式版V4-Flash原生支持Responses API格式,并针对性适配了Codex,开发者可直接将其接入VS Code、Codex CLI或ChatGPT桌面端

本次升级仅限V4-Flash API,DeepSeek-V4-Pro API及App/Web端模型暂未更改,V4-Pro正式版将尽快发布

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧