DeepSeek-V4-Flash 正式版与预览版区别:模型未变,Agent 能力暴涨 6 倍
DeepSeek-V4-Flash 是深度求索于 2026 年 4 月 24 日发布的 V4 系列高性价比 MoE 大模型预览版。其正式版 API 于 2026 年 7 月 31 日 上线公测。
关于两者的核心区别,可以从三个层面来看:模型架构保持一致,仅重新进行了后训练;Agent(智能体)能力实现质的飞跃,多项基准测试反超 Pro 预览版;价格保持不变,性价比进一步提升。
📌 本文大纲
- 模型架构:骨架未变,后训练定胜负
- Agent 能力:9 项基准测试全面碾压 Pro 预览版
- 价格与可用性:价格不变,公测仅限 API
- 总结
一、模型架构:骨架未变,后训练定胜负
预览版与正式版在模型结构和参数规模上完全一致:
- 架构:MoE(混合专家)架构
- 总参数量:2840 亿(284B)
- 激活参数量:130 亿(13B)
- 上下文窗口:最长 100 万 token
正式版唯一的变动是 “重新进行了后训练” 。同样的模型 “骨架”,经过更精细的后训练策略调优,就在基准测试中产生了质的飞跃——这说明 “后训练” 阶段的优化空间可能比单纯堆参数更具杠杆效应。
二、Agent 能力:9 项基准测试全面碾压 Pro 预览版
这是正式版最核心的升级。DeepSeek-V4-Flash 正式版的 Agent 能力在多项基准测试中,全面超越了三个月前发布的 V4-Pro 预览版。
官方公布的 9 项 Agent 基准测试成绩如下:
| 基准测试 | 评测内容 | V4-Flash 正式版 |
|---|---|---|
| Terminal Bench 2.1 | Linux 终端自主规划与命令行执行 | 82.7 |
| NL2Repo | 自然语言转代码仓库 | 54.2 |
| Cybergym | 网络安全攻防模拟 | 76.7 |
| DeepSWE | 真实长周期多步骤编程任务 | 54.4(预览版仅 7.3) |
| Toolathlon verified | 工具调用综合测试 | 70.3 |
| Agent Last Exam | Agent 综合能力 | 25.2 |
| Automation Bench (Public) | 自动化测试 | 25.1 |
| DSBench-FullStack | 内部全栈开发测试 | 68.7 |
| DSBench-Hard | 内部 Coding Agent 难题测试 | 59.6 |
其中最引人注目的是 DeepSWE 从预览版的 7.3 分飙升至 54.4 分,暴涨超过 6 倍。在海外模型评测机构 Artificial Analysis 的智能指数测试中,V4-Flash 正式版(最高推理档位)拿下 50 分,而同类可比模型的中位数仅为 17 分。
这意味着 AI 不再只是 "能写代码",而是开始真正像工程师一样工作——打开终端、分析仓库、调用工具、完成端到端任务。
三、价格与可用性:价格不变,公测仅限 API
价格方面,正式版与预览版保持一致:
- 输入(缓存命中) :0.2 元 / 百万 tokens
- 输入(未命中缓存) :1 元 / 百万 tokens
- 输出:2 元 / 百万 tokens
这个价格大约只有 Claude Opus 4.8 的 1/90。有开发者反馈:"蹬了一小时才不到一块钱"。
可用性方面,有几点需要留意:
- 本次升级仅限 API 接口,App 和网页端暂无法体验最新能力
- V4-Pro 正式版 “将尽快发布”
- 正式版 V4-Flash 原生支持 Responses API 格式,并针对性适配了 Codex
- 调用方式不变:将模型名称设置为
deepseek-v4-flash即可使用最新版本
四、总结
DeepSeek-V4-Flash 正式版与预览版的区别,不在模型架构,而在 “后训练” 带来的能力跃升。同一个 “骨架”,经过更精细的后训练调优,就在 Agent 能力上实现了对自家 Pro 预览版的全面反超。价格不变,Agent 能力却暴涨 6 倍——这才是这次升级最值得关注的地方。
💡 如果你正在寻找能将大模型能力转化为实际业务生产力的工具,可以了解 实在Agent。它通过 “TARS 大模型 + ISSUT 屏幕语义理解 + Computer-use(RPA 引擎)” 的全栈架构,有 API 优先走 API,API 走不通就用 Computer-use 兜底,将 AI 的理解转化为跨系统执行力。已服务超 6000 家制造、能源、交通航空、跨境、医药、电商等行业企业。访问实在智能官网(www.ai-indeed.com)即可了解更多。



