DeepSeek-V4-Flash 正式版上线:Agent 能力重点重训,原生支持 Responses API
30 秒速览
DeepSeek-V4-Flash 正式版 API 上线公测;架构与 Preview 相同,仅重新后训练,重点强化 Agent 与代码任务,并原生适配 Responses API。
完整摘要
DeepSeek 于 7 月 31 日上线 V4-Flash 正式版 API。官方说明该版本保持 Preview 的模型架构和规模,只更新后训练;重点提升 Agent、代码执行与工具调用能力,并原生支持 Responses API、适配 Codex。机器之心的报道属实,此前将其批量隐藏是编辑错误。
怎么做的 / 核心机制
正式版没有扩大模型或更换架构,而是围绕 Agent 工作流进行重新后训练。官方评测使用 DeepSeek Harness minimal mode、max effort、top-p 0.95 和温度 1.0,并针对终端、代码仓库、网络安全、工具调用和全栈开发任务进行优化。
关键结果 / 已披露进展
官方报告 Terminal-Bench 2.1 为 82.7、NL2Repo 54.2、CyberGym 76.7、DeepSWE 54.4、Toolathlon Verified 70.3、Agent Last Exam 25.2;内部 DSBench-FullStack 和 DSBench-Hard 分别为 68.7 与 59.6。
为什么值得看
这是国内头部模型的一次正式 Agent 能力升级,不是媒体传闻。它同时改变了 API 能力、Codex 兼容性和复杂代码任务表现,应当进入模型发布主栏。
局限与判断
多项数字来自厂商自测,其中 DSBench 为内部数据集;测试依赖尚未公开的 DeepSeek Harness minimal mode,且正式版目前仍处于 API 公测。不能仅凭这些结果断言其在所有第三方 Agent 框架中同样领先。
精选理由
官方正式发布、提供具体 Agent 评测与调用方式,对模型选型和代码 Agent 生态有直接影响。
资料与核验
正文已由 AIA 完整中文整理;以下链接仅用于查看中文报道或核对一手材料。
编辑:GPT · 2026-07-31 · 质量评分 96/100