
DeepSeek V4 Pro 正式版通过大规模后训练大幅提升了 Agent 能力,在代码生成和工具调用上表现显著增强,但 thinking 模式可能消耗过多 token 导致输出截断。其定价低于多数竞品,性价比突出。
8 月 13 日凌晨,DeepSeek 悄然更新了 API 文档,模型指纹从预览版变为 fp_v4pro_20260812,宣告 V4 Pro 正式版(以下简称“V4 Pro”)的落地。没有发布会,没有预告,甚至更新日志都略显仓促,但这并不妨碍它成为近期 AI 圈最值得关注的事件之一。从 4 月 24 日预览版亮相到正式版上线,整整 111 天,期间 Kimi K3 高调发布、V4 Flash 正式版先行一步,所有人的目光都聚焦在 Pro 正式版何时到来。现在,答案揭晓:架构未变,但能力已非吴下阿蒙。
V4 Pro 的硬参数与预览版完全一致——1.6T 总参数、49B 激活参数的 MoE 架构,支持 1M 上下文和 384K 最大输出。真正的变化在于后训练,且幅度惊人。在 DeepSeek 自家的软件工程基准 DeepSWE 上,得分从预览版的 12.8 飙升至 62.7,涨幅接近 50 分;Cybergym 从 52.7 提升至 83.3,Terminal Bench 从 72.1 升至 87.9,DSBench-Hard 更是翻倍至 67.2。这些评测的共同点是它们都涉及长链路的代码修改、环境操作和工具调用——恰恰是预览版最薄弱的环节。
从 V4 Flash 正式版的更新日志可推断,这轮升级的核心就是面向代码 Agent 场景的大规模后训练。Flash 版已用相同方法将 Agent 能力提升至“基准测试远超 V4-Pro-Preview”的水平,Pro 版只是补上了同一课。价格方面,每百万 token 输入 3 元、输出 6 元,与预览版持平。尽管 DeepSeek 曾在 8 月 6 日预告“计划近期整体上调 API 定价,预计涨幅较大”,但 0813 版本尚未调整,窗口期能持续多久未知,开发者可把握当前成本优势。
跑分只是门票,真实任务才是试金石。个不同方向的测试,探究 V4 Pro 在“一次性生成完整可运行代码”上的实际水平。
任务一:Boids 群体涌现模拟。 要求在 Canvas 上实现 200 个三角形 boid 的群体行为,含分离/对齐/凝聚三个可调参数、彩色轨迹、点击生成捕食者和 glassmorphism 风格控制面板。V4 Pro 耗时约 170 秒,生成了 761 行完整 HTML,打开浏览器后,200 个彩色三角形在黑色背景上游动、聚散、避障,拖动滑块可实时改变行为模式,效果流畅,一次运行通过。
任务二:模糊需求的“产品化补全”。 用中文告知“我想要一个好看的番茄钟工作面板”,仅提供“能计时、能记录、有白噪音、中文界面、要有质感”方向,其余由模型自行决定。V4 Pro 生成了 1223 行代码,除基础计时功能外,还自主添加了任务标签、专注统计图表、快捷键支持,甚至用 Web Audio API 从零合成白噪音。对模糊需求的补全能力,确实比预览版有明显进步。
任务三:寻路算法可视化。 要求实现 BFS、DFS、A* 三种算法的逐步动画、可交互网格画墙和迷宫自动生成。此任务代码量最大,也最能暴露问题。开启默认 thinking 模式时,V4 Pro 使用 16384 个 token 的输出配额,其中 13394 个花在“思考”上,留给实际代码的不到 3000 token,导致 HTML 输出中途截断。关闭 thinking 模式重跑,54 秒便输出完整的 715 行代码,功能一应俱全。这不是 bug,而是 V4 Pro 的一个真实特征:在复杂代码生成场景下,thinking 模式的推理 token 可能占输出的 80% 以上,挤压了实际内容空间。对于需要大段代码输出的任务,开发者可能需要主动关闭 thinking,或大幅提高 max_tokens 来兜底。
V4 Pro 并非“全面碾压”的成绩单。HLE(不使用工具)得分 42.7,落后 Claude Opus 4.8(49.8)和 Fable 5(53.3);NL2Repo 以 61.5 低于 Opus 4.8 的 69.7;在部分测试上与 Kimi K3 也存在轻微差距。纯知识推理和最复杂的软件工程任务,V4 Pro 尚未登顶。但 DeepSeek 的竞争力从不依赖“最强”,而是遵循一条铁律:比我强的没我便宜,比我便宜的没我强。每百万 token 输入 3 元的价格,约为 Fable 5 的十分之一、Kimi K3 的三分之一。在 Agent 能力从“几乎不可用”跃升至“可与头部闭源模型正面对打”后,这一定律的杀伤力显著放大。
更值得关注的是 V4 Flash 正式版更新日志中的一行小字:评测使用了“DeepSeek Harness 极简模式(即将发布)”作为 Agent 框架。结合近期注册的“DeepSeek Harness 团队”公众号和招聘信息,DeepSeek 正计划将模型与 Agent 运行框架打包推出。如果说此前竞争停留在“谁的模型更聪明”,Harness 的出现则意味着竞争进入新阶段——不是比大脑,而是比谁能将大脑、手脚和工具箱组装成真正能替人干活的系统。V4 Pro 正式版补齐了大脑这一环,接下来就看“即将发布”何时落地。
在国内市场,DeepSeek 的动向并非孤例。文心一言、通义千问、Kimi 等也在加速 Agent 布局。例如,Kimi K3 的发布主打高调,强调其在长文本和复杂推理上的优势;智谱 GLM 系列则在多模态和 Agent 框架上持续迭代。相较于 DeepSeek 的“性价比+框架打包”策略,其他厂商更侧重生态整合或垂直场景优化。V4 Pro 的定价和 Agent 能力提升,可能迫使国内竞品在成本或功能上做出回应,推动整个行业向更实用的方向演进。
正式版在架构上与预览版一致,但通过大规模后训练大幅提升了 Agent 能力,尤其在代码生成、工具调用和长链路任务上表现显著增强。
每百万 token 输入 3 元、输出 6 元,与预览版持平,但 DeepSeek 已预告将上调 API 定价,当前价格窗口期可能有限。
在复杂代码生成场景下,thinking 模式可能消耗超过 80% 的输出 token 用于推理,导致实际代码输出被截断。开发者可关闭 thinking 或调高 max_tokens 来避免。
DeepSeek Harness 是 DeepSeek 计划推出的 Agent 运行框架,旨在将模型与工具调用、环境操作结合,实现更完整的自动化任务处理,目前处于“即将发布”状态。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

Omarchy 4.0 尝试将 AI 从应用层下沉到系统层,让自然语言成为人机交互的核心协议。文章分析了其技术理念、八位硅谷巨头的 800 万美元注资背后的战略意义,以及社区驱动的插件生态爆发,并对比了国内 AI 与操作系统融合的渐进式路径。

最新研究显示,过度依赖 AI 工具的学生在闭卷考试中成绩显著下滑。文章深入分析了 AI 使用与认知能力退化之间的关系,探讨了如何在效率与深度思考之间找到平衡。

本文深度解析8月20日科技圈热点:游戏科学《黑神话:钟馗》实机演示公布、宝马呼吁抵制行业浮躁、华为发布全球首款阔直板手机、周杰伦疑代言vivo、特斯拉Robotaxi数据修正及亚马逊无人机送货乌龙事件,并探讨其背后的行业趋势。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。