Bingdada 技术博客Bingdada 技术博客
首页博客SEOGEOAEOAI工具关于
登录注册
Logo

Bingdada 技术博客

专注于SEO搜索引擎优化和GEO生成式引擎优化以及未来人工智能发展趋势的技术博客

快速链接

  • 首页
  • 博客文章
  • 关于我们

联系方式

  • 398848662@qq.com

订阅我们的 Newsletter,获取最新的 SEO 和 GEO 技术资讯。

© 2024 Bingdada 技术博客. All rights reserved.

首页博客国产 AI 前线DeepSeek V4 Pro 正式版实测:Agent 能力跃升,但有个坑要注意
DeepSeek V4 Pro 正式版实测:Agent 能力跃升,但有个坑要注意
国产 AI 前线

DeepSeek V4 Pro 正式版实测:Agent 能力跃升,但有个坑要注意

bingdadabingdada
八月 14, 202686 次阅读约 7 分钟阅读
快速回答

DeepSeek V4 Pro 正式版通过大规模后训练大幅提升了 Agent 能力,在代码生成和工具调用上表现显著增强,但 thinking 模式可能消耗过多 token 导致输出截断。其定价低于多数竞品,性价比突出。

核心要点
  • V4 Pro 正式版架构不变,但后训练使 Agent 能力大幅提升,DeepSWE 得分从 12.8 飙升至 62.7。
  • 实测显示,V4 Pro 在一次性生成完整代码任务上表现出色,但 thinking 模式可能截断输出,需注意调整。
  • 价格与预览版持平,每百万 token 输入 3 元、输出 6 元,但涨价预告已发布。
  • V4 Pro 在纯推理和复杂软件工程上仍落后于 Claude Opus 4.8 等,但性价比优势明显。
  • DeepSeek 正计划推出 Harness 框架,将模型与 Agent 运行环境打包,竞争进入新阶段。
目录

目录

  • 从“能用”到“好用”:DeepSeek V4 Pro 正式版的 Agent 进化之路
  • 后训练驱动:Agent 能力飙升,架构保持稳定
  • 实测:三个任务,考验真实场景下的代码生成
  • 性价比与生态布局:DeepSeek 的差异化策略
  • 国内视角:Agent 赛道的竞逐
  • 参考链接
  • 常见问题
  • DeepSeek V4 Pro 正式版与预览版有何不同?
  • V4 Pro 正式版的价格是多少?
  • V4 Pro 的 thinking 模式在代码生成时有什么问题?
  • DeepSeek Harness 是什么?
  • V4 Pro 在哪些方面仍落后于竞品?
  • 关于 Bingdada

从“能用”到“好用”:DeepSeek V4 Pro 正式版的 Agent 进化之路

8 月 13 日凌晨,DeepSeek 悄然更新了 API 文档,模型指纹从预览版变为 fp_v4pro_20260812,宣告 V4 Pro 正式版(以下简称“V4 Pro”)的落地。没有发布会,没有预告,甚至更新日志都略显仓促,但这并不妨碍它成为近期 AI 圈最值得关注的事件之一。从 4 月 24 日预览版亮相到正式版上线,整整 111 天,期间 Kimi K3 高调发布、V4 Flash 正式版先行一步,所有人的目光都聚焦在 Pro 正式版何时到来。现在,答案揭晓:架构未变,但能力已非吴下阿蒙。

后训练驱动:Agent 能力飙升,架构保持稳定

V4 Pro 的硬参数与预览版完全一致——1.6T 总参数、49B 激活参数的 MoE 架构,支持 1M 上下文和 384K 最大输出。真正的变化在于后训练,且幅度惊人。在 DeepSeek 自家的软件工程基准 DeepSWE 上,得分从预览版的 12.8 飙升至 62.7,涨幅接近 50 分;Cybergym 从 52.7 提升至 83.3,Terminal Bench 从 72.1 升至 87.9,DSBench-Hard 更是翻倍至 67.2。这些评测的共同点是它们都涉及长链路的代码修改、环境操作和工具调用——恰恰是预览版最薄弱的环节。

从 V4 Flash 正式版的更新日志可推断,这轮升级的核心就是面向代码 Agent 场景的大规模后训练。Flash 版已用相同方法将 Agent 能力提升至“基准测试远超 V4-Pro-Preview”的水平,Pro 版只是补上了同一课。价格方面,每百万 token 输入 3 元、输出 6 元,与预览版持平。尽管 DeepSeek 曾在 8 月 6 日预告“计划近期整体上调 API 定价,预计涨幅较大”,但 0813 版本尚未调整,窗口期能持续多久未知,开发者可把握当前成本优势。

实测:三个任务,考验真实场景下的代码生成

跑分只是门票,真实任务才是试金石。个不同方向的测试,探究 V4 Pro 在“一次性生成完整可运行代码”上的实际水平。

任务一:Boids 群体涌现模拟。 要求在 Canvas 上实现 200 个三角形 boid 的群体行为,含分离/对齐/凝聚三个可调参数、彩色轨迹、点击生成捕食者和 glassmorphism 风格控制面板。V4 Pro 耗时约 170 秒,生成了 761 行完整 HTML,打开浏览器后,200 个彩色三角形在黑色背景上游动、聚散、避障,拖动滑块可实时改变行为模式,效果流畅,一次运行通过。

任务二:模糊需求的“产品化补全”。 用中文告知“我想要一个好看的番茄钟工作面板”,仅提供“能计时、能记录、有白噪音、中文界面、要有质感”方向,其余由模型自行决定。V4 Pro 生成了 1223 行代码,除基础计时功能外,还自主添加了任务标签、专注统计图表、快捷键支持,甚至用 Web Audio API 从零合成白噪音。对模糊需求的补全能力,确实比预览版有明显进步。

任务三:寻路算法可视化。 要求实现 BFS、DFS、A* 三种算法的逐步动画、可交互网格画墙和迷宫自动生成。此任务代码量最大,也最能暴露问题。开启默认 thinking 模式时,V4 Pro 使用 16384 个 token 的输出配额,其中 13394 个花在“思考”上,留给实际代码的不到 3000 token,导致 HTML 输出中途截断。关闭 thinking 模式重跑,54 秒便输出完整的 715 行代码,功能一应俱全。这不是 bug,而是 V4 Pro 的一个真实特征:在复杂代码生成场景下,thinking 模式的推理 token 可能占输出的 80% 以上,挤压了实际内容空间。对于需要大段代码输出的任务,开发者可能需要主动关闭 thinking,或大幅提高 max_tokens 来兜底。

性价比与生态布局:DeepSeek 的差异化策略

V4 Pro 并非“全面碾压”的成绩单。HLE(不使用工具)得分 42.7,落后 Claude Opus 4.8(49.8)和 Fable 5(53.3);NL2Repo 以 61.5 低于 Opus 4.8 的 69.7;在部分测试上与 Kimi K3 也存在轻微差距。纯知识推理和最复杂的软件工程任务,V4 Pro 尚未登顶。但 DeepSeek 的竞争力从不依赖“最强”,而是遵循一条铁律:比我强的没我便宜,比我便宜的没我强。每百万 token 输入 3 元的价格,约为 Fable 5 的十分之一、Kimi K3 的三分之一。在 Agent 能力从“几乎不可用”跃升至“可与头部闭源模型正面对打”后,这一定律的杀伤力显著放大。

更值得关注的是 V4 Flash 正式版更新日志中的一行小字:评测使用了“DeepSeek Harness 极简模式(即将发布)”作为 Agent 框架。结合近期注册的“DeepSeek Harness 团队”公众号和招聘信息,DeepSeek 正计划将模型与 Agent 运行框架打包推出。如果说此前竞争停留在“谁的模型更聪明”,Harness 的出现则意味着竞争进入新阶段——不是比大脑,而是比谁能将大脑、手脚和工具箱组装成真正能替人干活的系统。V4 Pro 正式版补齐了大脑这一环,接下来就看“即将发布”何时落地。

国内视角:Agent 赛道的竞逐

在国内市场,DeepSeek 的动向并非孤例。文心一言、通义千问、Kimi 等也在加速 Agent 布局。例如,Kimi K3 的发布主打高调,强调其在长文本和复杂推理上的优势;智谱 GLM 系列则在多模态和 Agent 框架上持续迭代。相较于 DeepSeek 的“性价比+框架打包”策略,其他厂商更侧重生态整合或垂直场景优化。V4 Pro 的定价和 Agent 能力提升,可能迫使国内竞品在成本或功能上做出回应,推动整个行业向更实用的方向演进。

参考链接

  • DeepSeek 官方 API 文档
  • Kimi K3 发布报道
  • MoE 架构详解 (Wikipedia)

常见问题

DeepSeek V4 Pro 正式版与预览版有何不同?

正式版在架构上与预览版一致,但通过大规模后训练大幅提升了 Agent 能力,尤其在代码生成、工具调用和长链路任务上表现显著增强。

V4 Pro 正式版的价格是多少?

每百万 token 输入 3 元、输出 6 元,与预览版持平,但 DeepSeek 已预告将上调 API 定价,当前价格窗口期可能有限。

V4 Pro 的 thinking 模式在代码生成时有什么问题?

在复杂代码生成场景下,thinking 模式可能消耗超过 80% 的输出 token 用于推理,导致实际代码输出被截断。开发者可关闭 thinking 或调高 max_tokens 来避免。

DeepSeek Harness 是什么?

DeepSeek Harness 是 DeepSeek 计划推出的 Agent 运行框架,旨在将模型与工具调用、环境操作结合,实现更完整的自动化任务处理,目前处于“即将发布”状态。

V4 Pro 在哪些方面仍落后于竞品?

在纯知识推理(如 HLE)和最复杂的软件工程任务(如 NL2Repo)上,V4 Pro 仍落后于 Claude Opus 4.8 和 Fable 5,但性价比优势明显。

关于 Bingdada

Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。

编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com

© 2026 Bingdada. 保留所有权利。

目录

  • 从“能用”到“好用”:DeepSeek V4 Pro 正式版的 Agent 进化之路
  • 后训练驱动:Agent 能力飙升,架构保持稳定
  • 实测:三个任务,考验真实场景下的代码生成
  • 性价比与生态布局:DeepSeek 的差异化策略
  • 国内视角:Agent 赛道的竞逐
  • 参考链接
  • 常见问题
  • DeepSeek V4 Pro 正式版与预览版有何不同?
  • V4 Pro 正式版的价格是多少?
  • V4 Pro 的 thinking 模式在代码生成时有什么问题?
  • DeepSeek Harness 是什么?
  • V4 Pro 在哪些方面仍落后于竞品?
  • 关于 Bingdada
常见问题
黄金广告位 · 限时招商
广告位招商中

把品牌放进读者的阅读流

文章内广告位,高注意力场景,适合新品发布与活动招募。

商务合作

标签

#AI 模型#代码生成#DeepSeek V4 Pro#Agent 能力#API 定价#极客公园 GeekPark
bingdada

bingdada

SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

相关文章

Omarchy 4.0:当操作系统本身成为 AI 的“操作对象”,硅谷为何集体下注?
国产 AI 前线

Omarchy 4.0:当操作系统本身成为 AI 的“操作对象”,硅谷为何集体下注?

Omarchy 4.0 尝试将 AI 从应用层下沉到系统层,让自然语言成为人机交互的核心协议。文章分析了其技术理念、八位硅谷巨头的 800 万美元注资背后的战略意义,以及社区驱动的插件生态爆发,并对比了国内 AI 与操作系统融合的渐进式路径。

8月 25约 8 分钟阅读
AI 依赖症候群:当智能工具开始侵蚀我们的深度思考能力
国产 AI 前线

AI 依赖症候群:当智能工具开始侵蚀我们的深度思考能力

最新研究显示,过度依赖 AI 工具的学生在闭卷考试中成绩显著下滑。文章深入分析了 AI 使用与认知能力退化之间的关系,探讨了如何在效率与深度思考之间找到平衡。

8月 23约 8 分钟阅读
周杰伦或牵手vivo、华为阔直板手机亮相:科技圈8月20日热点全解析
国产 AI 前线

周杰伦或牵手vivo、华为阔直板手机亮相:科技圈8月20日热点全解析

本文深度解析8月20日科技圈热点:游戏科学《黑神话:钟馗》实机演示公布、宝马呼吁抵制行业浮躁、华为发布全球首款阔直板手机、周杰伦疑代言vivo、特斯拉Robotaxi数据修正及亚马逊无人机送货乌龙事件,并探讨其背后的行业趋势。

8月 21约 9 分钟阅读

订阅我们的 Newsletter

获取最新的 SEO 与 GEO 技术资讯。

我们尊重您的隐私,随时可以取消订阅。

评论 ({count}) (0)

登录后即可参与讨论

登录注册
还没有评论,来抢沙发吧