WORK / ArchiveKelly Personal Marketing Intelligence OS
阅读READ
每日简报Daily Brief市场情报Market Intelligence品牌案例库Brand Casebook公司研究Company Dossier
收听与学习LISTEN & LEARN
播客Podcasts商务英语Business English
创作CREATE
创意工作室Creative Studio视觉素材库Visual Library作品集Portfolio
职业CAREER
面试题库Interview Bank营销工具箱Marketing Toolkit
资料库LIBRARY
收藏集Collections观察名单Watchlists来源体系Sources
我的Profile设置Settings
⌘K
更新于 —KKelly
今日情报播客来源我的
WORK / ArchiveKelly Personal Marketing Intelligence OS
阅读READ
每日简报Daily Brief市场情报Market Intelligence品牌案例库Brand Casebook公司研究Company Dossier
收听与学习LISTEN & LEARN
播客Podcasts商务英语Business English
创作CREATE
创意工作室Creative Studio视觉素材库Visual Library作品集Portfolio
职业CAREER
面试题库Interview Bank营销工具箱Marketing Toolkit
资料库LIBRARY
收藏集Collections观察名单Watchlists来源体系Sources
我的Profile设置Settings
⌘K
更新于 —KKelly
WORK / ArchiveKelly Personal Marketing Intelligence OS
阅读READ
每日简报Daily Brief市场情报Market Intelligence品牌案例库Brand Casebook公司研究Company Dossier
收听与学习LISTEN & LEARN
播客Podcasts商务英语Business English
创作CREATE
创意工作室Creative Studio视觉素材库Visual Library作品集Portfolio
职业CAREER
面试题库Interview Bank营销工具箱Marketing Toolkit
资料库LIBRARY
收藏集Collections观察名单Watchlists来源体系Sources
我的Profile设置Settings
⌘K
更新于 —KKelly
Market Intelligence/极客公园

实测正式版 DeepSeek V4 Pro,补齐 Agent 能力|AI 上新

作者|桦林舞王 编辑|靖宇 没有预告,没有倒计时,甚至连更新日志都没来得及写好。DeepSeek V4 Pro 的正式版,就这么悄悄的来了。 8 月 13 日凌晨,DeepSeek 官网悄悄刷新了 API 文档。模型名还是那个 deepseek-v4-pro,但 fingerprint 已经变成了 fp_v4pro_20260812。打开社区一看,消息已经炸开—— V4 Pro 正式版,来了。 从 4 月 24 日预览版上线算起,整整 111 天。 这期间 Kimi K3 高调发布抢走了开源头条,V4 Flash 正式版先行一步在 7 月

·2026.08.13·5 min 阅读
事件背景基于真实抓取数据整理

本条来自 极客公园(Business / 科技商业),聚焦 technology、brand。 没有预告,没有倒计时,甚至连更新日志都没来得及写好。DeepSeek V4 Pro 的正式版,就这么悄悄的来了。

Original Intelligence基于真实抓取数据整理

作者|桦林舞王 编辑|靖宇 没有预告,没有倒计时,甚至连更新日志都没来得及写好

  • 作者|桦林舞王
  • 编辑|靖宇
  • 所有人都在问同一个问题:Pro 的正式版到底什么时候来?
  • 01
  • 没有预告,没有倒计时,甚至连更新日志都没来得及写好

作者|桦林舞王 编辑|靖宇 没有预告,没有倒计时,甚至连更新日志都没来得及写好

DeepSeek V4 Pro 的正式版,就这么悄悄的来了

8 月 13 日凌晨,DeepSeek 官网悄悄刷新了 API 文档

作者|桦林舞王

编辑|靖宇

没有预告,没有倒计时,甚至连更新日志都没来得及写好。DeepSeek V4 Pro 的正式版,就这么悄悄的来了。

8 月 13 日凌晨,DeepSeek 官网悄悄刷新了 API 文档。模型名还是那个 deepseek-v4-pro,但 fingerprint 已经变成了 fp_v4pro_20260812。打开社区一看,消息已经炸开—— V4 Pro 正式版,来了。

从 4 月 24 日预览版上线算起,整整 111 天。

这期间 Kimi K3 高调发布抢走了开源头条,V4 Flash 正式版先行一步在 7 月 31 日上线,API 涨价的预告更是悬在所有开发者头顶。

所有人都在问同一个问题:Pro 的正式版到底什么时候来?

答案是一个周三的深夜。

01

架构没变,能力暴涨

先说硬参数。V4 Pro 正式版的模型架构和预览版完全一致——1.6T 总参数、49B 激活参数的 MoE 结构,支持 1M 上下文、384K 最大输出。 变的是后训练,而且变化大到像换了个模型。

最夸张的数字来自 Agent 相关评测。DeepSWE(DeepSeek 自家的软件工程基准)从预览版的 12.8 飙到 62.7,涨了将近 50 分。Cybergym 从 52.7 到 83.3,Terminal Bench 从 72.1 到 87.9,DSBench-Hard 翻了一倍多达到 67.2。

这些测试项有一个共同特点——它们都涉及长链路的代码修改、环境操作和工具调用。 恰好是预览版最容易翻车的地方。

DeepSeek V4 Pro 正式版 Agent 能力大幅增强|图片来源:DeepSeek

从 V4 Flash 正式版的更新日志可以推断,这轮升级的核心就是面向代码 Agent 场景的大规模后训练。Flash 版已经用同样的方法把 Agent 能力做到了「基准测试远超 V4-Pro-Preview」的程度,Pro 版只是补上了同一课。

价格方面,每百万 token 输入 3 元、输出 6 元,和预览版持平。

虽然 8 月 6 日 DeepSeek 已经预告「计划近期整体上调 API 定价,预计涨幅较大」,但目前 0813 版本还没动。窗口期能撑多久不好说,想薅的趁早。

02

天花板和脾气

跑分好看只是门票,真正有意义的是拿真实任务去试。

极客公园用 V4 Pro 正式版跑了三个不同方向的测试,试图回答一个问题—— 这个模型在「一次性生成完整可运行代码」这件事上,到底到什么水平了?

第一个任务是 Boids 群体涌现模拟。 要求在 Canvas 上实现 200 个三角形 boid 的群体行为,带分离/对齐/凝聚三个可调参数、彩色轨迹、点击生成捕食者、glassmorphism 风格控制面板。这是一个涉及物理模拟、实时渲染和 UI 设计的综合任务。

V4 Pro 用了大约 170 秒,生成了 761 行完整 HTML。打开浏览器,200 个彩色三角形在黑色背景上游动、聚散、避障,拖动滑块可以实时改变群体行为模式。效果流畅,代码一次运行通过。

第二个任务故意模糊——用中文告诉它「我想要一个好看的番茄钟工作面板」, 只给了「能计时、能记录、有白噪音、中文界面、要有质感」这几个方向,其余让模型自行决定。

V4 Pro 交回来 1223 行代码,除了基础的 25/5 分钟计时功能,它自己加了任务标签、专注统计图表、快捷键支持、甚至用 Web Audio API 从零合成了几种白噪音。

对模糊需求的「产品化补全」能力,确实比预览版有明显进步。

第三个任务是寻路算法可视化, 要求实现 BFS、DFS、A* 三种算法的逐步动画、可交互的网格画墙、迷宫自动生成。这个任务的代码量最大,也是翻车最多的地方——但翻车的方式本身就很有意思。

开着默认的 thinking 模式,V4 Pro 用了 16384 个 token 的输出配额,其中 13394 个花在了「思考」上。留给实际代码的不到 3000 个 token,直接截断,HTML 写到一半就断了。

关掉 thinking 模式重跑,54 秒就输出了完整的 715 行代码,寻路动画、迷宫生成、暗色主题一应俱全。

这不是一个 bug,而是 V4 Pro 正式版的一个真实特征——thinking 模式在复杂代码生成场景下,推理 token 可能占到输出的 80% 以上,反而挤压了实际内容的空间。

对于需要大段代码输出的任务,开发者可能需要主动关闭 thinking,或者大幅提高 max_tokens 来兜底。

03

大鲸鱼的位置

经过 API 实测之后,坦率地说,V4 Pro 0813 不是一张「全面碾压」的成绩单。

HLE 不使用工具时 42.7 分,落后 Claude Opus 4.8 的 49.8 和 Fable 5 的 53.3。NL2Repo 以 61.5 落后 Opus 4.8 的 69.7。有 Kimi K3 在前,它在部分测试上也存在轻微差距。

纯知识推理和最复杂的软件工程任务,V4 Pro 还没有坐上头把交椅。

但 DeepSeek 从来不是靠「最强」赢的。它靠的是那条所有人都背得出来的定律——比我强的没我便宜,比我便宜的没我强。

每百万 token 输入 3 元的价格,大约是 Fable 5 的十分之一、Kimi K3 的三分之一。

在 Agent 能力从「几乎不可用」暴涨到,「能和头部闭源模型正面对打」之后,这条定律的杀伤力比预览版时期大了一个量级。

更值得关注的是藏在 V4 Flash 正式版更新日志里的一行小字——评测使用了「DeepSeek Harness 极简模式(即将发布)」作为 Agent 框架。结合前两天注册的「DeepSeek Harness 团队」公众号和此前的招聘信息, DeepSeek 正在准备把模型和 Agent 运行框架打包推出。

如果说过去大家的竞争还停留在「谁的模型更聪明」这个维度,那 Harness 的出现意味着竞争正式进入下一阶段—— 不是比谁的大脑更好,而是比谁能把大脑、手脚和工具箱组装成一个真正能替人干活的系统。

V4 Pro 正式版补齐了大脑这一环。接下来,就看那个「即将发布」还要等多久了。

*头图来源:AI 生成

本文为极客公园原创文章,转载请联系极客君微信 geekparkGO

❧
Industry Analysis规则派生 · 可核对

本条目归入「Technology AI」垂直,涉及真实话题:technology、brand。

· 市场:关注 technology、brand 对相关品类与竞争格局的潜在影响。

· 消费者:受众行为与偏好变化值得追踪。

· 品牌:本动向对品牌资产建设的启示。

· 渠道:内容分发与触点组合(社媒 / 电商 / 线下)的协同值得复盘。

Marketing Insight规则派生 · 可核对

· 核心话题:technology、brand。

· 可思考:如何把「technology」的洞察,转化为可衡量的内容与增长动作?

Career Usage规则派生 · 可核对

面试中可引用「实测正式版 DeepSeek V4 Pro,补齐 Agent 能力|AI 上新」:围绕 technology、brand,说明你对行业动向的判断与可落地动作。

本条目相关英文术语可在「商务英语」模块按话题检索,用于外企面试表达训练。

关联播客真实 RSS 单集
Why creativity matters more than ever in the age of AI - Adobe CMO, Lara Balazs
Uncensored CMO · 2026.07.15
Melissa Grady Dias (Measured Wellness) | From CMO to CEO: Using AI and Human Connection to Transform Health
The CMO Podcast · 2026.06.03
What the Best Fashion Stores Get Right
The Business of Fashion Podcast · 2026.08.13
延伸信源A / B 级权威来源 · 供深挖
Marketing BrewACampaignAThe DrumAWARCAAdweekADigidayA
Business English提取正文真实商业词汇

本条正文未命中预设商业词表,可前往 /english 系统学习。

系统商务英语 →
关联 English Brief
软件不是文件:KDC 的知识工程主张
InfoQ 中文
FineToday 菲婷丝发起「换」醒青年力
品观网
来源
阅读原文 · 极客公园 ↗
发布:2026.08.13
类型:Business / 科技商业
话题:technology、brand
相关阅读
极客公园/2026.08.13
「美国豆包手机」全系涨价,新东西全留给了 Gemini
TechCrunch/2026.08.13
Who really needs a cocktail robot?
第一财经/2026.08.13
AI进化速递丨AI版支付宝“阿宝”鸿蒙版逐步开放测试
爱范儿/2026.08.13
Pixel 11 上手:AI 不支棱,涨价不消停
TechCrunch/2026.08.13
Amazon will train on Twitch streamers’ content by default, unless they opt out
个人笔记
自动同步到云端