从昨夜到今天下午,DeepSeek V4 Pro正式版经历了一场过山车。
8月13日凌晨,DeepSeek没有预热,没有发布会,只是悄悄修改了API文档,官方还释放了一张得分不错的榜单。等待近四个月的V4 Pro正式版,就这样突然出现在公众视野里。
随后,海外开发者和AI圈迅速沸腾,直呼Deepseek V4 Pro正式版性能几乎追平Fable 5。
可几个小时后,故事开始出现反转。被调侃为滑动变阻器的梁文锋,在一天之内从“梁圣”又变成了“梁子”。
不少开发者体验后发现,V4 Pro正式版远没此前V4 Flash惊艳。与此同时,DeepSeek官方对这次发布没有更多说明,甚至到了下午,Deepseek官网突然撤下V4 Pro正式版公告。
于是出现一些猜疑,V4 Pro究竟是能力不及预期,还是这次发布本身就还没有真正完成?一位开发者对我们做出一个大胆的猜测,会不会是模型已经准备好了,但Harness还没准备好,DeepSeek准备等两者一起端上来?
如果答案真是后者,那么现在看到的V4 Pro,或许还不是故事的最终版本。
01
陷入争议的DeepSeek V4 Pro正式版
8月13日凌晨,DeepSeek没有发布预热海报,只是悄悄修改了API文档:deepseek-v4-pro背后的模型版本,从此前的Preview变成了DeepSeek-V4-Pro-0813。
这意味着,被外界等待近四个月的V4 Pro正式版终于上线。
消息在X等海外社交平台迅速沸腾。AI Coding工具Cline称它的Terminal-Bench 2.1成绩,较4月预览版提高15.8个百分点,以低约57倍的价格达到Claude Fable 5的水平,可能是“目前市场上性价比最高的模型”。
这条内容被大量开发者、投资人、AI博主转发。
科技投资人Jennifer Zhu Scott感叹,DeepSeek几乎是在“嘲弄全球AI行业”。曾参与Google AI加速器软件研发的工程师Shantanu Goel则认为,这一价格足以让V4 Pro冲击大量同类模型。
在反映真实开发者偏好的Arena.ai榜单里的前端 Web 开发任务中,DeepSeek V4-Pro-0813已经在短短半天冲到了gpt-5.6-sol-xhigh和glm-5.2-max之间。
今天早上有一波报道跟进,大多是夸赞V4 Pro正式版的,普遍将V4 Pro 正式版描述为一次明显的能力升级,尤其强调其Agent能力提升,以及在部分测试中已经逼近甚至对标顶尖模型Fable 5。
比如在Terminal-Bench 2.1上,V4 Pro正式版拿到了87.9分,距离Fable 5的88.0只差0.1。
另外,作为目前性价比最高的旗舰级Agent模型,DeepSeek V4-Pro-0813没有在绝对能力上击败所有海外模型,但正在让OpenAI、Anthropic们的模型定价显得越来越难以解释。DeepSeek的性价比王冠,还是戴得好好的。
一时之间,一个达到Fable水平、API价格只有其1/50、缓存价格还更低的模型,引发了更多的开发者涌入测评。
但兴奋只持续了几个小时。很快,一些程序员和工程师们体验之后发现,远不如此前V4 Flash惊艳。
我们在DeepSeek官方社群里看到,一些测试过程体验不好的程序员,不敢相信这是V4 Pro的水平,他们甚至认为V4 Pro版可能还没有正式发布,或者还没完全部署。
其中一个数据更让他们难以置信。
V4 Pro在Terminal-Bench、CyberGym、DeepSWE等Agent评测上大幅领先Flash,但Artificial Analysis给V4-Pro-0813打出53分,只比参数规模小得多的V4-Flash-0731高1分。与GLM-5.2持平,低于Kimi K3的60分。
这也带来了一个非常有意思的问题,一个1.6万亿参数、单次激活490亿参数的Pro模型,为什么只比2840亿参数、激活130亿参数的Flash高1分?
开发者Jun Song将V4 Pro接入自己的Agent框架后表示,“相对于benchmark,模型的实际表现有些令人失望。”尽管V4-Pro-0813明显强于当前被算力限制,能力有所下降的部分Opus服务端版本,但没有达到benchmark,给人的那种全面接近顶级闭源模型的感觉。
Jun Song的评价代表了不少海外开发者群体的心声,“中国模型公司在小模型上表现得异常出色,例如Qwen 27B、V4 Flash和GLM-5.2,但到了更大的旗舰模型,能力提升往往没有随着参数同步放大。”
网络安全公司Aikido的测试,则同时为两方舆论提供了证据。V4 Pro连续运行三次后,找出了32个真实漏洞中的28个,87.5%的召回率超过Opus 5和Qwen 3.8。
但它报告的漏洞只有65.6%真实有效,单次平均只能找到58.3%的漏洞。
评论区有人提出了解法,用更便宜的V4 Pro完成第一轮扫描,然后再用GPT-5.6 Sol或者人工审计过滤误报,这可能比某一个benchmark第一更接近V4 Pro的商业价值。
V4 Pro正式版带来的风波,似乎也暴露出DeepSeek在Agent和Coding上作为追赶者的慌乱与焦虑。
02
DeepSeek Harness会爆吗
Harness无疑是Deepseek接下来的重心。
其实早在V4 Flash正式版发布时,DeepSeek就已经释放了这个信号。官方更新日志里提到,对于公开代码Agent任务,测试使用了“DeepSeek Harness minimal mode”,并且这一框架即将发布。
官方还明确说,V4 Flash0731与Preview版本保持相同的模型架构和规模,主要变化来自后训练。
而这次V4 Pro的评测,官方目前还没有披露更多细节,更没有提到 Harness。
但是,鉴于这次V4 Pro正式版跑分较高,DeepSeek一个官方交流群里,一位程序员则提出了一个猜测:“官方公布的V4 Pro高分数据,可能也是在搭配DeepSeek Harness环境下跑出来的。”
如果DeepSeek V4-Pro的高分来自自研dsh(Code Harness),那么这个成绩更准确地反映的是“V4-Pro+dsh”这一整套 Coding Agent 系统的能力,而不单单是V4-Pro模型本身的纯模型能力。
另一方面,由于DeepSeek Harness目前尚未正式发布,普通用户即使使用同一个模型,也很难复现官方的成绩。这或许也是开发者体验V4 Pro正式版不太好的原因之一。
上述程序员对我们说,“我压根不在乎他是不是裸跑的成绩,用户只需要知道,怎么样才能跑出你这个成绩。”
模型真正进入终端环境后,面对的并不只是写代码这么简单。它需要理解陌生环境,寻找文件,安装依赖,修改代码,执行命令,读取报错,再根据反馈重新尝试,最后还要通过自动测试。
其中任何一个环节出现问题,都可能导致整个任务失败。
一个Agent在这类测试中的最终表现,很难只归因于模型本身。模型决定能想多深,Harness决定怎么干活,Tools决定能做什么。
这也是为什么,如今评价一个Agent的能力,单看模型Benchmark已经越来越不够了。
不过这次真正让行业兴奋的,也正是DeepSeek Harness这个尚未完整亮相的变量。
Harness被认为是DeepSeek从模型走向Agent的关键一步。
今年5月,DeepSeek开始公开招聘Agent Harness产品经理和研发工程师,并表示,正在把DeepSeek的模型能力转化为Agent产品,“模型本身以外的所有工作,都属于Harness的范畴。”
DeepSeek资深研究员陈德里还在社交平台进直接发帖招人,标题就是:“来DeepSeek从零做Code Harness。”并且明确写着,对标Claude Code,做DeepSeek Code Harness。
这意味着DeepSeek要做的并不是简单的给大模型加一个编程插件,要从底层重新搭一套自己的Coding Agent运行体系。
一位开发者告诉我们,万众瞩目的Deepseek Harness,可能不会大爆。“现在我用的比较好的agent工具,codex 、zcode、pi,这些感觉架构形态基本上已经趋同,DeepSeek Harness估计也是跟这个差不多,性能增幅大,也不会太大。”这位工程师说。
关于Deepseek为什么撤掉V4 Pro正式版的公告,在Deepseek官方社群里,有人猜测是因为上错了版本。
不过上述开发者告诉我们,未必,另一种可能是V4-Pro本身已经准备就绪,但DeepSeek Harness还没有完全准备好,官方可能打算把模型和Harness一起端上来。
这个猜测并非完全没有依据。DeepSeek此前公布的Agent基准成绩,就明确提到使用了DeepSeek Harness。这几天,一个灰色头像的“Deepseek Harness团队”的公众号,开始在一些微信群里广为流传,只是尚未发布任何内容。
刚刚完成510亿融资的Deepseek,能否再次证明自己,或许还要等Harness登场后再看。
文|马舒叶
编辑|吴寻

