实测完DeepSeek V4 Pro正式版,我发现下一条「斩杀线」可能藏在它的Agent里
摘要
一夜之间,三款重磅模型罕见撞车。 Grok 4.6 纸面跑分逼近 Fable 5,大有成为海外御三家的势头。 总参数达到 2.4T 的 Qwen3.8 Max 也如期开放权重;DeepSeek 这边,DeepSeek V4 Pro 正式版(deepseek-v4-pro...
一夜之间,三款重磅模型罕见撞车。
Grok 4.6 纸面跑分逼近 Fable 5,大有成为海外御三家的势头。

总参数达到 2.4T 的 Qwen3.8 Max 也如期开放权重;
看完 V4 Pro 正式版的跑分图,我只能说,这波提升还是肉眼可见的。

但这年头,跑分没输过,实际体验没赢过的模型我们也见得太多了。因此,我们也第一时间将 deepseek-v4-pro 接进 Codex 和 Claude Code,看看实际效果如何。
V4 Pro 正式版到底好不好用?
先从文字能力开始。
我让 V4 Pro 正式版模仿鲁迅,写一篇约 400 字的短文,吐槽现代人饿着肚子也要先给饭菜拍照发朋友圈,同时要求兼顾年代感、讽刺和幽默。
结果如下:

说实话,第一眼看过去,离真正的鲁迅先生肯定还有距离。
开头甚至直接借用了鲁迅最具辨识度的经典句式,模仿痕迹相当明显。但 V4 Pro 正式版至少没有把「鲁迅风」机械理解成半文半白、生僻词和之乎者也。
它能抓住句式节奏,也知道把「吃饭拍照」从一个日常行为慢慢引向展示欲、面子和旁观者评价。
更重要的是,整篇文章的「AI 命题作文味」已经比较淡。虽然还算不上一代文豪,但至少没有那种让人两眼一黑的模板拼接感。
如果说模仿鲁迅多少还有点「考试」意味,接下来这封商务邮件,就更接近日常工作了。
我假设公司内部失误,导致一个大客户的定制系统延期一周,让它写一封道歉邮件,要求承认责任、提出补偿,同时不能把客户合作信心写没了。

V4 Pro 正式版没有用「多方面因素」「项目节奏调整」这类常见的职场模糊表达,而是直接承认「此次延期完全源于我方内部的失误」,随后给出了延长质保、增加免费培训和专属运维三项补偿。
整封邮件 28 秒左右完成,正文基本到了修改一下信息就能使用的程度。
有意思的是,邮件写完以后,它又额外解释了一遍为什么这么写,颇有一种交完卷还要给老师讲解答题思路的执着。
文笔测完以后,我把
我也测试了几个编程任务。
我先丢给它一个很典型的「大而全」前端需求。

经典的 macOS 风格 Web OS,要求所有代码放进单个 HTML 文件,同时加入文本编辑器、Terminal、代码编辑器、游戏、文件管理、画图和视频编辑等应用。

单看完成度,这应该是我此前测试过的同类模型里,功能最丰富的一版。多个应用都做出了基本界面和交互,系统框架也搭得比较完整,只不过审美嘛,就比较中规中矩了。
随后我又测试了一个拍立得相机案例,需要完整模拟按快门、闪光、出纸和 8 到 10 秒化学显影的过程,同时叠加复古偏色、轻微杂色以及类似宝丽来照片的表面质感。

从成品来看,动画之间的衔接也是比较自然流畅的。
再比如直接上 Three.js 和 WebGL,让它生成可以交互的黑洞吸积盘,鼠标改变观察角度以后,星空、吸积盘和光线弯曲都要跟着变化。
面对 WebGL 这类对性能敏感的场景,V4 Pro 对粒子数量、实时计算、渲染开销和动画复杂度的控制仍然偏激进。光打开网页,我的 M2 电脑已经开始明显掉帧。

最后则是一套科幻飞船驾驶舱 HUD,需要同时处理动态准星、雷达、航向、速度、能量、目标锁定和鼠标移动后的惯性偏移。V4 Pro 正式版最终把主要交互关系都做了出来。

总的来说,如果不存在官方部署 bug 的前提下,V4 Pro 正式版应对复杂任务的完整度还是有所提高,只不过,整体体验下来,我也总感觉少了一些特别惊艳感,甚至有些地方没有比 V4 Flash 拉开想象中那么大的差距。
不过放到 Agent 场景里,如果 Flash 已经能完成 80% 甚至 90% 的任务,Pro 只负责少数高难度节点,那么真正高效的系统,会动态决定什么时候调用 Flash,什么时候调用 Pro,而不会全程挂着最贵的模型。
换句话说,模型之间的能力梯度,本身可以变成 Agent 的成本优化空间。
DeepSeek 的下一张牌,藏在 Harness 里
规格上,
普通聊天基本用不到这么大的窗口,但 Coding Agent 很容易需要同时处理几十个文件、历史修改、工具返回结果和长时间任务状态。上下文越长,模型能够留在手里的项目资料越多。
代价也是不言而喻的,Token 会迅速上涨。
这也解释了
当前 V4 Pro 正式版缓存命中的输入价格为每百万 tokens 0.025 元,缓存未命中输入 3 元,输出 6 元。V4 Flash 则分别是 0.02 元、1 元和 2 元。

Pro 的输入和输出价格基本是 Flash 的三倍,但放到全球市场里,依然十分便宜。
另一个值得注意的地方是,按照现有模型信息,它的主要能力仍集中在文本、推理、Coding、Tool Calls 等方向,暂时还没有看到图像、视频等原生输入能力。简言之,多模态目前并不是 V4 Pro 正式版的重点。
相比之下,V4 Pro 正式版发布前后,

在过去的两三个月里,我们也看到正式挂帅
包括一个名为 「
Harness 是今天 Agent 竞争里经常被模型光环遮住的一层。
模型负责推理,真正决定 Agent 如何读文件、调工具、管理上下文、失败重试和持续执行的,还有外面的整个运行框架。
Claude Code 和 Codex 的实际体验,也从来不只由底层模型决定。
尤其当

在模型的成本优势上,我们已经见识到了
同理,现在
让模型更少重复读取上下文,让工具调用更高效,让长任务尽量避免无意义消耗,让同样一个任务需要的 Token 更少,再把底层模型本身的价格优势叠加上去。
到那时,哪怕
评论 (10)
体验下来 V4 Pro 没拉开和 Flash 太大差距。不过它成本低,要是 Harness 用好了,以后 Agent 系统成本能降很多。
V4 Pro 表现一般般,没达到预期。但价格便宜,等 Harness 团队把成本控制做好,说不定能改变局面。
性能一般体验没惊喜,成本优势明显。Harness 若能把成本优势传导到 Agent,这模型可能会火。
整体表现中规中矩,没特别厉害。但价格有竞争力,Harness 要是做好了,这模型应该能有市场。
这模型跑分和文字能力还行,编程面对性能场景有问题。价格能比其他模型低不少,要是 Harness 能降成本,估计能有市场。
文字编程测试有好有坏,没那么亮眼。价格便宜是优势,就看 Harness 团队咋利用模型成本优势了。
V4 Pro 有亮点也有不足,价格还得涨。就盼着 Harness 能利用好模型优势,降低 Agent 系统成本。
V4 Pro 优势在成本,文字编程差点意思。就看 Harness 咋操作,把成本优势用到 Agent 系统上。
V4 Pro 整体完成度有提升,但没特别惊艳。价格还会涨,就看 Harness 能不能把成本优势传导到 Agent 系统了。
模型完成复杂任务有进步,编程对性能控制差。价格虽上调但仍有优势,就看 Harness 咋发挥作用了。