大家好,我是冷逸。
千呼万唤始出来,deepseek v4终于发布了。
这次一共有2个版本,v4 pro和v4 flash,都是1m上下文,也都开源。
v4 pro,1.6t(1.6万亿)总参数,49b激活。
v4 flash,284b(2840亿)总参数,13b激活。
在网页端/app,v4 pro对应“专家模式”,v4 flash“快速模式”。

一图看懂deepseek v4,图由gpt生成
据deepseek自己介绍,v4的agent能力仅比肩claude sonnet 4.5,离opus 4.6、4.7还有差距;世界知识离gemini-pro-3.1还有差距;推理性能,与gpt-5.4旗鼓相当。
官方report也直言,“发展轨迹约滞后前沿闭源模型3到6个月”。
api价格方面,deepseek v4比v3.2有所上涨,v4 pro涨了约6倍,v4 flash降了约50%。另外,并没有coding plan。
以上,来自官方信息。下面,我们基于实测来评估一下这个模型。

一手实测
1)编程:3d任务
先测一个3d任务,主要看模型的前端能力,考验模型对空间想象和逻辑推理的能力。
提示词:制作一个3d的雪山场景html,雪山中间有一个日式的寺庙,整体风格参考塞尔达旷野之息。
qwen3.6-plus:

glm-5.1:

deepseek v4 pro:

minimax m2.7:

gemini-3.1-pro:

为什么不对比kimi k2.6?kimi说他有点累了,让我晚点再问一下。
整体来看,“开源五杰”表现不一。
glm-5.1、qwen3.6-plus和gemini-3.1-pro在同一个水平,其他四家略逊一筹。
细节方面,glm-5.1和qwen3.6-plus是最强的。比如雪山粒子特效、日式建筑还原、塞尔达风格参考,他俩的整体表现比其他模型都要更优一些。
deepseek v4 pro,在这个case中表现一般。
我又试了一个3d魔方的老case,v4能做到还原。
提示词:create a single html file containing a fully functional 3d rubik's cube simulation using three.js (via cdn). the cube must be able to automatically solve itself.
中文:创建一个html文件,其中使用three.js(通过cdn方式引入)来实现一个功能完备的3d魔方模拟程序。该魔方必须能够自动完成自己的“解谜”过程。

这个case,我也测过很多模型了。基本上,最新的模型都能one shot,一次跑通。
2)编程:skills任务
今天,藏师傅开源了一个极其牛逼的ppt skill“guizang-ppt-skill”。

skill地址:github.com/op7418/guizang-ppt-skil
生成的是一份html式ppt,也就几十kb,可以发给任何人,在浏览器打开,字体、动画都不会变。
对于这个skill,藏师傅说“这是他十年审美的压缩包。”
我第一时间,就把这个skills装到我的claude code里。直接对着你的claude code说这句话就行。
帮我安装这个skill:https://github.com/op7418/guizang-ppt-skill,放在这个文件夹:c:\users\administrator\.claude\skills
然后,接入deepseek v4 pro跑了个case,让它把我昨天的文章设计成10页ppt。

给大家看下最终的效果。
整体排版、风格、字体搭配,我都非常满意。差不多我再微调下文字(可用trae或文本编辑器来改),这套ppt可以直接拿去演讲了。
3)编程:网站开发
需求是,让deepseek v4 pro基于我给到的模特照片,做一个摄影师作品集的网站。
提示词:我是拍模特广告的摄影师,我的工作室叫“小逸摄影”,文件夹 d:\vibe coding\ds v4\模特图片 放了一些模特图片,给我生成一个高级审美、大师水准的摄影师作品网站,用上文件夹里的图片并配上精美的讲解。
qwen3.6-plus,之前已经测过,效果很惊艳。
来看下deepseek v4 pro的表现。
也是深色背景+hero全屏+网格画廊,整个水准跟qwen3.6-plus差距不大。
如果要论细节的话,qwen3.6-plus在一些logo、文字配色和交互动画上要更强一些。

qwen3.6-plus生成的首屏

deepseek v4 pro生成的首屏
4)agent长程任务
任务,还是我们的老case,让claude code做一个联网搜索+word生成+skill调用+网站开发的复杂长程任务。
提示词:联网搜索、调研张雪机车的发展轨迹,尽量从权威信源获取信息。首先,给我创建一份5000字的word调研报告。然后,调用knowledge site creator skills给这份报告创建一个知识学习网站,页面高级审美。
这个任务,deepseek v4 pro跑了很久,耗时33分钟。

交付给我了2个东西,一个是word报告,一个是知识学习网站(带后端)。
先看word报告。

内容还是挺全面的。最近,我高频在用deepseek做信息检索,回答质量一直都比较靠谱。相比去年的deepseek,现在的幻觉已经大幅下降。
然后,再看它生成的知识学习网站。

直接带了后端+数据库的功能,我添加数据后,这个网站就可以真实使用了。
以上4个case,一共消耗了450万tokens,成本10元。蹲一个,deepseek啥时候出codingplan啊
。

5)世界知识任务
世界知识,要系统测起来,比较麻烦。
我问了一些陌生领域(关闭联网,下同)的问题,它都能答得上来。

一些次新的知识,它也训了进去。

但最新的,它不知道。

我问了下它的知识库,说是训练数据截止到2025年5月。

6)写作任务
以我经常干的事“让ai续写”来进行测试。
提示词:
参考下文的风格续写,300字:
现在,谁发我一张图,我的第一反应都是:“这是不是gpt生成的?”
人类社会,大家能够坐下来一起讨论事情,最基本的前提是,我们活在同一个现实里,对最基础的事实认知是一致的。
而今天,目光所及的一切都在崩塌。deepseek v4 pro的表现还行,但还是爱拽一些技术词,比如锚点、脚本、图灵测试等。

gpt-5的表现,明显就更像人一些,说人话。

gpt,也一直是我的常用写作模型。但自己要注意微调一下,比如让它不要老说“不是…而是”,不要一直加破折号、冒号。
gemini-3.1-pro的表现继续拉胯。拽那么多成语一点用都没有,跟原文的风格非常割裂。

上周,我跟大家分享了写作经验,很多人都在评论区说gemini 3.1/3.0远不如gemini 2.5,确实如此。
claude-opus-4.6,这写作能力依旧顶级。
