比台式机处理器还强?这颗锐龙神U是真的强

【zol中关村在线原创评测】锐龙ai max+395处理器上市之后获得相当不错的反响,超大统一内存加上可变显存,以及处理器本身就相当不错的计算能力,使得这个移动级计算平台在某些方面甚至超过了桌面级处理器,最近我们终于拿到了搭载amd锐龙ai max+ 395处理器的产品,一番测试下来,我们终于搞懂了它为何能够带来完全不一样的性能体验。

锐龙ai max+ 395是锐龙ai max+系列的顶配型号,原生16颗超大核心32线程设计,最高加速频率5.1ghz,总缓存高达80mb,npu峰值ai算力为50tops,ctdp为45-120w,集成40个图形核心的radeon 8060s igpu,并且支持高达128gb容量的lpddr5x 8000高速统一内存。下面咱们看看它的性能表现。

首先参考cinebench r23和2024测试,锐龙ai max+ 395处理器在r23测试标准下,单核得分1985,多核得分36648;2024标准下单核得分113,多核得分1752,整体性能表现非常出色,甚至可以探到移动端hx级别处理器的性能水准。因此锐龙ai max+ 395并非“ai偏科生”,而是有着极其扎实的单核和多核性能实力。

通过aida 64 fpu cpu单烤机测试可见,这颗处理器的长时稳定功耗释放可以保持在103w附近,平均核心温度99.1℃,3分钟以内的短时功耗释放甚至可以达到120w。

锐龙ai max+ 395之所以能够胜任70b大模型运行,很重要的一点是它采用了128gb统一内存,并且可以将一部分内存容量分配给radeon 8060s igpu,而且最高可以分配96gb容量。这使得集成显卡也能通过超大显存顺利运行大参数量的大语言模型。

同时,统一内存的优势在于读写与拷贝速度更快,通过aida 64内存性能测试可以看到,其读取速度高达119.34gb/s,写入速度高达210.1gb/s,拷贝速度高达153.49gb/s。

锐龙ai max+ 395之所以能够胜任大参数量ai大模型的需求,很重要的原因在于它集成的radeon 8060s igpu,这颗gpu在集成显卡中可以说是超模的存在。它拥有2560个流处理器,64gb lpddr5显存,128gb/s显存带宽,核心频率高达2900mhz,显存频率1000mhz,比当前任何一款集成显卡的性能都要强很多。

参考3dmark各项测试可以看到,radeon 8060s igpu在speed way dx12性能方面得分达到了2025,远超其它集成显卡的性能。port royal光追性能达到了5884分,基本达到了rtx 4060独显的水平(5957分左右)。而time spy以及fire strike图形分也分别达到了11498和30713分,作为集成显卡,它的理论图形性能其实达到甚至超越了rtx 4060独显的水平,着实让人感到惊艳。

锐龙ai max+ 395除了在ai应用方面有优势之外,日常生产力、游戏等应用方面也完全不瘸腿。

7-zip压缩与解压缩测试中,锐龙ai max+ 395处理器得益于16颗超大核心32线程设计,压缩速度达到了150617kb/s,解压缩速度达到了2063057kb/s,总评分高达177.76gips,是目前移动级处理器中t0级别的性能水准。

视频编码方面,x264 benchmark实测编码2500帧的帧速率为77.31fps,完成时间为32秒,相对于hx系列的处理器要略慢一些。

渲染方面,v-ray bencmark 1分钟采样率达到38813 vsamples;corona benchmark渲染速度达到了11248700rays/sec,渲染用时仅43秒。

总体来说,锐龙ai max+ 395处理器在压缩、解压缩以及物理渲染方面有着远高于其它移动端处理器的性能表现,而视频编码能力满足生产力需求也是不成问题的。

接下来再看看radeon 8060s igpu相关的应用性能。

首先是v-ray benchmark的加速测试,1分钟渲染速度达到了1812 vpaths,在集成显卡中鹤立鸡群。

blender benchmark的表现同样出色,monster、junkshop、classroom三项渲染采样率分别达到560.23、199.86以及252.34 samples/min,同样远超当前其它集成显卡的性能。

生产力应用性能我们参考ul procyon的照片编辑和视频编辑测试,二者评分分别达到了8955和22765分,可以相当轻松地胜任raw格式原片处理,并且在2k、4k视频剪辑上也能提供极为出色的性能支持。

目前,搭载amd锐龙ai max+ 395处理器的产品主要是笔记本与迷你电脑,价格在13999元到20000多不等,对于大众用户这个价格不便宜,但是如果将它与动辄数万、数十万元的ai一体机来做对比的话,这款机器可以说是目前成本相当低的ai学习、开发、应用平台,对初步上手ai的人群来说非常适合。

了解ai的朋友都知道,显存和内存在ai应用中非常重要,radeon 8060s虽然图形性能极为出色,但其显存也不过就是6gb,应对ai大语言模型的应用需求有点捉襟见肘。不过通过amd独特的统一内存技术,在amd软件控制中心,我们可以将其128gb内存分配给集成显卡作显存,最高可以分配96gb,这样就可以承担起大参数量大语言模型的应用需求了。

在ai应用测试之前,我们先来看看锐龙ai max+ 395处理器的cpu、gpu以及npu三大ai计算单元的算力表现。参考ul procyon的cpu integer、gpu float 16以及npu integer测试,三项评分分别为248、987以及1783分,相对此前的锐龙8040系列的处理器来说,锐龙ai max+ 395处理器的cpu ai算力提升不算太大,但gpu和npuai算力提升幅度基本都超过了3倍!

理论性能了解之后,我们看看锐龙ai max+ 395在实际ai应用中的表现。

首先通过ul procyon测试了phi-3.5 4b、mistral 7b、llama 3.1 8b以及llama 2 13b四款经典大语言模型,生成速度分别达到了69.56 tokens/s、44.87 tokens/s、38.01 tokens/s以及25.45 tokens/s,速度非常快。另外值得一提的是,即便是rtx 5060笔记本电脑gpu,因为其作为独立显卡也只有可怜的8gb显存,所以也无法正常运行参数量较大的llama 2大模型,而radeon 8060s不仅成功运行,且生成速度能够达到25.45 tokens/s,日常应用完全没有问题。此时,锐龙ai max+ 395平台的独特优势就彻底显现出来了。

接下来我们通过lm studio进行了15b及以下小参数量大语言模型和22b及以上大参数量大语言模型的测试。

首先在各类小参数量稠密大模型测试中可以看到,锐龙ai max+ 395表现非常出色,凭借内存分配带来的超大显存支持,即便是遇到bf16高精度的mistral-small 24b以及gemma 2 27b大模型,生成速度也分别达到了12.37 tokens/s和11.62 tokens/s,表现出色。而对于更高性能的deepseek r1 14b、phi-4 15b,速度也能达到19.63 tokens/s和12.24 tokens/s;低精度的deepseek r1 7b生成速度更是达到了41.94 tokens/s,而deepseek r1 1.5b则达到了92.67 tokens/s,可见在面对小参数量大模型时,锐龙ai max+ 395无论是面对高精度模型还是低精度模型,都能提供足够快的生成速度。

在面对大参数量大语言模型时,其实首要解决的问题不是能不能使用大模型,而是能不能正常加载大模型。就比如rtx 5060笔记本电脑gpu,虽然其性能比radeon 8060s要强,但如果大模型参数量较大,前者大概率也过不了加载这一关,更别提进一步应用了。

从下图可以看到,我们在加载qwen3-235b-a22b-iq2_s的moe混合大模型时,内存峰值占用高达63.6gb,如果没有128gb超大内存支持的话,加载这一关就过不了。

在各类大参数量大语言模型测试中,qwen3-235b-a22b-iq2_smoe模型生成速度达到了14.72 tokens/s,表现出色;deepseek iq2_m、deepseek r1 distill llama 70b大参数量稠密模型也能够正常运行,并且可以达到4.91 tokens/s和5.31 tokens/s的生成速度。而q4量化版本的deepseek r1 qwen 32b蒸馏模型以及qwq 32b大模型生成速度分别可以达到9.71 tokens/s和9.79 tokens/s的生成速度。

另外这里要说明的一点是,qwen3-235b-a22b-iq2_s这个模型虽然参数量达到了235b,但它并非是常见的稠密模型,而是moe(mixture of experts)混合专家模型。简单来说,moe模型虽然总参数量很大,但以qwen3-235b-a22b-iq2_s模型为例,它虽然拥有235b总参数量,但运行时实际只会调用22b(模型中a22b标识就表示运行时只会调用22b参数量)的参数进行计算,因此对于硬件的压力要小很多。

也正是因为有着这种大参数、低算力特性,moe模型或许会成为未来大模型发展的主流趋势。

反之,稠密模型每一次计算都会调用所有参数,这也就是为什么235b的qwen3-235b-a22b-iq2_s生成速度反而比deepseek r1 32b、qwq 32b大模型要快的原因。

ai测试的最后一部分,我们使用了针对amd锐龙平台打造的amuse这款stable diffusion工具,它支持文生图、图生图、文生视频等应用,使用起来非常方便。

首先我们使用最近大半年非常火爆的flux.1-dev模型进行了文生图测试,实测迭代10步,生成一张1024×1024超清图片用时234.3秒。这个表现虽然不如独显,但在集成显卡里,能顺利完成这一任务的此前没有,radeon 8060s不仅顺利完成,而且效率也还不错,毕竟1024×1024规格的图片生成,在ai文生图应用中算是高负载任务了。

其次我们使用了stable diffusion xl turbo模型,进行了2048x2048规格图片的生成。这款大模型整体精度要低一些,所以对硬件负载的压力不算太高。普通用户使用这类大模型进行文生图就足够了,没必要使用flux.1-dev这种超高精度大模型。

可以看到,stable diffusion xl turbo模型生成2048x2048规格图片耗时仅需12.8秒,每秒迭代次数也达到了2.6次。

总体来说,锐龙ai max+ 395是非常不错的ai计算平台,配合大内存并通过amd统一内存技术分配给显存之后,常规的ai应用基本没有太大压力,完全可以作为个人或者小型工作室、小型企业用户的ai终端设备。尤其相比动辄数万、数十万元的ai一体机来说,它绝对是一个高性价比的解决方案。