比台式機處理器還強?這顆銳龍神U是真的強

【zol中關村在線原創評測】銳龍ai max+395處理器上市之後獲得相當不錯的反響,超大統一內存加上可變顯存,以及處理器本身就相當不錯的計算能力,使得這個移動級計算平台在某些方面甚至超過了桌面級處理器,最近我們終於拿到了搭載amd銳龍ai max+ 395處理器的產品,一番測試下來,我們終於搞懂了它為何能夠帶來完全不一樣的性能體驗。

銳龍ai max+ 395是銳龍ai max+系列的頂配型號,原生16顆超大核心32線程設計,最高加速頻率5.1ghz,總緩存高達80mb,npu峰值ai算力為50tops,ctdp為45-120w,集成40個圖形核心的radeon 8060s igpu,並且支持高達128gb容量的lpddr5x 8000高速統一內存。下面咱們看看它的性能表現。

首先參考cinebench r23和2024測試,銳龍ai max+ 395處理器在r23測試標準下,單核得分1985,多核得分36648;2024標準下單核得分113,多核得分1752,整體性能表現非常出色,甚至可以探到移動端hx級別處理器的性能水準。因此銳龍ai max+ 395並非「ai偏科生」,而是有着極其紮實的單核和多核性能實力。

通過aida 64 fpu cpu單烤機測試可見,這顆處理器的長時穩定功耗釋放可以保持在103w附近,平均核心溫度99.1℃,3分鐘以內的短時功耗釋放甚至可以達到120w。

銳龍ai max+ 395之所以能夠勝任70b大模型運行,很重要的一點是它採用了128gb統一內存,並且可以將一部分內存容量分配給radeon 8060s igpu,而且最高可以分配96gb容量。這使得集成顯卡也能通過超大顯存順利運行大參數量的大語言模型。

同時,統一內存的優勢在於讀寫與拷貝速度更快,通過aida 64內存性能測試可以看到,其讀取速度高達119.34gb/s,寫入速度高達210.1gb/s,拷貝速度高達153.49gb/s。

銳龍ai max+ 395之所以能夠勝任大參數量ai大模型的需求,很重要的原因在於它集成的radeon 8060s igpu,這顆gpu在集成顯卡中可以說是超模的存在。它擁有2560個流處理器,64gb lpddr5顯存,128gb/s顯存帶寬,核心頻率高達2900mhz,顯存頻率1000mhz,比當前任何一款集成顯卡的性能都要強很多。

參考3dmark各項測試可以看到,radeon 8060s igpu在speed way dx12性能方面得分達到了2025,遠超其它集成顯卡的性能。port royal光追性能達到了5884分,基本達到了rtx 4060獨顯的水平(5957分左右)。而time spy以及fire strike圖形分也分別達到了11498和30713分,作為集成顯卡,它的理論圖形性能其實達到甚至超越了rtx 4060獨顯的水平,着實讓人感到驚艷。

銳龍ai max+ 395除了在ai應用方面有優勢之外,日常生產力、遊戲等應用方面也完全不瘸腿。

7-zip壓縮與解壓縮測試中,銳龍ai max+ 395處理器得益於16顆超大核心32線程設計,壓縮速度達到了150617kb/s,解壓縮速度達到了2063057kb/s,總評分高達177.76gips,是目前移動級處理器中t0級別的性能水準。

視頻編碼方面,x264 benchmark實測編碼2500幀的幀速率為77.31fps,完成時間為32秒,相對於hx系列的處理器要略慢一些。

渲染方面,v-ray bencmark 1分鐘採樣率達到38813 vsamples;corona benchmark渲染速度達到了11248700rays/sec,渲染用時僅43秒。

總體來說,銳龍ai max+ 395處理器在壓縮、解壓縮以及物理渲染方面有着遠高於其它移動端處理器的性能表現,而視頻編碼能力滿足生產力需求也是不成問題的。

接下來再看看radeon 8060s igpu相關的應用性能。

首先是v-ray benchmark的加速測試,1分鐘渲染速度達到了1812 vpaths,在集成顯卡中鶴立雞群。

blender benchmark的表現同樣出色,monster、junkshop、classroom三項渲染採樣率分別達到560.23、199.86以及252.34 samples/min,同樣遠超當前其它集成顯卡的性能。

生產力應用性能我們參考ul procyon的照片編輯和視頻編輯測試,二者評分分別達到了8955和22765分,可以相當輕鬆地勝任raw格式原片處理,並且在2k、4k視頻剪輯上也能提供極為出色的性能支持。

目前,搭載amd銳龍ai max+ 395處理器的產品主要是筆記本與迷你電腦,價格在13999元到20000多不等,對於大眾用戶這個價格不便宜,但是如果將它與動輒數萬、數十萬元的ai一體機來做對比的話,這款機器可以說是目前成本相當低的ai學習、開發、應用平台,對初步上手ai的人群來說非常適合。

了解ai的朋友都知道,顯存和內存在ai應用中非常重要,radeon 8060s雖然圖形性能極為出色,但其顯存也不過就是6gb,應對ai大語言模型的應用需求有點捉襟見肘。不過通過amd獨特的統一內存技術,在amd軟件控制中心,我們可以將其128gb內存分配給集成顯卡作顯存,最高可以分配96gb,這樣就可以承擔起大參數量大語言模型的應用需求了。

在ai應用測試之前,我們先來看看銳龍ai max+ 395處理器的cpu、gpu以及npu三大ai計算單元的算力表現。參考ul procyon的cpu integer、gpu float 16以及npu integer測試,三項評分分別為248、987以及1783分,相對此前的銳龍8040系列的處理器來說,銳龍ai max+ 395處理器的cpu ai算力提升不算太大,但gpu和npuai算力提升幅度基本都超過了3倍!

理論性能了解之後,我們看看銳龍ai max+ 395在實際ai應用中的表現。

首先通過ul procyon測試了phi-3.5 4b、mistral 7b、llama 3.1 8b以及llama 2 13b四款經典大語言模型,生成速度分別達到了69.56 tokens/s、44.87 tokens/s、38.01 tokens/s以及25.45 tokens/s,速度非常快。另外值得一提的是,即便是rtx 5060筆記本電腦gpu,因為其作為獨立顯卡也只有可憐的8gb顯存,所以也無法正常運行參數量較大的llama 2大模型,而radeon 8060s不僅成功運行,且生成速度能夠達到25.45 tokens/s,日常應用完全沒有問題。此時,銳龍ai max+ 395平台的獨特優勢就徹底顯現出來了。

接下來我們通過lm studio進行了15b及以下小參數量大語言模型和22b及以上大參數量大語言模型的測試。

首先在各類小參數量稠密大模型測試中可以看到,銳龍ai max+ 395表現非常出色,憑藉內存分配帶來的超大顯存支持,即便是遇到bf16高精度的mistral-small 24b以及gemma 2 27b大模型,生成速度也分別達到了12.37 tokens/s和11.62 tokens/s,表現出色。而對於更高性能的deepseek r1 14b、phi-4 15b,速度也能達到19.63 tokens/s和12.24 tokens/s;低精度的deepseek r1 7b生成速度更是達到了41.94 tokens/s,而deepseek r1 1.5b則達到了92.67 tokens/s,可見在面對小參數量大模型時,銳龍ai max+ 395無論是面對高精度模型還是低精度模型,都能提供足夠快的生成速度。

在面對大參數量大語言模型時,其實首要解決的問題不是能不能使用大模型,而是能不能正常加載大模型。就比如rtx 5060筆記本電腦gpu,雖然其性能比radeon 8060s要強,但如果大模型參數量較大,前者大概率也過不了加載這一關,更別提進一步應用了。

從下圖可以看到,我們在加載qwen3-235b-a22b-iq2_s的moe混合大模型時,內存峰值佔用高達63.6gb,如果沒有128gb超大內存支持的話,加載這一關就過不了。

在各類大參數量大語言模型測試中,qwen3-235b-a22b-iq2_smoe模型生成速度達到了14.72 tokens/s,表現出色;deepseek iq2_m、deepseek r1 distill llama 70b大參數量稠密模型也能夠正常運行,並且可以達到4.91 tokens/s和5.31 tokens/s的生成速度。而q4量化版本的deepseek r1 qwen 32b蒸餾模型以及qwq 32b大模型生成速度分別可以達到9.71 tokens/s和9.79 tokens/s的生成速度。

另外這裡要說明的一點是,qwen3-235b-a22b-iq2_s這個模型雖然參數量達到了235b,但它並非是常見的稠密模型,而是moe(mixture of experts)混合專家模型。簡單來說,moe模型雖然總參數量很大,但以qwen3-235b-a22b-iq2_s模型為例,它雖然擁有235b總參數量,但運行時實際只會調用22b(模型中a22b標識就表示運行時只會調用22b參數量)的參數進行計算,因此對於硬件的壓力要小很多。

也正是因為有着這種大參數、低算力特性,moe模型或許會成為未來大模型發展的主流趨勢。

反之,稠密模型每一次計算都會調用所有參數,這也就是為什麼235b的qwen3-235b-a22b-iq2_s生成速度反而比deepseek r1 32b、qwq 32b大模型要快的原因。

ai測試的最後一部分,我們使用了針對amd銳龍平台打造的amuse這款stable diffusion工具,它支持文生圖、圖生圖、文生視頻等應用,使用起來非常方便。

首先我們使用最近大半年非常火爆的flux.1-dev模型進行了文生圖測試,實測迭代10步,生成一張1024×1024超清圖片用時234.3秒。這個表現雖然不如獨顯,但在集成顯卡里,能順利完成這一任務的此前沒有,radeon 8060s不僅順利完成,而且效率也還不錯,畢竟1024×1024規格的圖片生成,在ai文生圖應用中算是高負載任務了。

其次我們使用了stable diffusion xl turbo模型,進行了2048x2048規格圖片的生成。這款大模型整體精度要低一些,所以對硬件負載的壓力不算太高。普通用戶使用這類大模型進行文生圖就足夠了,沒必要使用flux.1-dev這種超高精度大模型。

可以看到,stable diffusion xl turbo模型生成2048x2048規格圖片耗時僅需12.8秒,每秒迭代次數也達到了2.6次。

總體來說,銳龍ai max+ 395是非常不錯的ai計算平台,配合大內存並通過amd統一內存技術分配給顯存之後,常規的ai應用基本沒有太大壓力,完全可以作為個人或者小型工作室、小型企業用戶的ai終端設備。尤其相比動輒數萬、數十萬元的ai一體機來說,它絕對是一個高性價比的解決方案。