OpenAI剛推出的GPT-5.4 mini,Day0就已經被嫌棄了。
根據公開的大語言模型評測基準Vals,今天新出的GPT-5.4 mini僅排行第13名,優於OpenAI半年前發佈的GPT-5。

值得一提的是,排行第12的是一月底出的的Kimi 2.5,而Kimi 2.5比新出的5.4mini便宜一倍多,延遲還更低。
在同步的拓撲證明中,新出的mini和nano模型在全球範圍內表現也只是中規中矩,分別排行第九第十,不如早前發佈的Kimi、Qwen、DeepSeek等模型。
(OpenAI後來居下這一塊)

還有人指出,這次GPT‑5.4 mini的baseline對比的是老GPT‑5 mini(運行速度快兩倍),也就是大半年前的版本,而不是其他廠家的新模型。

不少網友甚至直言,換新GPT‑5.4 mini「還真沒必要」。

雖然OpenAI的博客表示,在輸出tokens 上,性能近似的mini版本比GPT‑5.4便宜三倍,nano版本則幾乎便宜十二倍。
但如果你拿GPT‑5.4 mini與舊版GPT‑5 mini對比,會發現同為mini檔的模型,價格卻上漲了大約三倍。

可以說,在龍蝦熱中,全球所有模型廠家都在漲價,奧特曼這麼精的小子自然也沒放過。
所以,這是拿着專門優化過編程和agent的小模型就來了?
新版mini和nano模型
今天,OpenAI推出主打快速和經濟的GPT-5.4 mini和nano模型,專門針對編程、計算機操作、多模態理解以及子代理(subagent)做了優化。

相比前代GPT‑5mini,新版mini和nano在性能上有不錯的提升,同時運行速度提升超過兩倍。

值得注意的是,在多個評測中,mini/nano模型與滿血版GPT‑5.4的差距已經不大,性能上也基本與谷歌,Anthropic的輕量模型持平。

根據OpenAI官方博客,新模型主打編程和子代理。

其中,GPT‑5.4 mini在編程、推理、多模態理解和工具使用方面進行了優化,運行速度提升超過兩倍,在SWE-Bench Pro和OSWorld-Verified等評測中表現接近滿血版GPT‑5.4。

GPT‑5.4 nano則是GPT‑5.4系列中最小、最經濟的版本,適合速度和成本敏感的任務,例如分類、數據提取、排序,以及處理較簡單的輔助編程任務。
總的來說,這倆新模型適合延遲直接影響產品體驗的工作負載,比如編碼助手、子代理、屏幕截圖解析、多模態應用。
說白了就是龍蝦這類已經抽象出skill的agent,部署在mini/nano這類反應快速,能力夠用的小模型就更實惠。
在具體的使用上,GPT‑5.4 mini可在API、Codex和ChatGPT中調用,而nano僅能通過API使用。
價格方面,mini版本每百萬輸入tokens0.75美元,每百萬輸出tokens4.5美元。Nano版本在API中費用更低,每百萬輸入0.2美元,每百萬輸出1.25美元。
不過,橫向對比來看,有網友指出,Gemini Flash 3 lite則更智能,而且總體要便宜六倍多。

評測結果
在實際評測中,mini和nano主要是針對編程和Agent任務做了優化。
在編程任務中,它們能夠低延遲完成代碼修改、調試循環和庫導航,快速迭代,高效處理需要速度和成本兼顧的工作流程。
Mini的通過率接近GPT‑5.4,同時速度更快。

在子代理場景中,開發者可以讓大模型負責決策和規劃,同時將較小的任務並行委派給mini子代理,比如搜索代碼庫、處理文檔或輔助操作。
隨着小型模型越來越快,這種模式的價值愈發凸顯。
在計算機操作和多模態任務中,mini表現同樣出色,能夠快速解析複雜用戶界面截圖,高效完成操作任務。
在OSWorld-Verified測試中,它的表現幾乎接近滿血版GPT‑5.4,同時明顯優於GPT‑5 mini。

有些網友的實際測試也佐證了這些亮點。
reddit網友Rent_South系統地測試新版mini在分類、總結、翻譯等任務上的表現,並給出了高度評價:
我在它們身上跑了些基準測試,結果發現——在一些真實場景任務中,它們更便宜、更快,也更好用。自從大約一年前,我在構建一個RAG流水線時,gpt‑4.1-mini在某些代理任務步驟上打敗了GPT‑4原版之後,我對mini/nano版本的熱情就比對原版還高。
在分類任務中,nano準確率達70%,成本比GPT‑5.4降低十二倍。

當調用超過超過一萬次時,GPT-5.4大約花費20.30美元,GPT-5.4-nano則只有1.64美元,節省幅度約91.9%。
在翻譯任務上,nano得分略低,為55分,但與GPT‑5.4的63分差距不大,仍可作為替代選擇。在超萬次調用後,節省幅度仍達到了91.3%!

在寫作任務中,mini版本反倒得分最高,成本比滿血版低約六成。在超過1萬次調用時,mini花費29.61美金,nano僅花費10.30美金。

此外,還有網友測試了模型描述圖片的能力,nano在描述博物館照片時,輸出詳細準確,使用token極少,總成本甚至不到一分錢。
比如,這位網友讓nano模型描述自己隨手拍的博物館的照片:

nano模型輸出了以下描述:
圖片顯示了一間博物館展廳的內部,有一面長長的展牆。白色磚牆上整齊排列着許多裝框肖像畫。肖像畫下方是多個玻璃展示櫃,木框深色,頂部/前方為玻璃,展示櫃內擺放着各種歷史文物和設備。房間鋪設了拋光木地板,吊頂上有懸掛燈具及電線,牆頂附近可見少量管道。前景中,沿房間長度排列的玻璃櫃映出了其他展區的物品。
生成這麼一段描述這次操作用了2751個輸入tokens和112個輸出tokens,費用為0.069美分(不到一分錢的十分之一)。
即便在創意任務上,如生成鵜鶘騎單車的SVG圖,nano和mini與滿血版GPT‑5.4仍有一定差距,但它們完成基礎創作任務完全可行。
起碼隨着推理強度的提升,我們能看到畫面可以保持相對的正確性。

整體看下來,這次模型跟OpenAI自家的產品來比,的確是可圈可點。
但對於這是否就是市面上最好的、最經濟的小模型,還有待討論。
one more thing
有趣的是,在OpenAI總裁Greg Brockman發佈新模型的評論區,最火熱的討論居然不是新模型的能力,也不是價格,甚至幾乎和新模型本身沒有關係。

評論區里刷屏的,幾乎全是帶keep4o標籤的:「讓4o回來!」



參考鏈接
[1]https://x.com/gdb/status/2034003374627049909
[2]https://simonwillison.net/2026/Mar/17/mini-and-nano/
[3]https://www.reddit.com/r/OpenAI/comments/1rwd9hd/breaking_openai_just_dropped_gpt54_mini_and_nano/
[4]https://x.com/scaling01/status/2033958931874099560
本文來自微信公眾號「量子位」,作者:henry ,36氪經授權發佈。