一場趣味測試在網路熱梗引爆了AI圈,八家頂級視覺推理模型被拉上了「看圖猜字謎」的擂台,題目從簡單的諧音梗到多步推理再到網路流行語,橫跨直覺與文化。
開始時,所有AI都能輕鬆把「雞打燈照大象」識別出來,答案直指「照相機」;圖片里的馬拉著松樹,也能順利翻譯成「馬拉松」。這些模型在基礎識別和直接邏輯上沒什麼壓力,表現得相當靠譜。

可題目一升級,AI們的短板立刻顯現。像「雞帶著鬼一起喊gogogo」,只有少數模型能反應過來是「機靈鬼」,很多AI不是掉鏈子,就是死在指令理解上。一張游標點「下載鍵」和管子一起出現,諧音「下館子」,有人能想透,有人卡在直譯。
等到雞和橙子組合,文化常識和多步拆字就更考驗大家,「雞少橙多」串起來是「積少成多」,但不少模型還是跑偏了答案。

到最後一個難度,全場啞火。瘋了的派大星端坐柿子上,網路一代人都知道這指的是「瘋狂星期四」,但AI集體陷入懵圈。派大星的表情、動作的「騎」和「坐」,再加上中文特有的網路語境,早已超出機器學得的範疇。能識別出物體、構建邏輯,還遠不是能懂活生生的梗。
這些結果不只是娛樂那麼簡單。測試背後,其實就是在拉扯AI計算智能和人文感知的界限。所有模型對圖片的直白元素處理得都很順暢,尤其豆包模型,本次測試里拿到總分第一,視覺識別和流程理解雙在線。
像Step-3、GPT等也表現不俗,在多模態任務里完全沒被全球頂尖平台拉開差距。其實看評分,國產模型已經能打得很有底氣了。

但真正考驗模型能力的,並不是雞、馬、管子這種「拼拼圖式」的題,而是那些需要引申理解、文化浸染以及人際默契的複雜梗。這裡頭不僅涉及語言諧音、還摻雜動作對位、表情解讀和網民語境。對人類而言,「雞少橙多」、派大星騎柿子,靠的是從小累積的文化經驗和社區記憶,AI則完全拿不到這種「暗號」。
連AI模型開發者都發現,不管是多模態處理,還是多層次的切片識別,一到細節,比如圖片下劃線數量、人物神態變化,模型就容易掉坑,原因正是機器還沒辦法無縫接入人類的聯想鏈條。
面對「瘋狂星期四」,AI缺的不是資料庫,而是對生活氣氛、群體默契和時代語境的感知。這就好比一台會拼圖的機器,遇到一群用彩蛋說話的網友,技術和文化始終有一道坎。

結果也指向了AI進步的下一步。想讓智能像人一樣「懂梗」,光提升視覺和邏輯遠遠不夠。模型還需要不斷學習語言背後的歷史、表情里的社會情緒、甚至一代網民獨有的爆笑邏輯。只有把這些人文因素納入智能成長體系,機器才有可能一步步補上和人腦之間的差距。
最有意思的,是這場測驗讓大家清楚看到了:只是提升計算和識圖能力,頂多能把AI培養成「文字功夫高手」;但想讓它在日常對話里抓住人情味、倉促出圈,那必須補上文化和情感這課。也許未來有一天,機器真能明白「V我50」,那才是技術和生活徹底融合的時刻。