AI看圖猜梗,能識“雞照相機”,卻總難懂“瘋狂星期四”

一場趣味測試在網絡熱梗引爆了AI圈,八家頂級視覺推理模型被拉上了“看圖猜字謎”的擂台,題目從簡單的諧音梗到多步推理再到網絡流行語,橫跨直覺與文化。


開始時,所有AI都能輕鬆把“雞打燈照大象”識別出來,答案直指“照相機”;圖片里的馬拉着松樹,也能順利翻譯成“馬拉松”。這些模型在基礎識別和直接邏輯上沒什麼壓力,表現得相當靠譜。

可題目一升級,AI們的短板立刻顯現。像“雞帶着鬼一起喊gogogo”,只有少數模型能反應過來是“機靈鬼”,很多AI不是掉鏈子,就是死在指令理解上。一張光標點“下載鍵”和管子一起出現,諧音“下館子”,有人能想透,有人卡在直譯。


等到雞和橙子組合,文化常識和多步拆字就更考驗大家,“雞少橙多”串起來是“積少成多”,但不少模型還是跑偏了答案。

到最後一個難度,全場啞火。瘋了的派大星端坐柿子上,網絡一代人都知道這指的是“瘋狂星期四”,但AI集體陷入懵圈。派大星的表情、動作的“騎”和“坐”,再加上中文特有的網絡語境,早已超出機器學得的範疇。能識別出物體、構建邏輯,還遠不是能懂活生生的梗。


這些結果不只是娛樂那麼簡單。測試背後,其實就是在拉扯AI計算智能和人文感知的界限。所有模型對圖片的直白元素處理得都很順暢,尤其豆包模型,本次測試里拿到總分第一,視覺識別和流程理解雙在線。


像Step-3、GPT等也表現不俗,在多模態任務里完全沒被全球頂尖平台拉開差距。其實看評分,國產模型已經能打得很有底氣了。

但真正考驗模型能力的,並不是雞、馬、管子這種“拼拼圖式”的題,而是那些需要引申理解、文化浸染以及人際默契的複雜梗。這裡頭不僅涉及語言諧音、還摻雜動作對位、表情解讀和網民語境。對人類而言,“雞少橙多”、派大星騎柿子,靠的是從小累積的文化經驗和社區記憶,AI則完全拿不到這種“暗號”。


連AI模型開發者都發現,不管是多模態處理,還是多層次的切片識別,一到細節,比如圖片下劃線數量、人物神態變化,模型就容易掉坑,原因正是機器還沒辦法無縫接入人類的聯想鏈條。


面對“瘋狂星期四”,AI缺的不是數據庫,而是對生活氣氛、群體默契和時代語境的感知。這就好比一台會拼圖的機器,遇到一群用彩蛋說話的網友,技術和文化始終有一道坎。

結果也指向了AI進步的下一步。想讓智能像人一樣“懂梗”,光提升視覺和邏輯遠遠不夠。模型還需要不斷學習語言背後的歷史、表情里的社會情緒、甚至一代網民獨有的爆笑邏輯。只有把這些人文因素納入智能成長體系,機器才有可能一步步補上和人腦之間的差距。


最有意思的,是這場測驗讓大家清楚看到了:只是提升計算和識圖能力,頂多能把AI培養成“文字功夫高手”;但想讓它在日常對話里抓住人情味、倉促出圈,那必須補上文化和情感這課。也許未來有一天,機器真能明白“V我50”,那才是技術和生活徹底融合的時刻。