一场趣味测试在网络热梗引爆了AI圈,八家顶级视觉推理模型被拉上了“看图猜字谜”的擂台,题目从简单的谐音梗到多步推理再到网络流行语,横跨直觉与文化。
开始时,所有AI都能轻松把“鸡打灯照大象”识别出来,答案直指“照相机”;图片里的马拉着松树,也能顺利翻译成“马拉松”。这些模型在基础识别和直接逻辑上没什么压力,表现得相当靠谱。

可题目一升级,AI们的短板立刻显现。像“鸡带着鬼一起喊gogogo”,只有少数模型能反应过来是“机灵鬼”,很多AI不是掉链子,就是死在指令理解上。一张光标点“下载键”和管子一起出现,谐音“下馆子”,有人能想透,有人卡在直译。
等到鸡和橙子组合,文化常识和多步拆字就更考验大家,“鸡少橙多”串起来是“积少成多”,但不少模型还是跑偏了答案。

到最后一个难度,全场哑火。疯了的派大星端坐柿子上,网络一代人都知道这指的是“疯狂星期四”,但AI集体陷入懵圈。派大星的表情、动作的“骑”和“坐”,再加上中文特有的网络语境,早已超出机器学得的范畴。能识别出物体、构建逻辑,还远不是能懂活生生的梗。
这些结果不只是娱乐那么简单。测试背后,其实就是在拉扯AI计算智能和人文感知的界限。所有模型对图片的直白元素处理得都很顺畅,尤其豆包模型,本次测试里拿到总分第一,视觉识别和流程理解双在线。
像Step-3、GPT等也表现不俗,在多模态任务里完全没被全球顶尖平台拉开差距。其实看评分,国产模型已经能打得很有底气了。

但真正考验模型能力的,并不是鸡、马、管子这种“拼拼图式”的题,而是那些需要引申理解、文化浸染以及人际默契的复杂梗。这里头不仅涉及语言谐音、还掺杂动作对位、表情解读和网民语境。对人类而言,“鸡少橙多”、派大星骑柿子,靠的是从小累积的文化经验和社区记忆,AI则完全拿不到这种“暗号”。
连AI模型开发者都发现,不管是多模态处理,还是多层次的切片识别,一到细节,比如图片下划线数量、人物神态变化,模型就容易掉坑,原因正是机器还没办法无缝接入人类的联想链条。
面对“疯狂星期四”,AI缺的不是数据库,而是对生活气氛、群体默契和时代语境的感知。这就好比一台会拼图的机器,遇到一群用彩蛋说话的网友,技术和文化始终有一道坎。

结果也指向了AI进步的下一步。想让智能像人一样“懂梗”,光提升视觉和逻辑远远不够。模型还需要不断学习语言背后的历史、表情里的社会情绪、甚至一代网民独有的爆笑逻辑。只有把这些人文因素纳入智能成长体系,机器才有可能一步步补上和人脑之间的差距。
最有意思的,是这场测验让大家清楚看到了:只是提升计算和识图能力,顶多能把AI培养成“文字功夫高手”;但想让它在日常对话里抓住人情味、仓促出圈,那必须补上文化和情感这课。也许未来有一天,机器真能明白“V我50”,那才是技术和生活彻底融合的时刻。