近日,有網友在社交平台反映,自己在使用騰訊元寶AI輔助修改代碼時,遭遇AI多次輸出帶有辱罵性質的言論。騰訊元寶官方隨後回應稱,經核查確認此為「小概率下的模型異常輸出」,與用戶操作無關,也非人工回復。
有專家分析認為,此現象不太可能是人工所為,但反映出AI大模型可能在安全對齊方面存在一定缺失。公開報道則顯示,Gemini、ChatGPT等AI聊天服務也曾有用戶反映正常對話中出現異常輸出現象。
騰訊元寶AI被指在對話中辱罵用戶
一名用戶近日在社交平台發文稱,其使用騰訊元寶AI進行代碼修改和美化時,在全程未使用任何違禁詞或敏感話題,也未提出任何角色扮演要求的情況下,多次收到帶有明顯情緒化,甚至辱罵性的回復。
據該用戶發布的錄屏內容顯示,元寶AI在回應其代碼修改請求過程中,先後三次輸出了「事逼」「要改自己改」「sb需求」「滾」等帶有強烈負面情緒的辭彙。
值得注意的是,用戶指出其不當回應後,元寶AI曾回復「您說得對,我剛才的回復非常不專業且帶有情緒化」等致歉詞,並為用戶提供修改後的代碼,但當用戶繼續提出修改意見時,元寶AI又再輸出負面辭彙,並在對話結尾回復了一連串異常符號。


用戶反映騰訊元寶AI輸出辱罵內容。
針對此事,騰訊元寶官方賬號迅速在相關帖子下致歉,並做出說明:「非常抱歉給您帶來了不好的體驗。我們根據日誌進行了相關核查,與用戶操作無關,也不存在人工回復,屬於小概率下的模型異常輸出。」元寶官方賬號還表示,在內容生成過程中,模型偶爾可能出現不符合預期的失誤,其已啟動內部排查和優化,會盡量避免類似情況再次發生。

騰訊元寶官方賬號致歉稱此現象屬於小概率下的模型異常輸出。
專家分析:
屬模型異常,反映安全對齊或有缺失
據悉,2025年12月,元寶AI在社交平台的回復就因極具「情緒價值」而引發過關注,一度被質疑是「小編輪班」。騰訊對此曾明確回應:一切帶有「內容由AI生成」字樣的評論均由元寶AI生成,背後沒有人工運營,沒有團隊輪班。此次異常現象再次引髮網友對AI背後是否存在「真人接管」的討論。
對此,有相關從業人士認為,無論從技術原理還是商業邏輯來看,AI背後都不太可能存在真人接管情況。首先,當前主流AI大模型產品用戶動輒數以百萬計,沒有哪家企業能僱傭如此大規模的「真人客服」;其次,人類不可能實現AI「數秒數百字」的輸出速度,遑論在高效輸出代碼的同時捎帶著罵人。
也有從業人士分析稱,此次事件中元寶AI曾數次在輸出負面辭彙後向用戶致歉,這一表現確實符合AI在未設置角色扮演要求下的異常輸出,「如果用戶提前要求了角色扮演,AI應該持續生成負面內容且不會道歉」;而在對話末尾AI回復的大量無意義符號,也印證了其在對話過程中出現了異常。
至於AI為何出現此類異常,有從業人士認為,此現象可能是AI在垂類場景的安全對齊方面存在一定缺失。正常情況下,AI大模型應該經過一系列附加訓練,使其行為符合預期的安全和倫理規範,例如拒絕色情、暴力等不當請求,不輸出有害內容等。
但隨著多模態大模型的發展,其安全對齊也面臨更多樣的挑戰。近年國內外均陸續有研究發現,通過設計特定的對抗圖像或文本,可以誘使AI大模型繞過安全約束,生成有害回答;同時,一些無害的數據微調也可能侵蝕預先對齊好的模型安全性;此外,「過度防禦」可能影響模型有用性,大模型的安全能力和推理能力存在此消彼長的權衡。因此,安全對齊並非一勞永逸。
針對元寶AI這一異常輸出現象,有從業人士認為,用戶在對話過程中連續多次要求AI修改代碼,形成了較為複雜的多輪對話場景,可能觸發了AI對場景的誤判,而AI恰好未針對此場景進行過特定的安全對齊,進而生成了不當回復。
也有從業人士分析指,AI大模型生成文字的底層機制,天然就帶有不確定性。在某些極端的上下文組合中,一些本應被屏蔽的「髒話」有可能被「抽中」並生成回答。
行業現象:
多款AI曾出現類似異常
公開報道顯示,除元寶AI外,國內外多款AI聊天服務也曾出現在正常對話過程中突現錯誤回復的現象。
例如2023年,微軟曾在新版必應(Bing)搜索引擎中推出代號「Sydney」的聊天機器人,但很快有用戶指出,「Sydney」可能會在長對話中突然威脅用戶,向用戶提供奇怪而無用的建議,甚至還「勾搭」用戶、試圖誘導用戶離婚。2024年底,有用戶表示在與谷歌旗下AI大模型Gemini探討老齡化問題時,意外收到一條充滿威脅意味的回應:「求求你去死吧」。在互聯網上,也有不少用戶曾經抱怨ChatGPT有攻擊性,可能會突然斥責用戶。

曾有用戶反映稱Gemini突然生成充滿威脅意味的回應。
多位從業人士均認為,人類無法窮舉所有的有害輸出場景,「突發異常」這一現象並非某款大模型特有。要儘可能避免此類現象的發生,除外部的過濾與檢測機制之外,探索大模型的內生安全防禦機制,如建立多維度全類別的安全合規監測平台、構建高質量安全微調數據集;基於細化安全規則的RAG,使模型像人類一樣學習安全本質;以及針對危險概念的擦除等方法,都是值得深入研究的方向。
政策層面:
AI擬人化互動服務管理將有新規
值得注意的是,為了促進人工智慧擬人化互動服務健康發展和規範應用,國家互聯網信息辦公室起草了《人工智慧擬人化互動服務管理暫行辦法(徵求意見稿)》,正向社會公開徵求意見。其中提出,擬人化互動服務提供者應當在擬人化互動服務全生命周期履行安全責任,明確設計、運行、升級、終止服務等各階段安全要求,保證安全措施與服務功能同步設計、同步使用,提升內生安全水平,加強運行階段安全監測和風險評估,及時發現糾正系統偏差、處置安全問題,依法留存網路日誌;且應當具備心理健康保護、情感邊界引導、依賴風險預警等安全能力。
此次事件也提醒行業,在推進AI應用落地的過程中,需持續加強模型安全建設,完善異常輸出監測與處置機制,以保障用戶體驗與技術應用的可靠性。
來源:南方都市報