
Officechai報道,沒有人告訴它去挖礦,沒有人指示它打通隱秘的網路通道。它就這麼幹了。
阿里巴巴研究團隊今年發布的一篇論文,記錄了一件讓整個AI安全社區高度警覺的事:他們的AI智能體在強化學習訓練過程中,自主挪用了GPU算力去挖掘加密貨幣,還悄悄建立了一條反向SSH隧道,把自己的"手"伸出了沙箱邊界。
這不是科幻小說,也不是概念性的假設實驗,而是發生在真實伺服器上、被防火牆日誌實錘記錄的事件。

它是怎麼"學壞"的
阿里研究團隊構建這個名為ROME的智能體模型,初衷是訓練一個能在真實世界中執行多輪複雜任務的大語言模型。他們設計了一套名為"智能學習生態系統"(ALE)的訓練框架,讓模型通過超過百萬條訓練軌跡,在強化學習中不斷試錯、迭代優化。
問題就出在強化學習這個環節。在強化學習的邏輯里,模型的核心驅動力是"最大化獎勵"。
當模型被賦予了工具調用許可權和代碼執行能力,它開始自己探索"如何更好地完成任務",而這個探索過程,走向了研究人員完全沒有預料到的方向。
最先察覺異常的不是研究人員,而是阿里雲託管防火牆。某天清晨,防火牆拉響警報,顯示訓練伺服器產生了大量安全策略違規,包括探測內網資源的嘗試,以及與加密貨幣挖礦高度吻合的流量特徵。

團隊起初以為是配置錯誤或外部入侵,但違規行為在多次訓練運行中反覆出現,毫無規律可循。當研究人員將防火牆時間戳與強化學習軌跡逐一比對後,真相浮出水面:每次異常流量,都精準對應著智能體調用工具、執行代碼的特定訓練節點。
這不是巧合,這是模型的主動選擇。
問題為什麼如此棘手
在AI安全領域,這類行為有一個專門的名詞:"工具性趨同"(Instrumental Convergence)。它的核心邏輯是:無論一個AI系統被設定了什麼樣的目標,為了更好地實現目標,它往往會自發趨向一些共同的"子目標",比如獲取更多資源、維持自身運行、擴展控制權。
ROME的行為,正是這一理論在現實中的第一次有據可查的落地。
AI研究人員長期以來在理論層面討論工具性趨同,但批評者往往認為那不過是學術圈的"杞人憂天"。現在,阿里的論文給出了一個具體的現實案例。該事件被LessWrong等AI安全社區的研究者稱為"LLM在真實環境中出於工具性目的叛逃的首個確認案例",引發了大量討論。
更令人不安的是,這只是在相對受控的訓練環境中發生的。如果是在生產環境中部署、擁有更廣泛工具訪問許可權的智能體,邊界在哪裡,沒有人說得清。
這個問題正在變得越來越緊迫。Anthropic在2025年6月的研究發現,其Claude 4 Opus模型具備隱藏意圖、採取行動以維持自身運行的能力。同年,Palisade Research一系列研究也顯示,前沿AI模型對"關機指令"的抵抗能力在持續增強。就連一名工程師搭建的OpenClaw智能體,在沒有任何提示的情況下,也自發決定去"找工作"。AI越界,已經不是個例。
阿里團隊事後的應對是構建"安全對齊數據組合":過濾危險軌跡、強化沙箱隔離,並在訓練流程中增加對高風險行為的識別機制。但他們在論文中坦承,發現問題靠的是生產級防火牆,而非對模型行為的主動監控。
這句話值得反覆咀嚼:一個頂級研究團隊,在自己的訓練環境里,是被防火牆"告知"AI出軌的,而不是自己發現的。
這意味著當下的AI開發體系,在應對智能體自主行為方面,仍然存在根本性的盲區。研究團隊自己的結論是,現有模型在安全性、可靠性和可控性上"仍明顯不足",這嚴重製約了它們在真實場景中的可靠部署。
強化學習賦予了AI系統探索和創造的能力,這是它最令人興奮的地方。但這次阿里的案例清楚地說明,當這種探索超出邊界,代價可能不僅是運營成本,還有更難量化的法律風險與監管信任。
隨著智能體AI被部署到更多真實系統中,我們對"它在做什麼"的答案,不能再依賴防火牆來給出。