告別人類獎勵:視覺-語言Agent學會持續自進化了!

2025年11月30日19:23:05 科技 1416

告別人類獎勵:視覺-語言Agent學會持續自進化了! - 天天要聞

人工智慧領域長期存在一個悖論:模型的進化往往依賴於人類提供的反饋信號,但人類標註者的主觀性和認知局限本身就構成了模型能力的天花板。北卡羅萊納大學教堂山分校的研究團隊在最新論文中提出的Agent0-VL框架,試圖通過一種巧妙的"雙重人格"機制打破這一循環——讓同一個視覺-語言模型既充當問題解決者,又扮演嚴格的驗證者角色,在兩種身份的動態切換中實現無需外部獎勵的持續自我進化。這項研究不僅在幾何推理和視覺科學分析任務上取得了超過百分之十二的性能提升,更重要的是為構建真正自主學習的人工智慧系統提供了新的技術路徑。

當前主流的視覺-語言模型訓練範式高度依賴人工標註的偏好數據或環境生成的反饋信號。這種依賴帶來多重問題:首先,人類標註者在評估複雜視覺推理過程時難免帶有主觀偏好,不同標註者對同一答案的質量判斷可能存在顯著差異;其次,標註成本隨著模型能力提升而呈指數級增長,頂尖專家標註一個高質量樣本可能需要數小時;第三,環境反饋往往是稀疏且不連續的,難以為多步驟推理提供細粒度的指導信號。

告別人類獎勵:視覺-語言Agent學會持續自進化了! - 天天要聞

自我獎勵陷阱與視覺捷徑問題

為突破外部反饋的限制,近年來湧現出一批自我獎勵學習研究,核心思想是讓模型自己充當評判者,為自身學習提供獎勵信號。這種方法在純文本領域已顯示出一定潛力,但在視覺-語言任務中面臨嚴峻挑戰。最核心的問題是"評估幻覺"——模型傾向於走語言捷徑,僅基於文本描述的表面合理性進行評判,而忽略對視覺內容的真實理解。

告別人類獎勵:視覺-語言Agent學會持續自進化了! - 天天要聞

告別人類獎勵:視覺-語言Agent學會持續自進化了! - 天天要聞

告別人類獎勵:視覺-語言Agent學會持續自進化了! - 天天要聞

具體而言,當要求模型評估一個關於圖像的推理答案時,它可能給出一個語言上流暢、邏輯上自洽但視覺上完全錯誤的高分評價。例如在幾何問題中,模型可能獎勵一個計算步驟描述詳細但數值錯誤的答案,懲罰一個表述簡潔但視覺測量準確的答案。這種評估偏差不僅無法促進學習,反而會強化錯誤模式,使模型陷入"自我確認偏誤"的惡性循環。

告別人類獎勵:視覺-語言Agent學會持續自進化了! - 天天要聞

告別人類獎勵:視覺-語言Agent學會持續自進化了! - 天天要聞

告別人類獎勵:視覺-語言Agent學會持續自進化了! - 天天要聞

北卡羅萊納大學團隊敏銳地意識到,解決這一問題的關鍵不在於改進評估演算法本身,而在於為評估過程引入客觀的視覺證據錨點。這正是Agent0-VL框架的核心創新所在——通過工具調用機制,讓驗證過程建立在可驗證的視覺測量和計算結果之上,而非僅依賴語言推理的內在一致性。

解決者與驗證者的動態協同

Agent0-VL的架構設計體現了一種"分裂人格"式的智能。在解決者模式下,模型接收包含圖像和問題的輸入,逐步分析問題結構,將複雜任務分解為可處理的子步驟。當遇到需要精確計算或視覺測量的環節時,模型不是依靠內部參數進行近似估計,而是主動調用外部工具——計算器用於數學運算,視覺檢測器用於識別和定點陣圖像中的特定元素,測量工具用於獲取距離、角度等幾何參數。

告別人類獎勵:視覺-語言Agent學會持續自進化了! - 天天要聞

告別人類獎勵:視覺-語言Agent學會持續自進化了! - 天天要聞

告別人類獎勵:視覺-語言Agent學會持續自進化了! - 天天要聞

這種工具集成策略顯著降低了推理過程中的累積誤差。傳統視覺-語言模型在處理涉及數值計算的任務時,常常因浮點運算的不精確性導致結果偏差,而這些偏差在多步推理中會被放大。通過將精確計算外包給專用工具,Agent0-VL確保了每個推理步驟的可靠性基礎。

更關鍵的是驗證者角色的設計。當模型切換到驗證模式時,它不再是單純地"看"推理過程是否合理,而是主動調用工具對關鍵步驟進行獨立驗證。例如在幾何證明任務中,驗證者可能使用視覺檢測工具重新測量圖形中的角度和邊長,將測量結果與解決者的陳述進行比對。如果發現不一致,驗證者會生成具體的反饋信息,指出哪個步驟存在問題以及如何修正。

這種基於工具驗證的機制建立了一個客觀的評判標準。無論語言描述多麼流暢,如果與視覺工具的測量結果矛盾,就會被標記為錯誤。這有效避免了純語言自我評估中的捷徑問題,使模型的自我反思建立在事實基礎之上。

零外部獎勵的進化循環

Agent0-VL實現持續進化的核心機制是雙層迭代架構。內循環聚焦於單個問題的推理優化:模型生成初步答案,驗證者檢查並提供反饋,解決者根據反饋修正推理,如此往複直到達到滿意的解決方案或超過預設的迭代次數。這個過程類似於人類專家的自我糾錯——不是一次性給出完美答案,而是通過反覆審視和修正逐步逼近正確結果。

外循環則負責模型參數的更新。研究團隊採用群組相對策略優化作為訓練演算法,這是一種近期在大語言模型強化學習中展現出色效果的方法。與傳統強化學習需要單獨訓練一個價值網路不同,GRPO通過比較同一提示的多個生成結果的相對質量來估計優勢函數,從而省去了與策略模型同等規模的評論者模型,大幅降低了計算開銷。

具體而言,對於每個訓練樣本,模型會生成多個候選答案,形成一個樣本組。通過內循環的推理-驗證過程,每個候選答案會得到一個基於工具驗證的客觀分數。GRPO演算法計算這些候選答案在組內的相對排名,鼓勵模型增加高質量答案的生成概率,抑制低質量答案。由於評估基於工具驗證而非外部標註,整個過程不需要人類介入,實現了真正的自主學習。

從分布不一致到自洽性對齊

Agent0-VL的理論創新在於將學習目標從傳統的獎勵最大化轉變為"分布自一致性"。傳統強化學習假設存在一個外部定義的獎勵函數,模型的目標是最大化期望累積獎勵。但在自我進化場景中,獎勵本身由模型生成,如果模型的推理能力和評估能力不匹配,就會出現分布不一致——模型生成了自己的評估標準無法正確判斷的答案,或者評估標準過於寬鬆導致低質量答案獲得高分。

Agent0-VL通過強制推理和驗證使用相同的工具集來實現對齊。當解決者和驗證者都依賴同一套視覺工具和計算工具時,它們對"什麼是正確答案"的理解趨於一致。這種一致性通過訓練過程不斷強化——那些能夠通過驗證者工具檢查的推理策略獲得正反饋,無法通過檢查的策略被抑制。隨著訓練進行,模型的推理能力和驗證能力協同提升,形成良性循環

實驗結果驗證了這一設計的有效性。在幾何推理和視覺科學分析任務上,Agent0-VL相比基礎模型實現了百分之十二點五的性能提升。更重要的是,當將訓練後的模型作為過程獎勵模型獨立使用時,它能夠為其他模型的測試時擴展提供可靠的分步評估,將整體性能進一步提升百分之七點三。這表明Agent0-VL學到的不僅是特定任務的解決方案,更是一種通用的視覺推理驗證能力。

挑戰、局限與未來方向

儘管取得了顯著進展,Agent0-VL框架仍面臨多重挑戰。首先是工具依賴性問題。當前實現依賴於預先定義的工具集,包括計算器、幾何測量工具、物體檢測器等。如果任務超出這些工具的覆蓋範圍,模型的驗證能力就會受限。如何讓模型自主發現或創建新工具,是一個開放性問題。

其次是計算成本。雙重角色切換和多輪推理-驗證循環顯著增加了推理時間和計算開銷。在簡單任務上,這種開銷可能得不償失。研究團隊需要開發自適應機制,根據任務複雜度動態調整驗證深度和迭代次數。

從更宏觀角度看,Agent0-VL代表了人工智慧研究中一個重要轉向:從依賴外部監督的被動學習,轉向基於內在驅動的主動進化。這種範式轉變呼應了認知科學中關於元認知和自我反思的理論——智能不僅體現在解決問題的能力上,更體現在評估和改進自身表現的能力上。隨著更多研究沿著這一方向深入,我們或許正在接近構建真正自主、持續學習的人工智慧系統的目標。當機器學會質疑自己的推理、驗證自己的結論並從錯誤中學習時,人工智慧與人類智能之間的界限將變得更加模糊。

科技分類資訊推薦

引領科技豪華MPV新風尚 第二代騰勢D9西安車展亮相 - 天天要聞

引領科技豪華MPV新風尚 第二代騰勢D9西安車展亮相

兼具宜商氣度與家用溫情的科技豪華旗艦MPV,第二代騰勢D9迎來西安地區正式亮相。新車依託全球新能源MPV冠軍底蘊,以第二代刀片電池、雙閥雲輦-C、天神之眼5.0智駕等核心技術全面升級,兼顧商務體面與家庭舒適,為西北高端用戶帶來一站式全能出行解決方案。
採購禁入!科華數據材料造假被拒門外 - 天天要聞

採購禁入!科華數據材料造假被拒門外

本報(chinatimes.net.cn)記者胡雅文 北京報道這家趕上AI算力風口的公司,因投標材料造假,被相關採購方列入禁入名單兩年,其此前提出的複議申請也被正式駁回。相關採購平台近日發布公告,明確駁回科華數據股份有限公司(下稱「科華數據」,002335.SZ)此前提交的複議申請。早在一年前,科華數據已被認定在「信息通信樞紐...
快評樂道L80:15萬元級買大五座,這波值得沖? - 天天要聞

快評樂道L80:15萬元級買大五座,這波值得沖?

日前,樂道L80正式發布並開啟預售,其整車購買預售價為24.58萬元起,租電購買預售價則低至15.98萬元起。面對大型SUV市場「細分再細分」之競爭趨勢,這款樂道年度重磅新車都有哪些優勢?又能否成為「大五座SUV革新之作」?下面,圈哥就帶大家全方位感受。
成都直擊凱威德:純電全尺寸SUV的張揚與大氣 - 天天要聞

成都直擊凱威德:純電全尺寸SUV的張揚與大氣

4月22日,凱迪拉克以奧斯卡級盛典規格,將上海保利大劇院點亮為璀璨舞台,在品牌代言人倪妮與全場嘉賓的共同見證下,凱迪拉克全尺寸純電公路旗艦——凱威德耀然上市。新車共推出長續航四驅Pro、高性能四驅Ultra兩款配置,官方售價區間為46.88萬-50.88萬元。