
當地時間7月21日,谷歌deepmind宣布其gemini deep think模型在第66屆國際數學奧林匹克競賽(imo)中取得金牌,首次以官方認證方式跨越這一全球頂尖高中生數學競賽的金牌得分線。這一成就標誌著ai在複雜數學推理能力上的重大突破。
在谷歌deepmind官宣之前,openai在上周六(7月19日)單方面宣布,其實驗性推理模型解答了本屆imo競賽中六道試題中的五道,得分為35分(滿分42分),達到金牌水平。雖openai宣布的成績與谷歌deepmind隨後宣布的成績相同,卻因未正式參賽,且違反imo競賽委員會的信息披露規則,引發業界熱議。
谷歌deepmind官宣獲得金牌
imo是全球最負盛名的數學賽事之一,吸引了來自100多個國家的頂尖高中生。今年,第66屆imo在澳大利亞昆士蘭陽光海岸舉行,630名參賽者中僅有67人(約11%)獲得金牌。谷歌deepmind的gemini deep think模型正式參賽,成功解答五道題目,獲得35分,達到金牌標準,其成績由imo委員會官方認證。
openai研究員亞歷山大·魏發帖宣布獲得金牌
相比之下,openai未正式參與imo競賽,而是通過三位前imo金牌得主獨立評分,宣稱其實驗性推理模型同樣解答了五道題目,達到金牌水平。這一非官方評估引發爭議,因其不僅未經過imo委員會的正式驗證,還違反了該委員會的相關規定。
如何獲獎imo
與以往依賴形式化語言(如lean)或專門數學系統的ai不同,谷歌deepmind的gemini deep think模型採用通用推理方法,直接處理自然語言問題,並在官方規定的每場4.5小時時限內完成解答。
該模型於今年5月谷歌開發者大會上首次亮相,其增強推理模式「deep think」通過並行運行多條推理路徑,整合結果後生成最終答案。谷歌deepmind高級科學家、imo團隊負責人盧唐(thang luong)表示:「我們實現了端到端的自然語言處理,無需人工干預,徹底革新了去年的方法。」
openai的模型同樣以自然語言處理為基礎,通過大規模擴展「測試時計算」實現突破,延長模型思考時間並利用並行計算運行多條推理路徑。openai研究員諾姆·布朗(noam brown)稱此過程「成本極高」,但未透露具體費用。他強調,這一方法展示了ai在數學之外的廣泛推理潛力。然而,openai未正式參賽,其成績未獲imo官方認可,削弱了其宣稱的突破性意義。
谷歌deepmind自去年起與imo官方密切合作,其結果由競賽委員會正式認證。imo委員會要求所有ai實驗室不要搶學生的風頭,在官方結果由獨立專家驗證並向學生授予應得的榮譽後(即7月21日周一)再發布成績。imo主席格雷戈爾·多利納(gregor dolinar)也向媒體確認,合作公司在周一獲准公布結果。也就是這一限制,讓openai「鑽了空子」。
谷歌deepmind首席執行官哈薩比斯發布的貼子
奧特曼在7月19日發布的貼子中宣稱openai模型獲獎
相比之下,由於openai未正式參賽,而是由三位前imo金牌得主獨立評分後於周六閉幕式後宣布結果,隨即引發爭議。在谷歌的成績獲准公布前,openai首席執行官山姆·奧特曼(sam altman)在社交媒體x上大張旗鼓地宣布,openai的一款未公開實驗性大語言模型在2025年imo中達到了金牌水平,成功躋身全球頂尖數學競賽選手行列。

面對爭議,openai的布朗在x上表示,openai幾個月前曾受邀參加正式數學競賽,但因專註於自然語言系統而拒絕,並不知曉imo的安排。
全球數學競賽的最高平台
imo是全球數學競賽的最高平台,旨在鼓勵年輕人對數學的興趣,並通過一系列的複雜題目考察他們的思維與推理能力。每年,來自世界各地的頂尖學生將在代數、幾何、數論等多個領域接受考驗,考試時間為四個半小時,難度之大,挑戰性之強,令其成為全球最具聲望的數學競賽之一。
imo的題目不僅需要學生具備紮實的數學基礎,更考驗其創造性思維和批判性分析能力。每年,數百名來自世界各地的學生參加這項賽事,只有排名前8%的參賽學生能夠獲得金牌。2024年,谷歌deepmind的alphaproof和alphageometry 2模型在imo中答對了四道題,得分為28分,達到銀牌標準。今年,gemini deep think模型的突破表明通用推理模型在數學任務上的潛力,超越了專門設計的數學ai。
對於未來,ai的推理能力有望擴展到更多學科,助力科學家在物理學等領域解決複雜的研究難題。谷歌計劃將gemini deep think提供給數學家測試,並最終向其ai ultra訂閱用戶開放,定價為每月250美元。openai則表示,短期內不會發布這一級別的數學能力模型。(文/騰訊科技特約編譯 無忌 編輯/陸陸)