同樣都獲得IMO「奧數」金牌,谷歌獲贊,OpenAI卻引發爭議

2025年07月22日21:30:27 科技 6023

同樣都獲得IMO「奧數」金牌,谷歌獲贊,OpenAI卻引發爭議 - 天天要聞

當地時間7月21日,谷歌deepmind宣布其gemini deep think模型在第66屆國際數學奧林匹克競賽(imo)中取得金牌,首次以官方認證方式跨越這一全球頂尖高中生數學競賽的金牌得分線。這一成就標誌著ai在複雜數學推理能力上的重大突破。

在谷歌deepmind官宣之前,openai在上周六(7月19日)單方面宣布,其實驗性推理模型解答了本屆imo競賽中六道試題中的五道,得分為35分(滿分42分),達到金牌水平。openai宣布的成績與谷歌deepmind隨後宣布的成績相同,卻因未正式參賽,且違反imo競賽委員會的信息披露規則,引發業界熱議。

同樣都獲得IMO「奧數」金牌,谷歌獲贊,OpenAI卻引發爭議 - 天天要聞谷歌deepmind官宣獲得金牌

imo是全球最負盛名的數學賽事之一,吸引了來自100多個國家的頂尖高中生。今年,第66屆imo在澳大利亞昆士蘭陽光海岸舉行,630名參賽者中僅有67人(約11%)獲得金牌。谷歌deepmind的gemini deep think模型正式參賽,成功解答五道題目,獲得35分,達到金牌標準,其成績由imo委員會官方認證。

同樣都獲得IMO「奧數」金牌,谷歌獲贊,OpenAI卻引發爭議 - 天天要聞openai研究員亞歷山大·魏發帖宣布獲得金牌

相比之下,openai未正式參與imo競賽,而是通過三位前imo金牌得主獨立評分,宣稱其實驗性推理模型同樣解答了五道題目,達到金牌水平。這一非官方評估引發爭議,因其不僅未經過imo委員會的正式驗證,還違反了該委員會的相關規定。

如何獲獎imo

與以往依賴形式化語言(如lean)或專門數學系統的ai不同,谷歌deepmind的gemini deep think模型採用通用推理方法,直接處理自然語言問題,並在官方規定的每場4.5小時時限內完成解答

該模型於今年5月谷歌開發者大會上首次亮相,其增強推理模式「deep think」通過並行運行多條推理路徑,整合結果後生成最終答案。谷歌deepmind高級科學家、imo團隊負責人盧唐(thang luong)表示:「我們實現了端到端的自然語言處理,無需人工干預,徹底革新了去年的方法。」

openai的模型同樣以自然語言處理為基礎,通過大規模擴展「測試時計算」實現突破,延長模型思考時間並利用並行計算運行多條推理路徑。openai研究員諾姆·布朗(noam brown)稱此過程「成本極高」,但未透露具體費用。他強調,這一方法展示了ai在數學之外的廣泛推理潛力。然而,openai未正式參賽,其成績未獲imo官方認可,削弱了其宣稱的突破性意義。

谷歌deepmind自去年起與imo官方密切合作,其結果由競賽委員會正式認證。imo委員會要求所有ai實驗室不要搶學生的風頭,在官方結果由獨立專家驗證並向學生授予應得的榮譽後(即7月21日周一)再發布成績。imo主席格雷戈爾·多利納(gregor dolinar)也向媒體確認,合作公司在周一獲准公布結果。也就是這一限制,讓openai「鑽了空子」。

同樣都獲得IMO「奧數」金牌,谷歌獲贊,OpenAI卻引發爭議 - 天天要聞谷歌deepmind首席執行官哈薩比斯發布的貼子

同樣都獲得IMO「奧數」金牌,谷歌獲贊,OpenAI卻引發爭議 - 天天要聞奧特曼在7月19日發布的貼子中宣稱openai模型獲獎

相比之下,由於openai未正式參賽,而是由三位前imo金牌得主獨立評分後於周六閉幕式後宣布結果,隨即引發爭議。在谷歌的成績獲准公布前,openai首席執行官山姆·奧特曼(sam altman)在社交媒體x上大張旗鼓地宣布,openai的一款未公開實驗性大語言模型在2025年imo中達到了金牌水平,成功躋身全球頂尖數學競賽選手行列。

同樣都獲得IMO「奧數」金牌,谷歌獲贊,OpenAI卻引發爭議 - 天天要聞

面對爭議,openai的布朗在x上表示,openai幾個月前曾受邀參加正式數學競賽,但因專註於自然語言系統而拒絕,並不知曉imo的安排

全球數學競賽的最高平台

imo是全球數學競賽的最高平台,旨在鼓勵年輕人對數學的興趣,並通過一系列的複雜題目考察他們的思維與推理能力。每年,來自世界各地的頂尖學生將在代數、幾何、數論等多個領域接受考驗,考試時間為四個半小時,難度之大,挑戰性之強,令其成為全球最具聲望的數學競賽之一。

imo的題目不僅需要學生具備紮實的數學基礎,更考驗其創造性思維和批判性分析能力。每年,數百名來自世界各地的學生參加這項賽事,只有排名前8%的參賽學生能夠獲得金牌。2024年,谷歌deepmind的alphaproof和alphageometry 2模型在imo中答對了四道題,得分為28分,達到銀牌標準。今年,gemini deep think模型的突破表明通用推理模型在數學任務上的潛力,超越了專門設計的數學ai。

對於未來,ai的推理能力有望擴展到更多學科,助力科學家在物理學等領域解決複雜的研究難題。谷歌計劃將gemini deep think提供給數學家測試,並最終向其ai ultra訂閱用戶開放,定價為每月250美元。openai則表示,短期內不會發布這一級別的數學能力模型。(文/騰訊科技特約編譯 無忌 編輯/陸陸)

科技分類資訊推薦

引領科技豪華MPV新風尚 第二代騰勢D9西安車展亮相 - 天天要聞

引領科技豪華MPV新風尚 第二代騰勢D9西安車展亮相

兼具宜商氣度與家用溫情的科技豪華旗艦MPV,第二代騰勢D9迎來西安地區正式亮相。新車依託全球新能源MPV冠軍底蘊,以第二代刀片電池、雙閥雲輦-C、天神之眼5.0智駕等核心技術全面升級,兼顧商務體面與家庭舒適,為西北高端用戶帶來一站式全能出行解決方案。
採購禁入!科華數據材料造假被拒門外 - 天天要聞

採購禁入!科華數據材料造假被拒門外

本報(chinatimes.net.cn)記者胡雅文 北京報道這家趕上AI算力風口的公司,因投標材料造假,被相關採購方列入禁入名單兩年,其此前提出的複議申請也被正式駁回。相關採購平台近日發布公告,明確駁回科華數據股份有限公司(下稱「科華數據」,002335.SZ)此前提交的複議申請。早在一年前,科華數據已被認定在「信息通信樞紐...
快評樂道L80:15萬元級買大五座,這波值得沖? - 天天要聞

快評樂道L80:15萬元級買大五座,這波值得沖?

日前,樂道L80正式發布並開啟預售,其整車購買預售價為24.58萬元起,租電購買預售價則低至15.98萬元起。面對大型SUV市場「細分再細分」之競爭趨勢,這款樂道年度重磅新車都有哪些優勢?又能否成為「大五座SUV革新之作」?下面,圈哥就帶大家全方位感受。
成都直擊凱威德:純電全尺寸SUV的張揚與大氣 - 天天要聞

成都直擊凱威德:純電全尺寸SUV的張揚與大氣

4月22日,凱迪拉克以奧斯卡級盛典規格,將上海保利大劇院點亮為璀璨舞台,在品牌代言人倪妮與全場嘉賓的共同見證下,凱迪拉克全尺寸純電公路旗艦——凱威德耀然上市。新車共推出長續航四驅Pro、高性能四驅Ultra兩款配置,官方售價區間為46.88萬-50.88萬元。