同样都获得IMO“奥数”金牌,谷歌获赞,OpenAI却引发争议

2025年07月22日21:30:27 科技 6023

同样都获得IMO“奥数”金牌,谷歌获赞,OpenAI却引发争议 - 天天要闻

当地时间7月21日,谷歌deepmind宣布其gemini deep think模型在第66届国际数学奥林匹克竞赛(imo)中取得金牌,首次以官方认证方式跨越这一全球顶尖高中生数学竞赛的金牌得分线。这一成就标志着ai在复杂数学推理能力上的重大突破。

在谷歌deepmind官宣之前,openai在上周六(7月19日)单方面宣布,其实验性推理模型解答了本届imo竞赛中六道试题中的五道,得分为35分(满分42分),达到金牌水平。openai宣布的成绩与谷歌deepmind随后宣布的成绩相同,却因未正式参赛,且违反imo竞赛委员会的信息披露规则,引发业界热议。

同样都获得IMO“奥数”金牌,谷歌获赞,OpenAI却引发争议 - 天天要闻谷歌deepmind官宣获得金牌

imo是全球最负盛名的数学赛事之一,吸引了来自100多个国家的顶尖高中生。今年,第66届imo在澳大利亚昆士兰阳光海岸举行,630名参赛者中仅有67人(约11%)获得金牌。谷歌deepmind的gemini deep think模型正式参赛,成功解答五道题目,获得35分,达到金牌标准,其成绩由imo委员会官方认证。

同样都获得IMO“奥数”金牌,谷歌获赞,OpenAI却引发争议 - 天天要闻openai研究员亚历山大·魏发帖宣布获得金牌

相比之下,openai未正式参与imo竞赛,而是通过三位前imo金牌得主独立评分,宣称其实验性推理模型同样解答了五道题目,达到金牌水平。这一非官方评估引发争议,因其不仅未经过imo委员会的正式验证,还违反了该委员会的相关规定。

如何获奖imo

与以往依赖形式化语言(如lean)或专门数学系统的ai不同,谷歌deepmind的gemini deep think模型采用通用推理方法,直接处理自然语言问题,并在官方规定的每场4.5小时时限内完成解答

该模型于今年5月谷歌开发者大会上首次亮相,其增强推理模式“deep think”通过并行运行多条推理路径,整合结果后生成最终答案。谷歌deepmind高级科学家、imo团队负责人卢唐(thang luong)表示:“我们实现了端到端的自然语言处理,无需人工干预,彻底革新了去年的方法。”

openai的模型同样以自然语言处理为基础,通过大规模扩展“测试时计算”实现突破,延长模型思考时间并利用并行计算运行多条推理路径。openai研究员诺姆·布朗(noam brown)称此过程“成本极高”,但未透露具体费用。他强调,这一方法展示了ai在数学之外的广泛推理潜力。然而,openai未正式参赛,其成绩未获imo官方认可,削弱了其宣称的突破性意义。

谷歌deepmind自去年起与imo官方密切合作,其结果由竞赛委员会正式认证。imo委员会要求所有ai实验室不要抢学生的风头,在官方结果由独立专家验证并向学生授予应得的荣誉后(即7月21日周一)再发布成绩。imo主席格雷戈尔·多利纳(gregor dolinar)也向媒体确认,合作公司在周一获准公布结果。也就是这一限制,让openai“钻了空子”。

同样都获得IMO“奥数”金牌,谷歌获赞,OpenAI却引发争议 - 天天要闻谷歌deepmind首席执行官哈萨比斯发布的贴子

同样都获得IMO“奥数”金牌,谷歌获赞,OpenAI却引发争议 - 天天要闻奥特曼在7月19日发布的贴子中宣称openai模型获奖

相比之下,由于openai未正式参赛,而是由三位前imo金牌得主独立评分后于周六闭幕式后宣布结果,随即引发争议。在谷歌的成绩获准公布前,openai首席执行官山姆·奥特曼(sam altman)在社交媒体x上大张旗鼓地宣布,openai的一款未公开实验性大语言模型在2025年imo中达到了金牌水平,成功跻身全球顶尖数学竞赛选手行列。

同样都获得IMO“奥数”金牌,谷歌获赞,OpenAI却引发争议 - 天天要闻

面对争议,openai的布朗在x上表示,openai几个月前曾受邀参加正式数学竞赛,但因专注于自然语言系统而拒绝,并不知晓imo的安排

全球数学竞赛的最高平台

imo是全球数学竞赛的最高平台,旨在鼓励年轻人对数学的兴趣,并通过一系列的复杂题目考察他们的思维与推理能力。每年,来自世界各地的顶尖学生将在代数、几何、数论等多个领域接受考验,考试时间为四个半小时,难度之大,挑战性之强,令其成为全球最具声望的数学竞赛之一。

imo的题目不仅需要学生具备扎实的数学基础,更考验其创造性思维和批判性分析能力。每年,数百名来自世界各地的学生参加这项赛事,只有排名前8%的参赛学生能够获得金牌。2024年,谷歌deepmind的alphaproof和alphageometry 2模型在imo中答对了四道题,得分为28分,达到银牌标准。今年,gemini deep think模型的突破表明通用推理模型在数学任务上的潜力,超越了专门设计的数学ai。

对于未来,ai的推理能力有望扩展到更多学科,助力科学家在物理学等领域解决复杂的研究难题。谷歌计划将gemini deep think提供给数学家测试,并最终向其ai ultra订阅用户开放,定价为每月250美元。openai则表示,短期内不会发布这一级别的数学能力模型。(文/腾讯科技特约编译 无忌 编辑/陆陆)

科技分类资讯推荐

引领科技豪华MPV新风尚 第二代腾势D9西安车展亮相 - 天天要闻

引领科技豪华MPV新风尚 第二代腾势D9西安车展亮相

兼具宜商气度与家用温情的科技豪华旗舰MPV,第二代腾势D9迎来西安地区正式亮相。新车依托全球新能源MPV冠军底蕴,以第二代刀片电池、双阀云辇-C、天神之眼5.0智驾等核心技术全面升级,兼顾商务体面与家庭舒适,为西北高端用户带来一站式全能出行解决方案。
采购禁入!科华数据材料造假被拒门外 - 天天要闻

采购禁入!科华数据材料造假被拒门外

本报(chinatimes.net.cn)记者胡雅文 北京报道这家赶上AI算力风口的公司,因投标材料造假,被相关采购方列入禁入名单两年,其此前提出的复议申请也被正式驳回。相关采购平台近日发布公告,明确驳回科华数据股份有限公司(下称“科华数据”,002335.SZ)此前提交的复议申请。早在一年前,科华数据已被认定在“信息通信枢纽...
快评乐道L80:15万元级买大五座,这波值得冲? - 天天要闻

快评乐道L80:15万元级买大五座,这波值得冲?

日前,乐道L80正式发布并开启预售,其整车购买预售价为24.58万元起,租电购买预售价则低至15.98万元起。面对大型SUV市场“细分再细分”之竞争趋势,这款乐道年度重磅新车都有哪些优势?又能否成为“大五座SUV革新之作”?下面,圈哥就带大家全方位感受。
成都直击凯威德:纯电全尺寸SUV的张扬与大气 - 天天要闻

成都直击凯威德:纯电全尺寸SUV的张扬与大气

4月22日,凯迪拉克以奥斯卡级盛典规格,将上海保利大剧院点亮为璀璨舞台,在品牌代言人倪妮与全场嘉宾的共同见证下,凯迪拉克全尺寸纯电公路旗舰——凯威德耀然上市。新车共推出长续航四驱Pro、高性能四驱Ultra两款配置,官方售价区间为46.88万-50.88万元。