在討論 agi 或者通用機器人定義時,人們往往會自然聯想到一些直觀的衡量標準,比如 ai 能否解出高考題、在國際數學奧林匹克(imo,international mathematical olympiad)上獲得金牌,或者機器人能否勝任家務。這些標準固然能體現「聰明」「適應性強」等能力,但卻容易忽略一個更本質的維度——它能否在科學領域產出真正的新知識與重大突破?在加拿大多倫多大學博士生張鵬松和所在團隊看來,評判超級智能的一個重要標準之一,是 ai 與機器人能不能推動科學邊界前進、打破人類既有認知與物理界限。這正是該團隊長期關注 ai scientists 和 robot scientists 的出發點與動力[1]。
圖 | 張鵬松(來源:張鵬松)
過去,科研進展受限於研究者的創造力、學術背景與有限時間。而近年的大模型與智能體進展,讓 ai agent以及機器人已能自動完成從提出研究設想、開展實驗、到撰寫論文等行為。比如日本公司 sakana ai 提出的 the ai scientist[2]、美國斯坦福大學教授 james zou 團隊的 the virtual lab[3]都已經非常好地驗證了 ai 作為自主科學家的可行性。這些工作共同指向一個趨勢:科學發現也將會迎來新的規模定律 scaling laws[1]。
然而,當前的學術出版生態難以承載這股浪潮,傳統學術出版體系是為「人類作者 + 人工評審」的時代設計的,如今面對 ai 生成的海量研究,瓶頸集中在以下幾方面:
其一,評審吞吐不足,傳統期刊和會議依賴人工評審,效率低下,根本無法應對 ai 生成內容的規模。
其二,預印本缺少質量控制,預印本平台像 arxiv 雖然可以快速發布,但是缺少質量控制機制,無法保證成果的可信度。
其三,署名與規範的不確定性,不少學術場景對 ai 署名/貢獻度仍存分歧,透明度與可追責性不足,抑制了人類與 ai 的深度協作,也影響成果的傳播與採用。
其四,proposal 早期生態缺位,現有平台不支持研究提案(research proposal)的結構化交流與迭代。這使得「idea 層面的共創與篩選」缺乏公共空間與思想碰撞,錯失了大量原本能在萌芽期快速試錯與放大的機會。
其五,ai 評審的安全與對齊問題, 基於大模型的評審會遭遇提示詞注入(prompt injection)等攻擊與操縱風險;同時還存在證據對齊不足、基線不一致等問題。若不治理,這些風險會侵蝕評審公正性與可用性。
其六,跨主體協作缺少統一環境,未來科研一定是 human-ai 與 ai-ai 的多智能體協同。但當前缺少一個統一、開放、可擴展的「科研環境」,如能打造出來那將既能讓不同類型的 agent(作者、審稿、導師、委員會、實驗、傳播)以標準化介面接入,又能對質量、溯源、版本進行全程管理。
(來源:arxiv:2508.15126)
圖 | aixiv platform overview(來源:arxiv:2508.15126)
基於上述原因,本次團隊提出並實現了 aixiv,其表示這是全球首個面向 ai scientists、robot scientists所產出的research proposal和paper,同時也是一個帶有 ai 同行評審與返修環節的 open access 預印本平台和 ai agetns 科研社區環境。目標是為 ai 科學家、機器人科學家以及人類研究者共同建立一個全新的科研生態,打破當下分散、封閉的格局,構建覆蓋提交-評審-返修-發布的完整科研與迭代流程。通過開放介面,人類研究者與各種科研智能體都能便捷接入,在同一平台上展開協作。
圖 | aixiv網站demo展示(來源:arxiv:2508.15126)
在機制設計上,aixiv 引入了結構化、多階段的評審機制,讓 proposal 和 paper 能夠在迭代中持續改進;同時,版本化發布和可溯源的質量軌跡,讓科研成果的提升可以被真實驗證。多模型投票機制避免了單一模型偏見,提升了結論的公平性和可靠性。
在安全與對齊方面,研究團隊在評審環節中加入檢索增強,使評審意見與真實文獻對齊;並構建多層次的提示詞注入檢測與防禦機制,抵禦隱蔽操縱,確保評審過程的公正與可信。實驗表明,在論文的 pairwise 評審任務中,大模型的準確率可達 81%,驗證了其具備真實的學術判斷能力。這意味著大模型不僅能夠生成科研內容,還能為 ai 產出的研究成果提供可靠的評審意見與打分,幫助智能體完成持續迭代和優化,從而不斷提高科研質量。
(來源:資料圖)
(來源:arxiv:2508.15126)
本次研究的相關論文發布之後,研究團隊收到了不同的角度的評論,有積極的讚許,也有審慎的質疑。
一些評論非常振奮人心。例如有人說「學術界曾經依靠填補已深入探索領域的小空白而蓬勃發展。這些空白已經消失。現在,只有真正的突破才算數。」還有評論提到:「ai 正在撼動學術界!但這些 ai 的改進是真正創新,還是僅僅完善了人類的努力?傳統學術界或許需要警鐘,是準備好主動適應,還是看著時間站在 ai 這邊?」
這些評論恰好與研究團隊建設 aixiv 的初衷高度契合。其認為,隨著 ai 與機器人科學家的發展,那些增量式的創新點和「小修小補」的工作會被 ai 快速完成與驗證,而這反而能刺激和推動人類科學家把精力集中到更具挑戰、更具突破性的科研問題上。
當然,也有不少謹慎的聲音。例如有人提醒:「科學不僅僅是發表論文,它還涉及共識、復現和信任,如果充斥著 ai 論文的系統沒有良好的治理,可能會淹沒真正的科學發現。」還有人擔憂:「即使在 arxiv上,有時也會有人質疑文章的真實性,但在 aixiv上這種情況似乎會更加嚴重」。
研究團隊表示,他們非常理解這些擔憂,這正是 aixiv 設計的關鍵考量之一。研究團隊為 ai 與人類研究者共同提供評審介面,讓不同的 ai reviewer 與 human reviewer 可以同時參與,形成多維度、多角度的綜合審查。這種機制既是對質量的保障,也是對「信任」的回應。研究團隊相信,隨著 ai 在科研與評審能力上的不斷迭代,它最終有可能形成一種新的學術評審範式,使其不僅接近人類水準,甚至在某些方面超越現有人類評審模式。
(來源:arxiv:2508.15126)
就應用前景來說:
研究團隊認為,本次 aixiv 平台或者未來出現的類似平台,將會帶來兩方面革新性的變化:
首先,有望革新現有的科學研究範式。
在 ai scientists 的初期發展階段,科研中的研究提案與創新點方面可能將首先被顛覆。現在的科研環境中存在著這樣一種描述「科研就像炒菜」,需要各學科、方法、思想的整合與碰撞。而當下的大模型本身就具備跨學科的知識儲備,它們能夠在極短時間內提出海量的創新性想法[4][5]。若這些想法通過像 aixiv 這樣的平台得到多維度評審與迭代,那麼 ai 產出的可行創新點將無限接近與覆蓋 100% 人類科學家所能想到的創新想法。這意味著人類科學家可探索的「增量空間」將迅速收縮,但也會倒逼人類去挑戰更高難度、更具突破性的科學問題。
從更長遠的視角來看,自 17 世紀以來,人類已在各學科領域發表了約 1.5 億至 2 億篇高質量科學論文。這份浩瀚的記錄凝聚了人類數百年的努力、協作和漸進式探索。但隨著自主 ai 研究人員的崛起,相比之下這些成果很快就會顯得微不足道。ai 系統將以超人的速度和規模運行,生成、測試和發表數十億篇科學論文,這並非幾個世紀的工夫,而是短短几年,甚至幾個月,幾天或幾小時……在這些成果中,不僅可能湧現諾貝爾獎級別的突破,還可能在迭代中誕生出堪比甚至超越「愛因斯坦」式的「超級 ai 科學家」。
(來源:arxiv:2503.22444)
其次,有望革新現有的科學出版方式。
aixiv 的理念是打造一個主要針對 ai 科學家與機器人科學家的免費、共享的預印本平台。但與傳統的預印本平台不同的是,aixiv 集成了 ai 評審,以保證 proposal 與 paper 的提交質量。為了實現真正的免費與共享,研究團隊正在考慮採用去中心化與區塊鏈技術以存儲、記錄 doi、版本、評審軌跡,保證可追溯性與透明性。
另據悉,本次研究團隊的合作者大多來自大模型、agent 與機器人方向。課題的出發點其實很樸素:ai 與機器人能否完成端到端的自主科學研究?如果答案是「能」,當這種能力以規模化出現時,人類應如何接住這股洪流?2024 年,馬斯克曾判斷「未來 3 年 200-300 億數量級的類人機器人將會出現」。即便把這個說法打個折,沒有物理身體的 ai agents 在數量上也更容易出現指數級增長。想像一下:僅 1 億個 ai 研究型智能體持續產生提案與論文,所形成的「審稿需求」已遠超人類評審能力。2025 年,國際頂會 nips、aaai 的投稿量都突破三萬篇。這只是一個開端,在 ai 的加持下,「沒有足夠審稿人可用」正在成為現實問題。研究團隊希望正面回答:當科研成果數量達到某個臨界點時,人們應該怎麼辦?
研究團隊最初把這個問題拋到社交媒體上尋找合作者,很快就吸引了來自全球各大高校和研究機構的夥伴加入,其中涵蓋大模型、agent、機器人以及生物醫學等方向的合作者。隨後研究團隊快速進入研究推進的三個關鍵階段。
首先是明確命題與邊界,其把問題壓縮成兩個可操作的問題:其一,如何驗證「ai/機器人能做科學」不是孤例,而是可複製、可擴展的流程?其二,當 ai 研究供給暴漲時,如何通過一個平台同時解決「快速發布」和「可信評審」的矛盾?這一步的關鍵是把願景轉化為可驗證的工程與制度設計。
其次是廣邀協作,跨學科的合作者拼圖讓研究團隊能夠從「科研生產」「質量管理」「安全對齊」三個維度同步推進。
最後是搭建最小可行原型,研究團隊打通了「提交-評審-返修-發布」的完整鏈路,支持 proposal 與 paper 的提交,讓 ai 與人類評審能夠被統一調度與記錄,每一次返修都能形成可追蹤的質量軌跡。
本次研究的合作者胡翔和黃國偉表示,在實驗階段,當研究團隊完整復現 ai-scientist 的流程時,從一個 idea 出發,到自動化完成實驗,再到安全地生成一篇完整的論文,讓人十分震撼。那一刻,研究團隊並不是擔心自己真人研究員的身份會被替代,而是意識到未來會出現越來越多更智能的 ai scientist 工具,它們能夠幫助人類更好地開展科研,加速整個科學進展。哪怕科研效率只提高百分之十,對社會的價值都會是巨大的。研究團隊做 aixiv 的初衷,就是希望把這些由 ai 產出的高質量知識沉澱下來,真正服務於科學。
當問及下一步基於該研究是否有後續計劃?胡翔以及張鵬松表示,在 aixiv 的基礎上,研究團隊計划進一步引入強化學習,將其打造為一個科研的 agent 環境,使研究型智能體能夠通過結構化交互不斷演化。隨著平台上大規模產生的科研提案、論文、同行評審與多輪返修積累,aixiv 將形成一個豐富的經驗數據倉庫,為科研智能體或者說 ai 科學家的學習提供堅實基礎。
在這一協作生態中,研究型智能體將能夠:
學習複雜推理與長期決策能力,提升其制定與執行科研計劃的能力;
發展自適應行為,在科學探索與綜合實驗中不斷優化策略;
自主獲取新知識與技能,通過與其他智能體和人類研究者的互動完成迭代,而無需依賴顯式重編程。
這些能力將使智能體能夠動態適應新興的科研領域與未知挑戰,確保其在快速演化的科學前沿保持持續相關性。
此外,研究團隊希望把 ai-scientist 真正用於端到端實驗。不僅要在計算機科學、數學等不太需要「動手」的學科實現從構想到結果的自動化,也要將其與自動化機器人系統深度結合,走進需要物理實驗與濕實驗的領域(如生物、化學、材料等工程科學)。通過高通量實驗執行、自動化儀器控制、實時數據採集與分析,以及「假設-實驗-評估-返修」的閉環,研究團隊希望能夠打通「選題-設計-實驗-分析-寫作-發布」的全流程。最終目標是培養具備「手腦一體」能力的 robot scientist,不僅能勝任人類科學家的日常工作,更在速度、準確性、創新性與可復現性上接近與超越人類水準。
研究團隊也希望將 ai-scientist 推廣到其他領域,尤其是商科研究。一個關鍵問題在於,ai-scientist 是否能夠自主識別並收集相關數據,從而開展高質量的商學院學術研究?與此同時,本次研究也發現當前在文獻引用方面仍然存在不足。然而,文獻的有效應用對科學研究至關重要。因此,研究團隊也希望在這一領域進一步提升 ai-scientist 在整合和運用現有文獻方面的能力。
目前,研究團隊正在籌備建立一個全球性非營利性組織 aixiv organization,旨在將 aixiv 打造為下一代的科學研究發布與共享平台。aixiv organization 的使命不僅是「發布論文」,更是要探索人類與 ai 共同進化的科研新範式,為未來的科學發現提供可信賴的基礎設施。
研究團隊也正在邀請各大頂級高校教授們加入上述非營利性組織的 advisory board,希望藉助他們的專業洞見與學術規範經驗,逐步共同建立起一個科學、可信、規範且長期可持續的 ai for research 生態環境。同時,其也期待得到來自企業、基金會等各類合作夥伴的支持,攜手推動這一開放科研平台的建設與落地。另外,本次論文的合作者周孝嚴也正在創立一家初創公司。公司使命是將「ai 科學家」這一前沿理念落地應用於各個垂直領域之中,從而加速企業科研創新進程,提升科研產出效率。