
2025年7月22日至25日,在上海期智研究院,ai安全國際論壇 (safe ai forum), 以及上海人工智慧實驗室主辦的第四屆ai安全國際對話 (international dialogues on ai safety) 中,全球頂尖的人工智慧 (ai) 科學家齊聚上海,就未來人工智慧系統可能超越人類智能水平帶來的失控風險,進行了深入的交流與研討。
本次會議促成了《ai安全國際對話上海共識》(以下簡稱「上海共識」), 首次呼籲全球各國政府及研究人員「確保高級人工智慧系統的對齊與人類控制,保障人類福祉」。共識指出,人工智慧正迅速逼近並可能超越人類智能水平。然而,依據現有的系統欺瞞人類開發者的證據推測,具有超過人類智慧的人工智慧系統可能在未來脫離人類控制或被不法分子利用,帶來災難性風險。因此,全球研究者必須聯合起來,確保人工智慧系統受人類掌控且符合人類價值觀。
國內外人工智慧安全與治理領域領軍人物,包括圖靈獎得主姚期智教授,諾貝爾獎和圖靈獎得主傑弗里·辛頓 (geoffrey hinton)教授,圖靈獎得主約書亞·本吉奧 (yoshua bengio) 教授(遠程),加州大學伯克利分校計算機科學教授斯圖爾特·羅素 (stuart russell) 等出席本次會議,並簽署了上海共識。

與會代表合影,傑弗里·辛頓 (geoffrey hinton) 教授站於後排。前排從左至右分別為:薛瀾教授,傅瑩女士,周伯文教授,姚期智教授,吉莉安·哈德菲爾德 (gillian hadfield)教授,克瑞格·蒙迪 (craig mundie)先生, 斯圖爾特·羅素 (stuart russell) 教授, 羅伯特·特拉格 (robert trager) 教授。
上海共識內容
shanghai consensus
a
人工智慧的欺騙與風險
上海共識基於近期人工智慧迅速提升的智能以及顯現的欺瞞傾向,對這一技術在短期內帶來的風險表達了深切的擔憂。
隨著人工智慧系統日益強大、更具自主性,這些系統可能在操作者毫不知情的情況下,執行並非操作者所期望或預測的行動。近期實驗證據顯示,人工智慧系統日益顯現出欺騙性和自我保護傾向,例如在模擬情境中,當系統即將被新版本替換時試圖脅迫開發者。隨著智能水平的不斷攀升,人工智慧系統一旦失控,便可能給人類帶來災難性乃至生存性風險。當前的許多人工智慧具有空前的能力和薄弱的安全防禦,不法分子亦可以用其開發生化武器或製造虛假信息、操控人心。當前尚無已知方法,能夠在更高級的通用人工智慧超越人類智能水平後,仍可靠地確保其對齊,並保持人類的有效控制。
人工智慧的安全問題已經獲得了一定的重視。各個主要國家和地區都在積極完善對於人工智慧的監管,希望主動掌握該技術的發展走向。中國自2023年開始就要求所有生成式人工智慧進行統一備案,且在今年年初成立了中國人工智慧發展與安全研究網路。歐盟通過了《人工智慧法案》,英國發起了人工智慧峰會系列,美國也設立了人工智慧標準與創新中心。
然而,監管體系、人工智慧安全研究投入以及風險緩解方法仍大幅落後於技術本身的迭代。與人工智慧開發獲得的支持和關注相比,人工智慧安全研究的投入仍相較甚遠。
b
在競爭中尋求人工智慧安全合作
因此,共識認為,全球主要國家和地區必須對接協調,採取可信的安全舉措,在能共同推進的領域協同發力,在必要時自主行動。
我們需要在國際層面逐步建立互信機制,並加大對人工智慧安全科學研究的投入。為了保障在不久的將來所有人類都能更好的生存,上海共識呼籲國際社會:
要求前沿人工智慧開發者提供安全保障
為了讓監管部門更清楚地了解未來高級ai系統的安全性,開發者在模型部署前應先進行全面的內部檢查和第三方評估,提交高可信的安全案例,以及開展深入的模擬攻防與紅隊測試。
若模型達到了關鍵能力閾值(比如檢測模型是否有具備幫助沒有專業知識的非法分子製造生化武器的能力),開發者應向政府(在適當時亦可向公眾)說明潛在風險。
部署後,開發者要持續監測模型運行情況,及時發現並報告新風險、事故或濫用行為,並準備好應急方案,必要時可立即關閉系統。
通過加強國際協調, 共同確立並恪守可驗證的全球性行為紅線
國際社會需要合作划出人工智慧開發不可以逾越的紅線(即「高壓線」),這些紅線應聚焦於人工智慧系統的行為表現,其劃定需同時考量系統執行特定行為的能力及其採取該行為的傾向性。
為落實這些紅線,各國應建立一個具備技術能力、具有國際包容性的協調機構,匯聚各國人工智慧安全主管機構,以共享風險相關信息,並推動評估規程與驗證方法的標準化。該機構將促進知識交流,並就遵守紅線所需的技術措施達成一致,包括統一披露要求與評估規程,從而幫助開發者可信地證明其人工智慧系統的安全與安保水平。
投資基於設計的安全人工智慧研究
科學界和開發者應投入一系列嚴格機制來保障人工智慧系統的安全性。
短期內,我們需通過可擴展的監督機制應對人工智慧欺騙行為:例如加強信息安全投入,防範來自系統內部和外部的各種威脅,增強模型抗越獄能力等。
長期來看,我們可能需要化被動為主動,轉而構建基於「設計即安全」的人工智慧系統。通過實驗數據總結出的規律,研究者可以提前預估未來人工智慧系統的安全水平和性能。這樣,開發者在正式訓練模型之前,就能預先設置好足夠的安全防護措施。

傑弗里·辛頓教授與姚期智教授參與圓桌討論。

姚期智教授在會議上發言。

傅瑩女士,吉莉安·哈德菲爾德教授,羅伯特·特拉格教授,薛瀾教授 (從左到右) 參加關於人工智慧治理的座談小組討論。
共識簽署人
signatories
向下滑動查看更多簽署人

傑弗里·辛頓 (geoffrey hinton)
2024年諾貝爾物理學獎得主
2018年圖靈獎得主
加拿大多倫多大學榮譽教授

姚期智
2000年圖靈獎得主
上海期智研究院院長
清華交叉信息研究院,人工智慧學院院長

約書亞·本吉奧 (yoshua bengio)
2018年圖靈獎得主
蒙特利爾大學教授
加拿大人工智慧研究所(mila)創始人

斯圖爾特·羅素 (stuart russell)
加州大學伯克利分校教授
人工智慧系統中心 (chai) 創始人
英國皇家學會院士

張亞勤
清華大學講席教授
智能產業研究院 (air) 院長

傅瑩

薛瀾
清華大學蘇世民書院院長
清華大學人工智慧國際治理研究院院長

吉莉安·哈德菲爾德 (gillian hadfield)
多倫多大學矢量ai研究所cifar講席教授
約翰斯·霍普金斯大學政府/計算機科學雙聘教授
openai前高級政策顧問

羅伯特·特拉格 (robert trager)
牛津大學馬丁人工智慧治理計劃聯合主任

薩姆·r·鮑曼 (sam r. bowman)
anthropic公益公司技術團隊成員
紐約大學數據科學, 計算機科學與語言學副教授

丹·貝爾 (dan baer)

丹·亨德里克斯 (dan hendrycks)
人工智慧安全中心執行主任
xai 顧問,scale ai 顧問

徐葳
上海期智研究院首席研究員
清華大學交叉信息研究院教授、副院長

朱亦博
上海階躍星辰智能科技有限公司聯合創始人

魏凱
中國信息通信研究院人工智慧研究所所長
中國人工智慧產業發展聯盟總體組組長

本傑明·普呂東 (benjamin prud'homme)
人工智慧安全與政策研究專家

肖恩·奧赫加提 (seán Ó hÉigeartaigh)
劍橋大學未來智能中心
「人工智慧:未來與責任」 項目主任

高奇琦
復旦大學國際關係與公共事務學院教授

亞當·格里夫 (adam gleave)
far.ai聯合創始人兼首席執行官

田天
瑞萊智慧 (real ai) 聯合創始人兼首席執行官

賀天行
上海期智研究院首席研究員
清華大學交叉信息研究院 (姚班) 助理教授

謝旻希
安遠ai總裁

fynn heide
ai安全國際論壇執行董事

陸超超
上海人工智慧實驗室科學家

付傑
上海人工智慧實驗室科學家
上海創智學院助理教授

陳欣
瑞士蘇黎世聯邦理工學院博士研究生

呼娜英
中國信息通信研究院
人工智慧研究所高級業務主管

傅瑩女士,克瑞格·蒙迪先生,傑弗里·辛頓教授,姚期智教授,周伯文教授,斯圖爾特·羅素教授,薛瀾教授 (從左到右) 進行圓桌討論。
主辦方
上海期智研究院為2020年1月成立的新型研究院。在上海市支持及姚期智院長主導下,匯聚多校尖端人才開展前沿交叉科學研究工作。

圖靈獎得主,上海期智研究院院長姚期智教授在會上作主題演講。
ai安全國際論壇是一家非盈利組織,致力於推動全球人工智慧治理合作,促進中西ai專家的第二軌道對話,共同應對ai帶來的極端風險,造福全人類。我們主辦ai安全國際對話,並提供研究和諮詢服務。

ai安全國際論壇執行董事fynn heide在會議上介紹ai安全國際對話的歷史和影響力。
上海人工智慧實驗室是我國人工智慧領域新型科研機構,開展戰略性、原創性、前瞻性的科學研究與技術攻關,目標建成國際一流的人工智慧實驗室,成為享譽全球的人工智慧原創理論和技術的策源地。

清華大學惠妍講席教授,上海人工智慧實驗室主任周伯文教授在會上作主題演講。
