Geoffrey Hinton, 姚期智等全球科學家:確保高級人工智慧系統的對齊與人類控制,保障人類福祉

2025年07月25日23:10:23 科學 8154
Geoffrey Hinton, 姚期智等全球科學家:確保高級人工智慧系統的對齊與人類控制,保障人類福祉 - 天天要聞



2025年7月22日至25日,在上海期智研究院,ai安全國際論壇 (safe ai forum), 以及上海人工智慧實驗室主辦的第四屆ai安全國際對話 (international dialogues on ai safety) 中,全球頂尖的人工智慧 (ai) 科學家齊聚上海,就未來人工智慧系統可能超越人類智能水平帶來的失控風險進行了深入的交流與研討。


本次會議促成了《ai安全國際對話上海共識》(以下簡稱「上海共識」)首次呼籲全球各國政府及研究人員確保高級人工智慧系統的對齊與人類控制,保障人類福祉」。共識指出,人工智慧正迅速逼近並可能超越人類智能水平。然而,依據現有的系統欺瞞人類開發者的證據推測,具有超過人類智慧的人工智慧系統可能在未來脫離人類控制或被不法分子利用,帶來災難性風險。因此,全球研究者必須聯合起來,確保人工智慧系統受人類掌控且符合人類價值觀。


國內外人工智慧安全與治理領域領軍人物,包括圖靈獎得主姚期智教授諾貝爾獎和圖靈獎得主傑弗里·辛頓 (geoffrey hinton)教授圖靈獎得主約書亞·本吉奧 (yoshua bengio) 教授(遠程)加州大學伯克利分校計算機科學教授斯圖爾特·羅素 (stuart russell) 出席本次會議,並簽署了上海共識。


Geoffrey Hinton, 姚期智等全球科學家:確保高級人工智慧系統的對齊與人類控制,保障人類福祉 - 天天要聞

與會代表合影,傑弗里·辛頓 (geoffrey hinton) 教授站於後排。前排從左至右分別為:薛瀾教授,傅瑩女士,周伯文教授,姚期智教授,吉莉安·哈德菲爾德 (gillian hadfield)教授,克瑞格·蒙迪 (craig mundie)先生, 斯圖爾特·羅素 (stuart russell) 教授, 羅伯特·特拉格 (robert trager) 教授。


上海共識內容

shanghai consensus



a

人工智慧的欺騙與風險


上海共識基於近期人工智慧迅速提升的智能以及顯現的欺瞞傾向對這一技術在短期內帶來的風險表達了深切的擔憂。


隨著人工智慧系統日益強大、更具自主性,這些系統可能在操作者毫不知情的情況下,執行並非操作者所期望或預測的行動。近期實驗證據顯示,人工智慧系統日益顯現出欺騙性和自我保護傾向例如在模擬情境中,當系統即將被新版本替換時試圖脅迫開發者。隨著智能水平的不斷攀升,人工智慧系統一旦失控,便可能給人類帶來災難性乃至生存性風險當前的許多人工智慧具有空前的能力和薄弱的安全防禦,不法分子亦可以用其開發生化武器或製造虛假信息、操控人心。當前尚無已知方法,能夠在更高級的通用人工智慧超越人類智能水平後,仍可靠地確保其對齊,並保持人類的有效控制。


人工智慧的安全問題已經獲得了一定的重視。各個主要國家和地區都在積極完善對於人工智慧的監管,希望主動掌握該技術的發展走向。中國自2023年開始就要求所有生成式人工智慧進行統一備案,且在今年年初成立了中國人工智慧發展與安全研究網路。歐盟通過了《人工智慧法案》,英國發起了人工智慧峰會系列,美國也設立了人工智慧標準與創新中心。


然而,監管體系、人工智慧安全研究投入以及風險緩解方法仍大幅落後於技術本身的迭代。與人工智慧開發獲得的支持和關注相比,人工智慧安全研究的投入仍相較甚遠



b

在競爭中尋求人工智慧安全合作


因此,共識認為,全球主要國家和地區必須對接協調,採取可信的安全舉措在能共同推進的領域協同發力,在必要時自主行動。


我們需要在國際層面逐步建立互信機制,並加大對人工智慧安全科學研究的投入為了保障在不久的將來所有人類都能更好的生存,上海共識呼籲國際社會


要求前沿人工智慧開發者提供安全保障

為了讓監管部門更清楚地了解未來高級ai系統的安全性,開發者在模型部署前應先進行全面的內部檢查和第三方評估,提交高可信的安全案例,以及開展深入的模擬攻防與紅隊測試。


若模型達到了關鍵能力閾值(比如檢測模型是否有具備幫助沒有專業知識的非法分子製造生化武器的能力)開發者應向政府(在適當時亦可向公眾)說明潛在風險


部署後,開發者要持續監測模型運行情況,及時發現並報告新風險、事故或濫用行為,並準備好應急方案,必要時可立即關閉系統



通過加強國際協調, 共同確立並恪守可驗證的全球性行為紅線

國際社會需要合作划出人工智慧開發不可以逾越的紅線(即「高壓線」),這些紅線應聚焦於人工智慧系統的行為表現,其劃定需同時考量系統執行特定行為的能力及其採取該行為的傾向性。


為落實這些紅線,各國應建立一個具備技術能力、具有國際包容性的協調機構匯聚各國人工智慧安全主管機構,以共享風險相關信息,並推動評估規程與驗證方法的標準化。該機構將促進知識交流,並就遵守紅線所需的技術措施達成一致,包括統一披露要求與評估規程,從而幫助開發者可信地證明其人工智慧系統的安全與安保水平。


投資基於設計的安全人工智慧研究

科學界和開發者應投入一系列嚴格機制來保障人工智慧系統的安全性。


短期內,我們需通過可擴展的監督機制應對人工智慧欺騙行為例如加強信息安全投入,防範來自系統內部和外部的各種威脅,增強模型抗越獄能力等。


長期來看,我們可能需要化被動為主動,轉而構建基於「設計即安全」的人工智慧系統通過實驗數據總結出的規律,研究者可以提前預估未來人工智慧系統的安全水平和性能。這樣,開發者在正式訓練模型之前,就預先設置好足夠的安全防護措施。




Geoffrey Hinton, 姚期智等全球科學家:確保高級人工智慧系統的對齊與人類控制,保障人類福祉 - 天天要聞

傑弗里·辛頓教授與姚期智教授參與圓桌討論。


Geoffrey Hinton, 姚期智等全球科學家:確保高級人工智慧系統的對齊與人類控制,保障人類福祉 - 天天要聞

姚期智教授在會議上發言。


Geoffrey Hinton, 姚期智等全球科學家:確保高級人工智慧系統的對齊與人類控制,保障人類福祉 - 天天要聞

傅瑩女士,吉莉安·哈德菲爾德教授,羅伯特·特拉格教授,薛瀾教授 (從左到右) 參加關於人工智慧治理的座談小組討論。



共識簽署人

signatories


向下滑動查看更多簽署人

Geoffrey Hinton, 姚期智等全球科學家:確保高級人工智慧系統的對齊與人類控制,保障人類福祉 - 天天要聞

傑弗里·辛頓 (geoffrey hinton)

2024年諾貝爾物理學獎得主 

2018年圖靈獎得主

加拿大多倫多大學榮譽教授

Geoffrey Hinton, 姚期智等全球科學家:確保高級人工智慧系統的對齊與人類控制,保障人類福祉 - 天天要聞

姚期智

2000年圖靈獎得主

上海期智研究院院長

清華交叉信息研究院,人工智慧學院院長

Geoffrey Hinton, 姚期智等全球科學家:確保高級人工智慧系統的對齊與人類控制,保障人類福祉 - 天天要聞

約書亞·本吉奧 (yoshua bengio)

2018年圖靈獎得主

蒙特利爾大學教授

加拿大人工智慧研究所(mila)創始人

Geoffrey Hinton, 姚期智等全球科學家:確保高級人工智慧系統的對齊與人類控制,保障人類福祉 - 天天要聞

斯圖爾特·羅素 (stuart russell)

加州大學伯克利分校教授

人工智慧系統中心 (chai) 創始人

英國皇家學會院士

Geoffrey Hinton, 姚期智等全球科學家:確保高級人工智慧系統的對齊與人類控制,保障人類福祉 - 天天要聞

張亞勤

清華大學講席教授

智能產業研究院 (air) 院長

Geoffrey Hinton, 姚期智等全球科學家:確保高級人工智慧系統的對齊與人類控制,保障人類福祉 - 天天要聞

傅瑩




Geoffrey Hinton, 姚期智等全球科學家:確保高級人工智慧系統的對齊與人類控制,保障人類福祉 - 天天要聞

薛瀾


清華大學蘇世民書院院長

清華大學人工智慧國際治理研究院院長

Geoffrey Hinton, 姚期智等全球科學家:確保高級人工智慧系統的對齊與人類控制,保障人類福祉 - 天天要聞

吉莉安·哈德菲爾德 (gillian hadfield)

多倫多大學矢量ai研究所cifar講席教授

約翰斯·霍普金斯大學政府/計算機科學雙聘教授

openai前高級政策顧問

Geoffrey Hinton, 姚期智等全球科學家:確保高級人工智慧系統的對齊與人類控制,保障人類福祉 - 天天要聞

羅伯特·特拉格 (robert trager)


牛津大學馬丁人工智慧治理計劃聯合主任


Geoffrey Hinton, 姚期智等全球科學家:確保高級人工智慧系統的對齊與人類控制,保障人類福祉 - 天天要聞

薩姆·r·鮑曼 (sam r. bowman)


anthropic公益公司技術團隊成員

紐約大學數據科學, 計算機科學與語言學副教授

Geoffrey Hinton, 姚期智等全球科學家:確保高級人工智慧系統的對齊與人類控制,保障人類福祉 - 天天要聞

丹·貝爾 (dan baer)


國際政策研究專家,前外交官


Geoffrey Hinton, 姚期智等全球科學家:確保高級人工智慧系統的對齊與人類控制,保障人類福祉 - 天天要聞

丹·亨德里克斯 (dan hendrycks)


人工智慧安全中心執行主任

xai 顧問,scale ai 顧問

Geoffrey Hinton, 姚期智等全球科學家:確保高級人工智慧系統的對齊與人類控制,保障人類福祉 - 天天要聞

徐葳


上海期智研究院首席研究員

清華大學交叉信息研究院教授、副院長


Geoffrey Hinton, 姚期智等全球科學家:確保高級人工智慧系統的對齊與人類控制,保障人類福祉 - 天天要聞

朱亦博 


上海階躍星辰智能科技有限公司聯合創始人 


Geoffrey Hinton, 姚期智等全球科學家:確保高級人工智慧系統的對齊與人類控制,保障人類福祉 - 天天要聞

魏凱


中國信息通信研究院人工智慧研究所所長

中國人工智慧產業發展聯盟總體組組長 

Geoffrey Hinton, 姚期智等全球科學家:確保高級人工智慧系統的對齊與人類控制,保障人類福祉 - 天天要聞

本傑明·普呂東 (benjamin prud'homme)


人工智慧安全與政策研究專家


Geoffrey Hinton, 姚期智等全球科學家:確保高級人工智慧系統的對齊與人類控制,保障人類福祉 - 天天要聞

肖恩·奧赫加提 (seán Ó hÉigeartaigh)


劍橋大學未來智能中心

「人工智慧:未來與責任」 項目主任

Geoffrey Hinton, 姚期智等全球科學家:確保高級人工智慧系統的對齊與人類控制,保障人類福祉 - 天天要聞

高奇琦


復旦大學國際關係與公共事務學院教授 


Geoffrey Hinton, 姚期智等全球科學家:確保高級人工智慧系統的對齊與人類控制,保障人類福祉 - 天天要聞

亞當·格里夫 (adam gleave)


far.ai聯合創始人兼首席執行官


Geoffrey Hinton, 姚期智等全球科學家:確保高級人工智慧系統的對齊與人類控制,保障人類福祉 - 天天要聞

田天


瑞萊智慧 (real ai) 聯合創始人兼首席執行官


Geoffrey Hinton, 姚期智等全球科學家:確保高級人工智慧系統的對齊與人類控制,保障人類福祉 - 天天要聞

賀天行


上海期智研究院首席研究員

清華大學交叉信息研究院 (姚班) 助理教授 

Geoffrey Hinton, 姚期智等全球科學家:確保高級人工智慧系統的對齊與人類控制,保障人類福祉 - 天天要聞

謝旻希


安遠ai總裁


Geoffrey Hinton, 姚期智等全球科學家:確保高級人工智慧系統的對齊與人類控制,保障人類福祉 - 天天要聞

fynn heide

ai安全國際論壇執行董事


Geoffrey Hinton, 姚期智等全球科學家:確保高級人工智慧系統的對齊與人類控制,保障人類福祉 - 天天要聞

陸超超

上海人工智慧實驗室科學家 


Geoffrey Hinton, 姚期智等全球科學家:確保高級人工智慧系統的對齊與人類控制,保障人類福祉 - 天天要聞

付傑


上海人工智慧實驗室科學家

上海創智學院助理教授 

Geoffrey Hinton, 姚期智等全球科學家:確保高級人工智慧系統的對齊與人類控制,保障人類福祉 - 天天要聞

陳欣


瑞士蘇黎世聯邦理工學院博士研究生


Geoffrey Hinton, 姚期智等全球科學家:確保高級人工智慧系統的對齊與人類控制,保障人類福祉 - 天天要聞

呼娜英


中國信息通信研究院

人工智慧研究所高級業務主管


Geoffrey Hinton, 姚期智等全球科學家:確保高級人工智慧系統的對齊與人類控制,保障人類福祉 - 天天要聞

傅瑩女士,克瑞格·蒙迪先生,傑弗里·辛頓教授,姚期智教授,周伯文教授,斯圖爾特·羅素教授,薛瀾教授 (從左到右) 進行圓桌討論。



主辦方



上海期智研究院為2020年1月成立的新型研究院。在上海市支持及姚期智院長主導下,匯聚多校尖端人才開展前沿交叉科學研究工作。


Geoffrey Hinton, 姚期智等全球科學家:確保高級人工智慧系統的對齊與人類控制,保障人類福祉 - 天天要聞

圖靈獎得主,上海期智研究院院長姚期智教授在會上作主題演講。





ai安全國際論壇是一家非盈利組織,致力於推動全球人工智慧治理合作,促進中西ai專家的第二軌道對話,共同應對ai帶來的極端風險,造福全人類。我們主辦ai安全國際對話,並提供研究和諮詢服務。


Geoffrey Hinton, 姚期智等全球科學家:確保高級人工智慧系統的對齊與人類控制,保障人類福祉 - 天天要聞


ai安全國際論壇執行董事fynn heide在會議上介紹ai安全國際對話的歷史和影響力。





上海人工智慧實驗室是我國人工智慧領域新型科研機構,開展戰略性、原創性、前瞻性的科學研究與技術攻關,目標建成國際一流的人工智慧實驗室,成為享譽全球的人工智慧原創理論和技術的策源地。


Geoffrey Hinton, 姚期智等全球科學家:確保高級人工智慧系統的對齊與人類控制,保障人類福祉 - 天天要聞

清華大學惠妍講席教授,上海人工智慧實驗室主任周伯文教授在會上作主題演講。





Geoffrey Hinton, 姚期智等全球科學家:確保高級人工智慧系統的對齊與人類控制,保障人類福祉 - 天天要聞



科學分類資訊推薦

首張嗅覺圖譜問世 或重塑嗅覺形成認知 - 天天要聞

首張嗅覺圖譜問世 或重塑嗅覺形成認知

研究人員以前所未有的細節繪製了小鼠鼻腔中的嗅覺受體分布圖譜。這一成果顛覆了人們對鼻子如何產生嗅覺的認知。△小鼠鼻腔的顯微鏡橫截面圖像,顯示了鼻腔上皮的解剖結構。圖片來源:Datta Lab4月28日發表於《細胞》的一項研究,揭示了感覺神經元上表達的約1100個嗅覺受體是如何在鼻腔內壁上皮組織中受到嚴格調控的空間位置...
心臟為什麼不會得癌症? - 天天要聞

心臟為什麼不會得癌症?

心臟為什麼不會得癌症?心肌細胞會進行有節律的搏動,並在個體出生後停止增殖,因此,心臟沒有再生能力。近日,義大利的里雅斯特大學醫學院Serena Zacchigna團隊完成的體內癌症模型和離體工程心臟組織實驗表明,心肌細胞搏動所產生的機械力負
暴雨、冰雹要來,廣東天氣明起大反轉!珠海接下來…… - 天天要聞

暴雨、冰雹要來,廣東天氣明起大反轉!珠海接下來……

【來源:珠海發布】「五一」假期前兩天, 珠海天氣晴好,大家都去哪裡玩了?不過天氣馬上要反轉再反轉了! 廣東明天好天氣要暫時「下線」,局部有大暴雨、小冰雹;珠海明天午後也將有雷雨+10級大風…… 這場雨會持續多久?假期接下來的天氣會怎樣?趕緊
河北衡水:假日邂逅飛行 低空魅力引遊人 - 天天要聞

河北衡水:假日邂逅飛行 低空魅力引遊人

5月2日,位於河北省衡水市的中國航協衡水航空飛行營地,各類飛行表演和低空飛行器展示吸引市民遊客觀賞。中國桃城第四屆「翱翔中國」全國低空無人飛行器大賽暨第二屆京津冀低空飛行器集采會於5月1日至2日在此舉行。圖為遊客近距離參觀飛行器。
可拍原子運動過程 揭秘地下30米的「國之重器」 - 天天要聞

可拍原子運動過程 揭秘地下30米的「國之重器」

來源:央視新聞客戶端坐落在上海張江的硬X射線自由電子激光裝置是「十三五」國家重大科技基礎設施建設規劃優先啟動項目,也是上海(長三角)國際科技創新中心核心空間載體——張江科學城重大科技基礎設施集群的旗艦裝置,是我國實現2035年建成科技強國戰