人類和人工智慧模型在閱讀複雜的程序代碼時都會表現出類似的困惑

2025年11月30日19:42:09 科學 1008

人類和人工智慧模型在閱讀複雜的程序代碼時都會表現出類似的困惑 - 天天要聞

信息來源:https://techxplore.com/news/2025-11-humans-ai-similar-tricky-code.html

德國薩爾蘭大學與馬克斯·普朗克軟體系統研究所的科學家們在一項突破性研究中發現,大型語言模型在處理複雜程序代碼時表現出的"困惑"模式,與人類程序員的大腦活動呈現出顯著的對應關係。這一發現不僅為理解人工智慧的認知機制提供了新視角,更為開發下一代智能編程工具奠定了神經科學基礎。

該研究成果已被軟體工程領域的頂級學術會議國際軟體工程會議接受,並於近期在預印本平台arXiv發表。研究團隊通過跨學科方法,將神經科學、軟體工程與人工智慧研究相結合,揭示了一個長期困擾學界的問題:機器學習模型是否真正以類似人類的方式"理解"代碼?

腦電波與演算法不確定性的意外共鳴

此次研究的核心在於一個精巧設計的對照實驗。薩爾蘭大學軟體工程教授斯文·阿佩爾與馬克斯·普朗克研究所的瑪麗亞·托內娃帶領團隊,選取了編程領域中一類特殊的代碼模式作為研究對象——所謂的"混淆原子"。這些代碼片段雖然語法正確且簡短,卻因其反直覺的結構而容易誤導程序員,即便是經驗豐富的開發者也可能在這些代碼前栽跟頭。

研究人員採用了雙軌並行的數據採集策略。在人類測試端,他們利用此前研究中獲得的腦電圖數據和眼動追蹤記錄,這些數據來自參與者閱讀清晰代碼與混淆代碼時的實時大腦活動。與此同時,他們讓大型語言模型處理相同的代碼樣本,並通過困惑度這一成熟指標來量化模型的不確定性。困惑度是自然語言處理領域的經典評估標準,數值越高代表模型在預測下一個代碼標記時越不確定,反之則表示模型對代碼結構有較強把握。

人類和人工智慧模型在閱讀複雜的程序代碼時都會表現出類似的困惑 - 天天要聞

Sven Apel,薩爾大學計算機科學教授。圖片來源:奧利弗·迪茨

實驗結果令研究團隊感到震驚。數據分析顯示,在人類程序員遇到理解障礙的代碼位置,語言模型的困惑度曲線也出現了相應的峰值。更引人注目的是,參與者的腦電信號中出現了所謂的"晚期額葉正波"——這是一種在神經語言學研究中與意外句子結構密切相關的大腦反應——其峰值出現的位置,恰好與模型不確定性最高的代碼段高度吻合。曾師從托內娃和阿佩爾的博士研究生尤瑟夫·阿卜杜勒薩拉姆表示:"我們原本預期可能會發現某些相關性,但大腦活動與模型不確定性之間如此顯著的對應關係,確實超出了我們的預料。"

從神經科學到軟體工程的轉化應用

這一發現的價值不僅限於學術層面。基於人類與機器在代碼理解上的這種一致性,研究團隊開發了一種數據驅動的自動化檢測系統,能夠識別並標註代碼中可能引發困惑的區域。在實際測試中,該演算法在超過百分之六十的案例中成功定位了已知的混淆模式,這些模式均經過人工標註驗證。更令人興奮的是,系統還發現了一百五十多個此前未被記錄的新型混淆模式,這些模式同樣與增強的大腦活動信號相關聯。

這種技術突破對軟體開發實踐具有深遠意義。當前,人工智慧輔助編程工具已經成為開發者的標準配置。根據業界統計,人工智慧生成的代碼已佔全球代碼產出的相當比例,主流工具如GitHub Copilot、亞馬遜CodeWhisperer等在集成開發環境中得到廣泛應用。然而,這些工具往往缺乏對代碼可讀性和理解難度的深層認知,無法主動識別哪些代碼可能讓開發者或未來維護者感到困惑。

新開發的檢測方法則提供了一種解決方案。想像一下,當程序員在編輯器中輸入代碼時,系統能夠實時高亮顯示那些可能引發理解困難的部分,就像拼寫檢查工具標記錯別字一樣。這種功能不僅能夠提升代碼的可維護性,還能減少因誤解代碼邏輯而引入的潛在缺陷。托內娃指出:"通過理解大型語言模型與人類在何處以及為何遇到相同的理解障礙,我們能夠設計出真正以人為本的開發工具,顯著改善人機協作效率。"

跨學科研究開闢的新疆域

這項研究的方法論本身也具有創新性。傳統的軟體工程研究往往依賴代碼度量指標、用戶調查或行為觀察,而神經科學方法的引入為理解程序員的認知過程打開了一扇新窗口。腦電圖技術能夠捕捉到毫秒級的大腦活動變化,這種時間解析度遠超傳統方法,使研究者能夠精確定位認知困難發生的時刻。

眼動追蹤技術的應用則進一步豐富了數據維度。通過分析程序員的注視時長和視線跳轉模式,研究者能夠推斷哪些代碼元素吸引了更多認知資源。當這些行為數據與腦電信號相結合時,便能構建出程序理解過程的全景圖。

更重要的是,這項研究建立了一座連接人工智慧與神經科學的橋樑。長期以來,深度學習模型常被批評為"黑箱",其內部決策過程難以解釋。通過將模型的困惑度與人類大腦活動進行對比,研究者實際上是在為理解模型的"思考"方式提供一種生物學參照系。這種對照不僅驗證了大型語言模型在某些認知任務上確實模擬了人類的處理模式,也指出了未來模型改進的方向——讓機器的"困惑"分布更加接近人類專家,從而提升其在實際應用中的可靠性。

面向未來的智能編程生態

阿佩爾教授強調,這項工作只是起點。團隊的長遠目標是建立一個完整的認知模型,能夠預測不同背景和經驗水平的程序員在面對特定代碼時可能遇到的理解障礙。這需要更大規模的數據採集,涵蓋不同編程語言、編程範式以及開發者群體。

從產業角度看,這類研究成果有望催生新一代智能開發環境。除了代碼生成和自動補全,未來的人工智慧助手可能具備"認知適配"能力:根據開發者的實時腦電信號或行為模式,動態調整代碼建議的呈現方式,主動簡化複雜邏輯,甚至在檢測到理解困難時提供即時解釋。這種"神經響應式"編程工具將把人機交互推向新的高度。

此外,該研究方法也可擴展到軟體教育領域。通過識別新手程序員最容易混淆的代碼模式,教育者能夠設計更有針對性的教學材料,而自適應學習系統則可根據學生的認知負荷實時調整教學難度。

隨著人工智慧在軟體開發中扮演越來越重要的角色,理解機器與人類認知的異同變得至關重要。這項研究提供的證據表明,至少在代碼理解這個特定領域,兩者的"困惑"確實存在深層次的一致性。這既是對當前大型語言模型能力的肯定,也為未來構建更智能、更人性化的開發工具指明了方向。正如研究團隊所展示的,神經科學不再只是研究人腦的學問,它正在成為塑造下一代人工智慧系統的關鍵力量。

科學分類資訊推薦

首張嗅覺圖譜問世 或重塑嗅覺形成認知 - 天天要聞

首張嗅覺圖譜問世 或重塑嗅覺形成認知

研究人員以前所未有的細節繪製了小鼠鼻腔中的嗅覺受體分布圖譜。這一成果顛覆了人們對鼻子如何產生嗅覺的認知。△小鼠鼻腔的顯微鏡橫截面圖像,顯示了鼻腔上皮的解剖結構。圖片來源:Datta Lab4月28日發表於《細胞》的一項研究,揭示了感覺神經元上表達的約1100個嗅覺受體是如何在鼻腔內壁上皮組織中受到嚴格調控的空間位置...
心臟為什麼不會得癌症? - 天天要聞

心臟為什麼不會得癌症?

心臟為什麼不會得癌症?心肌細胞會進行有節律的搏動,並在個體出生後停止增殖,因此,心臟沒有再生能力。近日,義大利的里雅斯特大學醫學院Serena Zacchigna團隊完成的體內癌症模型和離體工程心臟組織實驗表明,心肌細胞搏動所產生的機械力負
暴雨、冰雹要來,廣東天氣明起大反轉!珠海接下來…… - 天天要聞

暴雨、冰雹要來,廣東天氣明起大反轉!珠海接下來……

【來源:珠海發布】「五一」假期前兩天, 珠海天氣晴好,大家都去哪裡玩了?不過天氣馬上要反轉再反轉了! 廣東明天好天氣要暫時「下線」,局部有大暴雨、小冰雹;珠海明天午後也將有雷雨+10級大風…… 這場雨會持續多久?假期接下來的天氣會怎樣?趕緊
河北衡水:假日邂逅飛行 低空魅力引遊人 - 天天要聞

河北衡水:假日邂逅飛行 低空魅力引遊人

5月2日,位於河北省衡水市的中國航協衡水航空飛行營地,各類飛行表演和低空飛行器展示吸引市民遊客觀賞。中國桃城第四屆「翱翔中國」全國低空無人飛行器大賽暨第二屆京津冀低空飛行器集采會於5月1日至2日在此舉行。圖為遊客近距離參觀飛行器。
可拍原子運動過程 揭秘地下30米的「國之重器」 - 天天要聞

可拍原子運動過程 揭秘地下30米的「國之重器」

來源:央視新聞客戶端坐落在上海張江的硬X射線自由電子激光裝置是「十三五」國家重大科技基礎設施建設規劃優先啟動項目,也是上海(長三角)國際科技創新中心核心空間載體——張江科學城重大科技基礎設施集群的旗艦裝置,是我國實現2035年建成科技強國戰