
信息來源:https://techxplore.com/news/2025-11-humans-ai-similar-tricky-code.html
德國薩爾蘭大學與馬克斯·普朗克軟體系統研究所的科學家們在一項突破性研究中發現,大型語言模型在處理複雜程序代碼時表現出的"困惑"模式,與人類程序員的大腦活動呈現出顯著的對應關係。這一發現不僅為理解人工智慧的認知機制提供了新視角,更為開發下一代智能編程工具奠定了神經科學基礎。
該研究成果已被軟體工程領域的頂級學術會議國際軟體工程會議接受,並於近期在預印本平台arXiv發表。研究團隊通過跨學科方法,將神經科學、軟體工程與人工智慧研究相結合,揭示了一個長期困擾學界的問題:機器學習模型是否真正以類似人類的方式"理解"代碼?
腦電波與演算法不確定性的意外共鳴
此次研究的核心在於一個精巧設計的對照實驗。薩爾蘭大學軟體工程教授斯文·阿佩爾與馬克斯·普朗克研究所的瑪麗亞·托內娃帶領團隊,選取了編程領域中一類特殊的代碼模式作為研究對象——所謂的"混淆原子"。這些代碼片段雖然語法正確且簡短,卻因其反直覺的結構而容易誤導程序員,即便是經驗豐富的開發者也可能在這些代碼前栽跟頭。
研究人員採用了雙軌並行的數據採集策略。在人類測試端,他們利用此前研究中獲得的腦電圖數據和眼動追蹤記錄,這些數據來自參與者閱讀清晰代碼與混淆代碼時的實時大腦活動。與此同時,他們讓大型語言模型處理相同的代碼樣本,並通過困惑度這一成熟指標來量化模型的不確定性。困惑度是自然語言處理領域的經典評估標準,數值越高代表模型在預測下一個代碼標記時越不確定,反之則表示模型對代碼結構有較強把握。

Sven Apel,薩爾大學計算機科學教授。圖片來源:奧利弗·迪茨
實驗結果令研究團隊感到震驚。數據分析顯示,在人類程序員遇到理解障礙的代碼位置,語言模型的困惑度曲線也出現了相應的峰值。更引人注目的是,參與者的腦電信號中出現了所謂的"晚期額葉正波"——這是一種在神經語言學研究中與意外句子結構密切相關的大腦反應——其峰值出現的位置,恰好與模型不確定性最高的代碼段高度吻合。曾師從托內娃和阿佩爾的博士研究生尤瑟夫·阿卜杜勒薩拉姆表示:"我們原本預期可能會發現某些相關性,但大腦活動與模型不確定性之間如此顯著的對應關係,確實超出了我們的預料。"
從神經科學到軟體工程的轉化應用
這一發現的價值不僅限於學術層面。基於人類與機器在代碼理解上的這種一致性,研究團隊開發了一種數據驅動的自動化檢測系統,能夠識別並標註代碼中可能引發困惑的區域。在實際測試中,該演算法在超過百分之六十的案例中成功定位了已知的混淆模式,這些模式均經過人工標註驗證。更令人興奮的是,系統還發現了一百五十多個此前未被記錄的新型混淆模式,這些模式同樣與增強的大腦活動信號相關聯。
這種技術突破對軟體開發實踐具有深遠意義。當前,人工智慧輔助編程工具已經成為開發者的標準配置。根據業界統計,人工智慧生成的代碼已佔全球代碼產出的相當比例,主流工具如GitHub Copilot、亞馬遜CodeWhisperer等在集成開發環境中得到廣泛應用。然而,這些工具往往缺乏對代碼可讀性和理解難度的深層認知,無法主動識別哪些代碼可能讓開發者或未來維護者感到困惑。
新開發的檢測方法則提供了一種解決方案。想像一下,當程序員在編輯器中輸入代碼時,系統能夠實時高亮顯示那些可能引發理解困難的部分,就像拼寫檢查工具標記錯別字一樣。這種功能不僅能夠提升代碼的可維護性,還能減少因誤解代碼邏輯而引入的潛在缺陷。托內娃指出:"通過理解大型語言模型與人類在何處以及為何遇到相同的理解障礙,我們能夠設計出真正以人為本的開發工具,顯著改善人機協作效率。"
跨學科研究開闢的新疆域
這項研究的方法論本身也具有創新性。傳統的軟體工程研究往往依賴代碼度量指標、用戶調查或行為觀察,而神經科學方法的引入為理解程序員的認知過程打開了一扇新窗口。腦電圖技術能夠捕捉到毫秒級的大腦活動變化,這種時間解析度遠超傳統方法,使研究者能夠精確定位認知困難發生的時刻。
眼動追蹤技術的應用則進一步豐富了數據維度。通過分析程序員的注視時長和視線跳轉模式,研究者能夠推斷哪些代碼元素吸引了更多認知資源。當這些行為數據與腦電信號相結合時,便能構建出程序理解過程的全景圖。
更重要的是,這項研究建立了一座連接人工智慧與神經科學的橋樑。長期以來,深度學習模型常被批評為"黑箱",其內部決策過程難以解釋。通過將模型的困惑度與人類大腦活動進行對比,研究者實際上是在為理解模型的"思考"方式提供一種生物學參照系。這種對照不僅驗證了大型語言模型在某些認知任務上確實模擬了人類的處理模式,也指出了未來模型改進的方向——讓機器的"困惑"分布更加接近人類專家,從而提升其在實際應用中的可靠性。
面向未來的智能編程生態
阿佩爾教授強調,這項工作只是起點。團隊的長遠目標是建立一個完整的認知模型,能夠預測不同背景和經驗水平的程序員在面對特定代碼時可能遇到的理解障礙。這需要更大規模的數據採集,涵蓋不同編程語言、編程範式以及開發者群體。
從產業角度看,這類研究成果有望催生新一代智能開發環境。除了代碼生成和自動補全,未來的人工智慧助手可能具備"認知適配"能力:根據開發者的實時腦電信號或行為模式,動態調整代碼建議的呈現方式,主動簡化複雜邏輯,甚至在檢測到理解困難時提供即時解釋。這種"神經響應式"編程工具將把人機交互推向新的高度。
此外,該研究方法也可擴展到軟體教育領域。通過識別新手程序員最容易混淆的代碼模式,教育者能夠設計更有針對性的教學材料,而自適應學習系統則可根據學生的認知負荷實時調整教學難度。
隨著人工智慧在軟體開發中扮演越來越重要的角色,理解機器與人類認知的異同變得至關重要。這項研究提供的證據表明,至少在代碼理解這個特定領域,兩者的"困惑"確實存在深層次的一致性。這既是對當前大型語言模型能力的肯定,也為未來構建更智能、更人性化的開發工具指明了方向。正如研究團隊所展示的,神經科學不再只是研究人腦的學問,它正在成為塑造下一代人工智慧系統的關鍵力量。