中經記者 黃永旭 西寧報道

“如果一隻壞鍾每天只有兩次指向正確的時間,人們會不會逐漸忽視它的故障,甚至依賴它所提供的假象,大語言模型正如這隻壞鍾,它們依賴互聯網海量數據訓練,卻常常一本正經地‘胡說八道’。”9月21日,首屆青海數據要素生態大會上,浙江大學教授、博導,中國科協決策諮詢首席專家,全球數字經濟大會中國數據要素50人論壇主席王春暉如是表示。
當前,我國數據產業整體進入發展“快車道”,數據作為關鍵生產要素的價值日益凸顯。依託於數據產業支持的人工智能和ai模型的更高階進化和迭代,對高質量數據的需求尤其迫切。
高質量數據集是基石
基於當前數據產業生態以及ai大模型的訓練模式,藉助哲學家維特根斯坦的“壞鍾寓言”為引子,王春暉指出,當前大語言模型(llms)存在的“幻覺”輸出問題,若數據質量低下,模型輸出的“幻覺”將誤導認知、污染思想,而高質量數據集則是ai可信發展的基石。
據其介紹,現在,llms的訓練數據多源自互聯網,質量參差不齊,生成內容依賴“概率性匹配”,而非“事實性判斷”,這導致其常出現“幻覺現象”。
為佐證這一風險,王春暉拋出一組關鍵數據:“研究顯示,當訓練數據集中僅含0.01%的虛假文本時,模型輸出的有害內容會增加11.2%。”這一數據直指當前ai發展的核心痛點——高質量數據供給不足,尤其是專業領域數據的缺失,導致llms產生“幻覺”。
面對數據質量帶來的挑戰,王春暉強調了高質量數據集對ai大模型訓練、推理和驗證的關鍵作用,並詳細分類了高質量數據集的類型,包括通識數據集、行業通識數據集和行業專識數據集,並指出這些數據集是支撐通用大模型和行業模型落地應用的基礎。
其中,“行業通識數據集”,包含面向行業從業人員、需要一定專業背景才能理解的行業領域通用知識,主要用於支撐行業模型落地應用。如醫療健康數據:個人屬性數據、健康狀況數據、醫療應用數據、醫療支付數據、衛生資源數據以及公共衛生數據等。
而“行業專識數據集”,包含面向特定業務場景相關人員、需要較深的專業背景才能理解的行業領域專業知識,主要用於支撐業務場景模型落地應用。醫療ai離不開高質量的專家標註數據。比如醫療病理數據標註複雜耗時,必須由臨床專家執行以確保準確。
作為最新發展趨勢,ai與數據的融合發展,將逐步從以模型為中心到以數據為中心。不過,王春暉指出,以數據為中心的人工智能並未削弱以模型為中心的人工智能的價值,而是兩種範式在構建ai系統時相互補充交織。
ai時代的“提問藝術”
“人類最高級的智慧,是向自己或別人提問——蘇格拉底的這句話,在ai時代有了新註解。”在演講中,王春暉通過古希臘大哲學家蘇格拉底的提問法,強調了“提出問題”與“鑒別答案”的能力對於使用ai大模型的關鍵作用,而且提出了提示詞工程(prompt engineering)的概念。
據介紹,提示詞工程的核心是“通過精準設計提示語,引導llms生成有用內容”,而優秀的提示詞工程師需具備“專業知識+行業洞察+創意設計”能力,這一職業已成為ai服務業的“高端賽道”。
王春暉表示:“在工業、醫療、法律等領域,專業提示詞工程師能讓ai模型的效率提升30%以上——比如醫療提示詞工程師,可通過設計‘病例描述+診斷需求’的精準提示,讓ai輔助診斷的準確率大幅提高。”
王春暉進一步指出,提示詞工程的本質是“人與ai的協同對話”,而這一過程又會產生新的“高質量交互數據”,反哺數據集迭代——形成“數據→提示詞→新數據→更優模型”的閉環。
其實,8月26日,《國務院關於深入實施“人工智能+”行動的意見》中就對人工智能數據供給加以引導。要求以應用為導向,持續加強人工智能高質量數據集建設。支持發展數據標註、數據合成等技術,培育壯大數據處理和數據服務產業等。
在政策與產業結合層面,王春暉重點解讀了“健全促進實體經濟和數字經濟深度融合制度”,將此前的“數實融合”調整為“實數融合”。他認為,數智化轉型的最終目的,不是盲目的數智化應用,而是因地制宜地推動以實體經濟需求為牽引的產業數智化的高質量發展,加快實現和形成與新質生產力相適應的數智化生產關係。
(編輯:王金龍 審核:童海華 校對:顏京寧)