中經記者 黃永旭 西寧報道

9月21日,青海數據要素生態大會在西寧舉行,本次大會以「激活數據要素價值,賦能青海高質量發展」為核心主題,會聚了眾多行業領袖與專家,共同探討數據要素與區域經濟的深度融合路徑。
會議期間,中國信息通信研究院人工智慧研究所平台與工程化部副主任李蓀,以「站在ai產業與企業端」的務實視角,結合團隊研究實踐,深入剖析了數據在人工智慧領域的關鍵地位及未來趨勢。
近年來,人工智慧的發展有目共睹,ai大模型的創新應用也逐步進入日常生產生活。隨著人工智慧的模型訓練及可信ai的研究實踐加速深入,人工智慧領域正在經歷一場深刻的範式變革。
轉向「以數據為中心」
自2022年開始,人工智慧研究和應用重點逐步從「模型為中心」(model-centricai,mcai)轉向「數據為中心」(data-centricai,dcai)。也就是說,在模型相對固定的前提下,通過提升數據的質量和數量來提升整個模型的訓練效果。
「人工智慧每次階段性的進步,數據都扮演著重要角色,尤其在大模型時代,海量、高質量、多樣化的數據集,成為拉開模型能力差距的關鍵要素。」李蓀認為,人工智慧持續演進對數據集提出了新要求,而且,大模型技術對數據集質量和工程路線也提出了更高要求。
在技術層面,大模型對數據集的要求主要體現在三個方面,包括規模可擴展性增強、多任務適應性增強以及能力可塑性增強。
具體來說,參數規模和計算量的增加帶來了模型性能的持續提升,而一個模型能同時支持多種任務和多個模態,甚至實現跨模態,已成為新的技術追求。為了實現這些目標,迫切需要強化四類數據集的供給,包括多模態數據集、具身智能數據集、推理思維鏈數據集和長視頻數據集。
李蓀表示,這些數據集將使模型更加全面和精準地理解和處理任務,增強機器人在多樣化環境和任務中的適應性和決策智能,並促進模型推理能力的大幅提升。
此外,大模型的研究訓練中,進一步強化學習新範式聚焦於高質量推理型數據集,通過收集大量的推理相關訓練樣本和非推理訓練樣本,推理訓練監督微調數據佔比大幅減少,從而提高了模型的推理能力。
高質量數據集建設
數據產業和人工智慧的發展離不開政策的助力,近年來,國家部委和地方政府加大對「人工智慧+高質量數據集」的支持,政策協同效應開始顯現。
作為數據要素領域的行動指南,《「數據要素×」三年行動計劃》,強調打造高質量人工智慧大模型訓練數據集。2025年國務院國資委發布首批30項央企高質量數據集,覆蓋了能源、物流等關鍵領域。
同時,《關於促進數據標註產業高質量發展的實施意見》的落地,提出通過提升數據集質量、擴大應用場景、強化技術創新等舉措,為人工智慧產業發展提供關鍵支撐。截至2025年3月底,瀋陽、保定等7個數據標註基地建設高質量數據集335個。
而且,從地方層面的實踐來看,高質量數據集建設已經在各地開花。比如,上海市明確「2025年形成1000個高質量數據集」的目標,蘇州市發布首批30個工業、交通領域數據集,北京市、山東省等11個地區則通過獎補政策激勵數據建設等。
李蓀提出,「ai與數據的融合,最終要形成產業『飛輪』」,優質數據集能支撐企業研發出更優行業大模型,而大模型應用落地後,又會採集到更多真實場景數據,反哺數據集迭代。基於此,她認為,未來擁有高質量數據的企業,會持續拉開與同行的差距。
不過,在ai與數據的融合落地實踐中,仍存在一些問題。李蓀指出,當前企業在構建數據集時普遍面臨目標定位模糊、實施路徑碎片化以及技術底座薄弱等挑戰。許多企業陷入「為數據而數據」的誤區,未能將數據工程目標與核心業務指標深度綁定,導致數據價值難以轉化為模型性能的實際提升。
展望未來,李蓀表示,隨著技術的不斷進步和應用場景的持續拓展,數據與人工智慧的深度融合將成為不可逆轉的趨勢。
(編輯:王金龍 審核:童海華 校對:顏京寧)