(來源:醫學界)
轉自:醫學界
儘管前列腺癌(PCa)的早期篩查已普及,但其作為全球男性第二大常見惡性腫瘤的地位仍未改變,且是癌症死亡的第五大主因[1],但學界對其發病和進展的病因學因素仍缺乏全面的理解。臨床上面臨的挑戰不僅在於治療,更在於前端的預防和篩查。一方面,年齡、種族和遺傳等已知風險因素是不可改變的;另一方面,飲食、肥胖和環境暴露等可變因素與PCa發生之間的關係錯綜複雜,難以理清。隨著醫療數字化進程,海量高維度的臨床、實驗室和登記數據被不斷積累,然而,如何從這些龐雜的數據中提取有價值的隱藏知識,識別出真正影響疾病發生的關鍵因素,已成為公共衛生和預防醫學的瓶頸[2]。因此,迫切需要新的計算方法來系統性地梳理和評估眾多潛在風險因素,從而為制定有效的預防策略和篩查指南提供依據。
在Asian Pacific Journal of Cancer Prevention上發表的一篇前沿綜述,系統性地梳理了近十年間機器學習(ML)在探究PCa病因學因素方面的應用[3]。文章的核心貢獻在於繪製了一幅該領域的「技術圖譜」:它不僅歸納了被ML模型驗證的關鍵風險指標,也剖析了研究中偏好使用的計算方法與主要的數據來源。該文旨在釐清過去十年中該交叉學科的研究基石,為後續研究者在模型選擇、數據利用和因素聚焦方面提供了寶貴的參照基準。本文特對該綜述的核心發現進行提煉與解讀,以饗讀者。
研究設計
本篇研究是一篇系統性綜述,聚焦於利用ML技術識別前列腺癌的關鍵影響因素。本文的核心方法是遵循PRISMA指南對四大主流資料庫(PubMed, Scopus, Web of Science, IEEE)進行系統性檢索與回顧,最終納入23篇研究進行描述性分析,重點闡明了包括年齡、PSA水平、fPSA(遊離PSA)及PSAD(PSA密度)在內的最高頻風險因素,以及隨機森林、支持向量機和邏輯回歸等主流ML演算法。研究的重點在於歸納分析了當前研究中採用的計算工具(如R和Python軟體)、數據來源(如醫院記錄和SEER、PLCO等公共登記庫)以及普遍存在的局限性(如小樣本量、回顧性設計等)。在意義上,該文獻通過提煉該交叉學科的研究現狀與方法學全景,為後續研究者優化模型選擇、利用公共數據源以及改進研究設計提供了系統的基線參考與實踐指南。

研究結果
本次系統綜述的實施依賴於標準化的文獻篩選流程,旨在構建一個清晰的研究圖景。研究首先遵循PRISMA指南,對四大資料庫在2015年至2024年間的數據進行檢索,在剔除1018篇重複文獻後,通過標題摘要篩選和全文評估,最終納入23篇研究。在這一研究池中,數據顯示了明顯的地理集中性,其中中國學者發表的研究最多(7篇),其次是西班牙(3篇)。在數據收集方面,研究呈現高度的回顧性特徵,91.3%的研究(21篇)採用了回顧性設計。而在數據來源上,醫院的病歷記錄是主要來源(12篇),此外,MCC-Spain、SEER、PLCO和NCBI等公共資料庫或登記處也為研究提供了數據支持。
機器學習層面的分析揭示了指示前列腺癌風險的核心臨床與生物學因素。研究從23篇文獻中系統性地提取了超過30種影響因素。其中,年齡被證實是關聯性最強的因素,在11項研究中均被提及。其次,基於前列腺特異性抗原的指標群構成了風險預測的核心,包括PSA水平(7項研究)、fPSA(遊離PSA,6項研究)、tPSA(總PSA,6項研究)和PSAD(PSA密度,5項研究)。此外,前列腺體積、單核苷酸多態性(Single nucleotide polymorphism)、身體質量指數(Body Mass Index)以及f/t PSA比值也在多項研究中被報道,共同構成了當前ML模型預測PCa風險的多維特徵集。
表1 影響前列腺癌的因素

在演算法和工具領域,研究結果強調了特定ML方法和軟體的主導地位。儘管研究採用了多種演算法,但邏輯回歸、支持向量機和隨機森林是應用最廣泛的三種模型,均在6項研究中被使用;其次是人工神經網路(4項研究)。在分析軟體方面,R軟體(6項研究)和Python(5項研究)是研究者的首選工具。然而,該綜述也揭示了當前研究的普遍局限性:最突出的問題是未能考慮所有可能的影響因素以及樣本量過小,這兩點均在5項研究中被提及。此外,單中心研究和回顧性設計也是限制研究結果推廣性的主要瓶頸。

總結
本篇系統綜述綜合闡述了ML在識別PCa影響因素中的應用現狀,並明確了該交叉學科在過去十年中的研究圖景。研究系統性地歸納了以年齡和PSA相關指標(如fPSA, PSAD)為代表的核心風險因素,以及以隨機森林、支持向量機和邏輯回歸為代表的主流建模演算法。儘管ML方法展現了挖掘數據的潛力,但該領域的研究仍面臨嚴峻的方法學挑戰,特別是普遍存在的樣本量過小、回顧性設計和單中心數據源等局限,這嚴重製約了模型的可靠性與推廣性。未來研究的焦點應是克服這些局限,例如開展更大規模、多中心和前瞻性的研究。通過納入更全面的影響因素並改進研究設計,有望推動機器學習從「因素識別」向「精準風險預測」邁進,為前列腺癌的早期預防和篩查提供更穩健的決策支持。
參考文獻:
[1] Bray F, Laversanne M, Sung H, et al. Global cancer statistics 2022: GLOBOCAN estimates of incidence and mortality worldwide for 36 cancers in 185 countries[J]. CA Cancer J Clin. 2024;74:229–63.
[2] Hermanns T, Wettstein MS, Kaufmann B, et al. BioPrev-C - development and validation of a contemporary prostate cancer risk calculator[J]. Front Oncol. 2024;14:1343999.
[3] Mohammadi S, Imani B, Saeedi S, Amirzargar MA. Identification of Factors Affecting Prostate Cancer Using Machine Learning Methods: A Systematic Review[J]. Asian Pac J Cancer Prev, 2025, 26(5): 1519-1528.