決策樹演算法是監督學習中經典的分類與回歸模型,核心邏輯是「分而治之」:通過模擬人類決策過程,將複雜問題拆解為一系列簡單的二元判斷(如「收入是否大於5萬」「年齡是否小於30歲」),最終形成樹形結構。它就像岔路選擇,從樹根開始按特徵判斷分支,直到葉子節點得出類別或數值結果,邏輯直觀易懂,無需專業知識就能理解決策過程。
其核心特點是「可解釋性極強」和「無需預處理」:區別於貝葉斯、KNN等演算法,決策樹的樹形結構能清晰展示每一步決策依據,可直接用於業務解釋;同時對特徵量級不敏感,無需歸一化或標準化,能直接處理混合類型特徵(如連續型年齡、離散型職業)。此外,還可同時用於分類(輸出類別)和回歸(輸出數值),適用場景靈活。
核心要素包括樹形結構和分裂準則:樹形結構由根節點(初始特徵)、內部節點(判斷條件)、葉節點(結果)組成;分裂準則是構建樹的關鍵,常用信息增益(最大化信息熵降低)、Gini係數(最小化不純度),目的是讓每個分支的樣本儘可能屬於同一類別,提升決策準確性。
應用場景覆蓋多行業簡單決策任務:金融風控中,通過用戶收入、徵信等特徵判斷貸款違約風險;醫療診斷中,結合癥狀特徵輔助常見病判斷;工業質檢中,根據產品尺寸、材質等特徵區分合格/不合格品;零售行業中,依據消費特徵劃分用戶群體,支撐營銷決策。
局限主要是易過擬合:樹深度過深時會過度學習訓練數據中的雜訊,泛化能力下降;對訓練數據敏感,少量數據變化可能導致樹形結構大幅改變,穩定性較差;處理高維數據時,分裂準則可能難以精準篩選關鍵特徵,影響決策效果。
總體而言,決策樹是入門級經典演算法,以直觀的決策邏輯和強可解釋性成為業務決策的優選模型。儘管存在過擬合等局限,但通過剪枝(限制樹深度)、集成學習(如隨機森林)等優化方法可顯著提升性能,至今仍是機器學習領域的核心基礎演算法之一。
