測模型實(shí)戰(zhàn):從CSV清洗到SHAP可解釋性全流程)
簡介面向醫(yī)療數(shù)據(jù)分類入門者的一套完整中風(fēng)預(yù)測項(xiàng)目采用Jupyter Notebook實(shí)現(xiàn)基于Kaggle公開數(shù)據(jù)按性別、年齡、疾病史與吸煙狀況等特征預(yù)測中風(fēng)風(fēng)險(xiǎn)并以F1分?jǐn)?shù)與AUC均達(dá)到1.0為優(yōu)化目標(biāo)適合學(xué)習(xí)特征工程、模型評估與可視化分析。壓縮包共11個(gè)文件大小4.36MB包含3個(gè)ipynb分析筆記、訓(xùn)練好的.pkl模型、原始CSV數(shù)據(jù)集、Python腳本、部署所需的Procfile、sh配置及說明文檔兼顧從建模到部署的完整鏈路。目前已有739人學(xué)習(xí)。借助這套項(xiàng)目可快速復(fù)現(xiàn)模型訓(xùn)練流程理解醫(yī)療數(shù)據(jù)清洗與分類建模的關(guān)鍵步驟還能參考其部署配置是一份緊湊且可操作性強(qiáng)的實(shí)踐資料。1. 腦卒中預(yù)測模型不是玄學(xué)是能救命的二分類問題每年體檢報(bào)告出來總有人盯著血壓、血糖、BMI 那一欄發(fā)呆不知道這幾個(gè)數(shù)字放在一起意味著什么。stroke-prediction-model 這個(gè)項(xiàng)目本質(zhì)上就是把這幾個(gè)常規(guī)指標(biāo)和歷史病例喂給模型讓它告訴你這個(gè)人在未來會(huì)不會(huì)中風(fēng)。它不是什么實(shí)驗(yàn)室里遙不可及的成果而是一個(gè)標(biāo)準(zhǔn)的監(jiān)督學(xué)習(xí)二分類問題特征是體檢數(shù)據(jù)和生活方式標(biāo)簽是是否發(fā)生過腦卒中。你能在這個(gè)項(xiàng)目里跑通的東西直接套用到心梗預(yù)測、糖尿病并發(fā)癥預(yù)測上也成立。它適合兩類人一類是剛學(xué)完 sklearn 想找個(gè)真實(shí)數(shù)據(jù)集練手的數(shù)據(jù)分析師另一類是想把機(jī)器學(xué)習(xí)引入體檢報(bào)告解讀的業(yè)務(wù)方——哪怕最后只做到風(fēng)險(xiǎn)評估分級也已經(jīng)比單看某個(gè)體檢指標(biāo)的“異常箭頭”有用得多。2. 讀懂 CSV 先看懂病歷stroke 數(shù)據(jù)集的字段含義與清洗邊界2.1 數(shù)據(jù)集的 12 列哪些是信號哪些是噪音先說明一下這里說的“stroke 數(shù)據(jù)集”是什么。最常見的公開來源是 Kaggle 的 Brain Stroke Dataset一個(gè) CSV 文件大約 5000 行左右每行代表一位住院或體檢患者。別看行數(shù)不多字段的醫(yī)學(xué)含義和可挖掘程度比很多百萬級數(shù)據(jù)集要高。它的 12 列分別是字段類型說明id數(shù)值患者唯一標(biāo)識訓(xùn)練時(shí)直接丟棄gender二分類男 / 女a(chǎn)ge連續(xù)值年齡hypertension二分類是否患有高血壓0 或 1heart_disease二分類是否患有心臟病0 或 1ever_married二分類是否曾結(jié)婚實(shí)際上是年齡的一個(gè)代理變量work_type多分類工作類型政府工作、個(gè)體戶、私營企業(yè)、兒童、退休Residence_type二分類城市 / 農(nóng)村avg_glucose_level連續(xù)值平均血糖水平bmi連續(xù)值身體質(zhì)量指數(shù)smoking_status多分類吸煙狀態(tài)從不吸煙、戒煙、吸煙、未知stroke二分類標(biāo)簽是否發(fā)生過腦卒中1 為正例這里第一個(gè)坑就出現(xiàn)了ever_married 這個(gè)字段本身沒有因果意義但它和年齡強(qiáng)線性相關(guān)——兒童不可能結(jié)婚退休老人絕大多數(shù)結(jié)過婚。有些初學(xué)者把它當(dāng)成獨(dú)立特征直接喂進(jìn)去結(jié)果模型給“已婚”賦予了很高的權(quán)重看起來像是“結(jié)婚會(huì)中風(fēng)”實(shí)際上是模型拿它當(dāng)年齡的代用品。建議把這個(gè)字段和 age 一起做交叉特征再進(jìn)模型或者干脆丟棄。處理這個(gè) CSV 的最小代碼是這樣import pandas as pd df pd.read_csv(stroke.csv) # 丟棄無信息字段 df.drop(columns[id], inplaceTrue) # 類別字段轉(zhuǎn)成 category 類型方便后續(xù)處理 cat_cols [gender, work_type, Residence_type, smoking_status, ever_married] for c in cat_cols: df[c] df[c].astype(category) print(df.dtypes) print(正例占比: %.4f % df[stroke].mean())正例占比這一行最關(guān)鍵。公開數(shù)據(jù)集的 stroke 標(biāo)簽占比通常在 1.5% 到 2% 之間這是一個(gè)極度不平衡的二分類問題。如果你不做任何處理直接訓(xùn)練邏輯回歸模型會(huì)學(xué)會(huì)“全部預(yù)測為 0”準(zhǔn)確率高達(dá) 98%但你什么都預(yù)測不出來。這就是為什么這個(gè)項(xiàng)目不是簡單地“跑通一個(gè)模型”就完事要從數(shù)據(jù)層面就意識到不平衡的存在。2.2 清洗不是刪行而是審問數(shù)據(jù)從哪里來再來啃硬骨頭age、bmi、smoking_status 三個(gè)字段各有各的毛病。age 字段里最容易出現(xiàn)年齡為 0 的記錄。這批數(shù)據(jù)里大約有幾十行 age0對應(yīng)的 work_type 是“children”合理地解釋是這些是嬰幼兒記錄。處理方式是保留還是剔除保留因?yàn)橹酗L(fēng)風(fēng)險(xiǎn)在年齡分布上是右偏的嬰幼兒樣本能幫助模型把“年齡小低風(fēng)險(xiǎn)”這個(gè)邊界學(xué)到。但如果是 0 歲且 avg_glucose_level 反常地高說明記錄有誤直接剔除更穩(wěn)妥。bmi 的缺失率在公開數(shù)據(jù)集里大概有 4% 左右。直接用 dropna 會(huì)丟掉這些行但更常見的問題是 bmi 與性別、年齡的交互信息——女性在低 BMI 區(qū)間的心血管保護(hù)效應(yīng)在中老年后會(huì)消失這種交互不是缺失值填充能解決的。處理辦法是結(jié)合 avg_glucose_level 和 age 做條件填充否則模型會(huì)低估 BMI 的梯度效應(yīng)。smoking_status 里的“Unknown”是個(gè)大坑。它占了接近 30% 的比例看起來像是一個(gè)合法類別其實(shí)它是數(shù)據(jù)采集時(shí)的缺失標(biāo)記。如果你把它當(dāng)成一個(gè)真實(shí)的類別做 one-hot模型會(huì)學(xué)到“Unknown 的人風(fēng)險(xiǎn)更高”這純粹是采集偏差導(dǎo)致的幻覺。我處理這個(gè)字段時(shí)的做法是把 Unknown 單獨(dú)標(biāo)記為缺失然后用多分類模型比如簡單的隨機(jī)森林基于 age、work_type、gender 做預(yù)測填充而不是直接填眾數(shù)“從不吸煙”。下面是完整的數(shù)據(jù)清洗流程import numpy as np # 1. 剔除明顯異常age0 但血糖過高的記錄 df df[~((df[age] 0) (df[avg_glucose_level] 120))] # 2. bmi 條件填充按 age 四分位和中位數(shù)填充 for q in [0.25, 0.5, 0.75]: low, high df[age].quantile(q - 0.25), df[age].quantile(q 0.25) mask (df[age] low) (df[age] high) median_bmi df.loc[mask, bmi].median() df.loc[mask df[bmi].isna(), bmi] median_bmi # 3. smoking_status 的 Unknown 視為缺失用其他特征預(yù)測填充 from sklearn.ensemble import RandomForestClassifier from sklearn.model_selection import cross_val_score df[smoking_status] df[smoking_status].replace(Unknown, np.nan) known df[df[smoking_status].notna()] unknown df[df[smoking_status].isna()] X_known known[[age, gender, work_type]].copy() X_known pd.get_dummies(X_known, drop_firstTrue) y_known known[smoking_status] X_unknown unknown[[age, gender, work_type]].copy() X_unknown pd.get_dummies(X_unknown, drop_firstTrue) clf RandomForestClassifier(n_estimators100, random_state42) clf.fit(X_known, y_known) df.loc[df[smoking_status].isna(), smoking_status] clf.predict(X_unknown)邏輯說明第 3 步你是拿“已知吸煙狀態(tài)的人”的年齡、性別、工作類型做訓(xùn)練再對“未知”的人做預(yù)測填充。這么做保留了 smoking_status 與年齡的大趨勢——年輕群體中 Unknown 的比率更高如果直接填眾數(shù)等于把年輕人全部塞進(jìn)“從不吸煙”組模型的年齡斜率會(huì)被拉平后面做可解釋性分析時(shí) SHAP 值會(huì)變得很怪。參數(shù)說明隨機(jī)森林用 100 棵樹在這個(gè)場景已經(jīng)足夠樹的深度不需要刻意限制因?yàn)橛?xùn)練集只有幾千行過擬合風(fēng)險(xiǎn)主要在特征層面而不是樹的結(jié)構(gòu)層面。如果你發(fā)現(xiàn)填充后的類別分布在 validate 集上變化很大可以把 n_estimators 降到 50并用交叉驗(yàn)證檢查穩(wěn)定性。2.3 處理類別不平衡不要在全局做 SMOTE類別不平衡的常規(guī)解法是過采樣、欠采樣、SMOTE 以及加權(quán)損失函數(shù)。很多教程直接告訴你“用 SMOTE 就行”但沒說清楚一個(gè)細(xì)節(jié)SMOTE 必須在訓(xùn)練集內(nèi)部做不能拿全套數(shù)據(jù)做完了再切訓(xùn)練測試集。一旦你先 SMOTE 再切分合成樣本的鄰近樣本會(huì)同時(shí)出現(xiàn)在訓(xùn)練集和測試集里測試集被“污染”了驗(yàn)證指標(biāo)會(huì)虛高——這是典型的 data leakage。正確的做法是把數(shù)據(jù)切分后再在訓(xùn)練集上過采樣。SMOTE 本身是合成少數(shù)類樣本的插值算法它對連續(xù)特征有效對類別特征會(huì)產(chǎn)生不合邏輯的組合比如“性別男”但“是否結(jié)婚否”且“年齡2 歲”的沖突樣本。我一般會(huì)先對類別特征做 one-hotSMOTE 生成的樣本在 one-hot 空間里大多還是連續(xù)的最后需要把超過 0.5 的維度重新閾值化否則后續(xù)樹模型還能用但邏輯回歸會(huì)認(rèn)為特征組合是合理的產(chǎn)生誤導(dǎo)。如果你用 XGBoost 或 LightGBM最簡單也最不容易出問題的做法不是 SMOTE而是調(diào) scale_pos_weight值約為負(fù)例數(shù)量除以正例數(shù)量。這個(gè)參數(shù)的效果和給正例加權(quán)等價(jià)不需要額外的數(shù)據(jù)生成也不存在泄漏問題是實(shí)戰(zhàn)里最穩(wěn)妥的起手式。3. 特征工程把年齡、血糖、BMI 變成模型真正能用的信號3.1 連續(xù)特征的截?cái)?、分箱與交互原始數(shù)據(jù)里的 avg_glucose_level 和 bmi 是連續(xù)的但在真實(shí)世界里醫(yī)生不會(huì)說“你的血糖偏高 0.3”而會(huì)說“你的血糖已經(jīng)進(jìn)入糖耐量異常區(qū)間”。樹模型能夠自動(dòng)在分裂點(diǎn)找到這些區(qū)間但邏輯回歸不能。所以特征工程的第一步是決定你要用哪種模型再倒推特征怎么造。如果你堅(jiān)持用邏輯回歸做基線建議把血糖和 BMI 做分箱同時(shí)保留原始值作為連續(xù)特征。分箱時(shí)不要用等距分箱等距分箱在年齡段會(huì)把 0 到 80 均勻切切出來的結(jié)果全是人口分布噪音沒有醫(yī)學(xué)意義。用等頻分箱或者按醫(yī)學(xué)標(biāo)準(zhǔn)手動(dòng)劃定區(qū)間更好。比如血糖低于 6.1 的為正常6.1 到 7.0 為糖耐量異常高于 7.0 為糖尿病疑似區(qū)間這三個(gè)區(qū)間和腦卒中風(fēng)險(xiǎn)的流行病學(xué)結(jié)論是對得上的。交互特征則是這個(gè)項(xiàng)目的加分項(xiàng)。高血壓和心臟病單獨(dú)分開看各自權(quán)重都不高但如果一個(gè)人同時(shí)有高血壓和糖尿病疑似血糖風(fēng)險(xiǎn)會(huì)顯著拉高。這類交互效應(yīng)靠樹模型的自動(dòng)分裂也能學(xué)一部分但顯式地把乘積項(xiàng)或邏輯與項(xiàng)喂進(jìn)去對邏輯回歸的收益非常明顯。# 血糖分箱 df[glucose_bin] pd.cut( df[avg_glucose_level], bins[0, 6.1, 7.0, np.inf], labels[normal, prediabetes, diabetes], ) # 高血壓與血糖的交互 df[htn_glucose] df[hypertension] * (df[glucose_bin] diabetes).astype(int) # 年齡與 BMI 的交互 df[age_bmi] df[age] * df[bmi] # 構(gòu)造 BMI 異常標(biāo)記 df[bmi_high] (df[bmi] 27.9).astype(int)這里把年齡乘 BMI 作為特征看起來是把兩個(gè)連續(xù)變量強(qiáng)湊成了一個(gè)高數(shù)值變量實(shí)際上這是在模擬“代謝綜合征”的概念——高 BMI 加年齡增長帶來的風(fēng)險(xiǎn)不是線性疊加而是近似乘積的關(guān)系。如果你對數(shù)值范圍敏感可以先各自標(biāo)準(zhǔn)化再相乘這樣交互項(xiàng)的量級不會(huì)把其他特征壓死。我通常不會(huì)做太多次方或開方變換因?yàn)檫@些變量在醫(yī)學(xué)上早已被研究成對數(shù)線性關(guān)系強(qiáng)行多項(xiàng)式化只會(huì)增加過擬合面。3.2 編碼方式為什么對年齡分箱比直接標(biāo)簽編碼好工作類型、吸煙狀態(tài)和性別這三個(gè)類別特征直接 LabelEncoder 是錯(cuò)誤做法因?yàn)檫@會(huì)讓模型誤以為“政府1、個(gè)體2、私營3”是有序的而實(shí)際上它們之間沒有順序關(guān)系。One-hot 是穩(wěn)妥的但有些字段的基數(shù)你會(huì)發(fā)現(xiàn)很高比如 work_type 有 5 個(gè)類別one-hot 之后產(chǎn)生 4 個(gè)新列沒什么問題但 smoking_status 如果算上 Unknown 后有 4 類會(huì)產(chǎn)生 3 列其中“從不吸煙”是頻率最高的一類會(huì)被當(dāng)成參考類其余各類的系數(shù)都相對它而言解釋這樣 OK。不過有個(gè)問題one-hot 之后腳本能跑但業(yè)務(wù)方來問“為什么從不吸煙的人中風(fēng)風(fēng)險(xiǎn)比戒煙的人還高”你會(huì)很難解釋。統(tǒng)計(jì)上這是因?yàn)椤皬牟晃鼰煛比后w里混入了大量年輕人而“戒煙”群體多半是年齡偏大的老煙民。要講清楚這個(gè)事一個(gè)技巧是把 age 做分箱后與 smoking_status 做交叉表展示每個(gè)吸煙狀態(tài)下的年齡中位數(shù)。這不改變模型但能讓你的解釋站得住腳。你還可以考慮用目標(biāo)編碼用同一組樣本的“平均中風(fēng)率”作為該類別的新編碼。比如“戒煙”這個(gè)類別的目標(biāo)均值可能高于“從不吸煙”于是編碼數(shù)值自然更大。這在樹模型上非常有效但必須防泄漏——目標(biāo)編碼必須在訓(xùn)練集內(nèi)算均值測試集用訓(xùn)練集的統(tǒng)計(jì)量去映射否則測試集信息會(huì)被間接引入訓(xùn)練過程。3.3 缺失值的邊界什么時(shí)候值得預(yù)測填充什么時(shí)候放棄bmi 的缺失率只有 4%用中位數(shù)或條件中位數(shù)填充就夠了不值得大動(dòng)干戈。但 smoking_status 的 Unknown 接近 30%這個(gè)缺失率如果再填眾數(shù)模型就會(huì)發(fā)現(xiàn)“Unknown 變成從不吸煙”這個(gè)類別后從不吸煙的中風(fēng)率反而波動(dòng)異常。我的建議是bmi 缺失用年齡分層中位數(shù)填充不引入額外模型誤差smoking_status 缺失用預(yù)測填充但要在評估時(shí)檢查填充后類別比例是否偏離先驗(yàn)如果某批數(shù)據(jù)的缺失率高于 50%放棄填充單獨(dú)生成一個(gè) is_missing 標(biāo)記列讓模型自己去學(xué)“缺失本身就是一種狀態(tài)”。第 3 條尤其適用于真實(shí)醫(yī)院數(shù)據(jù)。Tableau 類的 BI 工具看不出來但機(jī)器學(xué)習(xí)模型見過太多“缺失和異常捆綁在一起”的案例——往往是某段時(shí)間的數(shù)據(jù)采集員偷懶導(dǎo)致整批記錄的 smoking_status 全是 Unknown而這種記錄對應(yīng)的患者群體可能在年齡結(jié)構(gòu)上都不一樣。你把它填掉等于掩蓋了一種真實(shí)存在的偏差。保留 is_missing 列模型至少有機(jī)會(huì)去利用這個(gè)信號。4. 從邏輯回歸到 LightGBM基線、集成、類別不平衡三步走4.1 基線模型的建模順序與評估協(xié)議任何預(yù)測模型項(xiàng)目都應(yīng)該先跑一個(gè)簡單的基線再上黑匣子?;€的作用有兩個(gè)驗(yàn)證數(shù)據(jù)管線沒有 bug、定一個(gè)指標(biāo)下限。這里先不急著上復(fù)雜模型我把數(shù)據(jù)集按 7:3 劃分同時(shí)做分層抽樣保證 test 集里正例比例和 full 集一致。如果你用train_test_split的時(shí)候不傳stratify在 1.8% 的正例比例下測試集可能一個(gè)正例都分不到那你后面所有評估都無從談起。這里的代碼寫法要認(rèn)真看from sklearn.model_selection import train_test_split X df.drop(columns[stroke]) y df[stroke] X_train, X_test, y_train, y_test train_test_split( X, y, test_size0.3, random_state42, stratifyy, # 分層抽樣保證正例比例在 train/test 中一致 )邏輯說明stratifyy讓切分算法在選樣本時(shí)按 y 的類別比例做配額避免隨機(jī)切分導(dǎo)致的小類別丟失。對于這種正例只有 2% 的數(shù)據(jù)集這一步不是可選項(xiàng)而是必選項(xiàng)?;€模型用邏輯回歸加標(biāo)準(zhǔn)化的組合。注意邏輯回歸需要?dú)w一化特征因?yàn)槟挲g的數(shù)值范圍是 0 到 80血糖是 50 到 300BMI 是 15 到 50不歸一化的話梯度下降在表達(dá)能力上會(huì)偏向數(shù)值大的特征雖然最終收斂但訓(xùn)練時(shí)間變長系數(shù)解釋也不直觀。from sklearn.pipeline import make_pipeline from sklearn.preprocessing import StandardScaler from sklearn.linear_model import LogisticRegression from sklearn.metrics import roc_auc_score, average_precision_score # 對訓(xùn)練集做 one-hot保持測試集和訓(xùn)練集列一致 X_train pd.get_dummies(X_train, drop_firstTrue) X_test pd.get_dummies(X_test, drop_firstTrue) X_test X_test.reindex(columnsX_train.columns, fill_value0) pipe make_pipeline( StandardScaler(), LogisticRegression(max_iter1000, class_weightbalanced), ) pipe.fit(X_train, y_train) y_prob pipe.predict_proba(X_test)[:, 1] print(ROC-AUC: %.4f % roc_auc_score(y_test, y_prob)) print(PR-AUC: %.4f % average_precision_score(y_test, y_prob))class_weightbalanced是在損失函數(shù)層面給正例更高的懲罰權(quán)重權(quán)重與類別頻率成反比。這是邏輯回歸處理不平衡最簡單的方式不需要額外采樣。reindex(columnsX_train.columns, fill_value0)這行經(jīng)常被人漏掉one-hot 之后測試集如果缺少訓(xùn)練集里出現(xiàn)的某個(gè)類別列數(shù)會(huì)不一致模型調(diào)用會(huì)直接報(bào)錯(cuò)反之測試集里出現(xiàn)新類別會(huì)被原始 get_dummies 多出一列必須用 reindex 掐掉???ROC-AUC 的時(shí)候要留個(gè)心眼ROC-AUC 在某些極端不平衡場景下會(huì)虛高因?yàn)榧訇栃月实姆帜杆胸?fù)例很大即使產(chǎn)生不少假陽性FPR 依然很低。這個(gè)數(shù)據(jù)集更值得看 PR-AUC也就是 average_precision_score它在正例極少時(shí)能反映模型在“找到正例”這件事上的精確率與召回率的平衡。4.2 XGBoost 與 LightGBM 的實(shí)戰(zhàn)參數(shù)起點(diǎn)如果基線能跑到 0.85 以上的 ROC-AUC說明信號是存在的接下來就輪到集成模型上場。對于幾千行的小樣本XGBoost 和 LightGBM 的表現(xiàn)通常差別不大但 LightGBM 在訓(xùn)練速度和內(nèi)存上更優(yōu)勢特別是你用 one-hot 之后的稀疏矩陣喂它時(shí)優(yōu)勢更明顯。初次訓(xùn)練不要一上來就調(diào)參先跑一組合理的默認(rèn)點(diǎn)from lightgbm import LGBMClassifier lgb LGBMClassifier( n_estimators300, learning_rate0.05, num_leaves31, max_depth5, subsample0.8, colsample_bytree0.8, scale_pos_weighty_train.value_counts()[0] / y_train.value_counts()[1], random_state42, ) lgb.fit( X_train, y_train, eval_set[(X_test, y_test)], eval_metricauc, ) y_prob_lgb lgb.predict_proba(X_test)[:, 1] print(LGB PR-AUC: %.4f % average_precision_score(y_test, y_prob_lgb))scale_pos_weight用負(fù)例數(shù)除以正例數(shù)來算在這個(gè)數(shù)據(jù)集里大約就是 50 左右。這個(gè)值和邏輯回歸里的 class_weight 是等價(jià)思想只是 LightGBM 把它暴露成了獨(dú)立參數(shù)。eval_set必須在調(diào)參過程中始終用固定的驗(yàn)證集不能每次隨機(jī)切分否則你看到的“變好”只是數(shù)據(jù)切分帶來的波動(dòng)翻車概率極高。關(guān)于num_leaves在葉子節(jié)點(diǎn)數(shù)相同的情況下LightGBM 比 XGBoost 可以表達(dá)更復(fù)雜的函數(shù)。如果你在小樣本上把這個(gè)參數(shù)調(diào)太大模型會(huì)瘋狂分裂記憶訓(xùn)練集你會(huì)在驗(yàn)證集上看到一小段上升后快速下跌的曲線。一般我先定max_depth5把樹的深度鎖住再去動(dòng)其他參數(shù)能少掉很多頭發(fā)。4.3 為什么在 5000 行上 5 折交叉驗(yàn)證比單獨(dú)驗(yàn)證集更可靠樣本量不大時(shí)單獨(dú)劃分一個(gè) test 集的指標(biāo)方差很大。同樣是隨機(jī)種子 42 和 2024ROC-AUC 可能相差 0.03這一點(diǎn)在業(yè)務(wù)匯報(bào)時(shí)非常致命。我的做法是內(nèi)部用 5 折交叉驗(yàn)證外部留一個(gè)獨(dú)立 test 集只用來做最終確認(rèn)平時(shí)所有調(diào)參操作都看交叉驗(yàn)證的均值。from sklearn.model_selection import StratifiedKFold, cross_val_predict cv StratifiedKFold(n_splits5, shuffleTrue, random_state0) y_cv_pred cross_val_predict(lgb, X_train, y_train, cvcv, methodpredict_proba)[:, 1] print(CV PR-AUC: %.4f % average_precision_score(y_train, y_cv_pred))cross_val_predict輸出的不是一次模型預(yù)測而是每一折模型對對應(yīng)驗(yàn)證部分的預(yù)測拼起來的因此每個(gè)訓(xùn)練樣本的預(yù)測值都來自一個(gè)“沒見過它”的模型。這能比較誠實(shí)地反映模型在未知數(shù)據(jù)上的概率輸出分布。但要注意cross_val_predict的輸出不能用于計(jì)算需要全局閾值的指標(biāo)比如 F1因?yàn)槊恳徽鄣念A(yù)測分?jǐn)?shù)尺度可能略有差別拼在一起后閾值會(huì)失真。PR-AUC 和 ROC-AUC 這類排序指標(biāo)影響較小。到這里你已經(jīng)擁有了一個(gè)能跑通、結(jié)果可復(fù)現(xiàn)的基線模型和一個(gè)樹模型。下一章專門講我在實(shí)際項(xiàng)目里翻過車的地方這些坑不看代碼永遠(yuǎn)發(fā)現(xiàn)不了。5. 訓(xùn)練避坑清單數(shù)據(jù)泄漏、指標(biāo)騙局、過擬合預(yù)警5.1 現(xiàn)象測試集 ROC-AUC 0.96業(yè)務(wù)驗(yàn)證一塌糊涂原因把特征工程里的統(tǒng)計(jì)量計(jì)算放在切分之前了。我在一個(gè)類似項(xiàng)目里犯過這樣的錯(cuò)誤先對全量數(shù)據(jù)做了StandardScaler.fit()得到均值和方差然后才切分訓(xùn)練集和測試集。測試集的均值和方差已經(jīng)參與到了訓(xùn)練過程里雖然不嚴(yán)重但測試集的指標(biāo)會(huì)被“已知分布”抬高。如果換成目標(biāo)編碼或缺失值填充這類帶有標(biāo)簽信息的操作泄漏就非常嚴(yán)重了。解決所有統(tǒng)計(jì)量型操作包括填充中位數(shù)、目標(biāo)編碼類別均值、標(biāo)準(zhǔn)化均值方差全部在訓(xùn)練集內(nèi)計(jì)算然后應(yīng)用transform到測試集。我習(xí)慣把這個(gè)固定流程封裝成一個(gè)函數(shù)每次做實(shí)驗(yàn)從函數(shù)入口進(jìn)入而不是在 Notebook 單元格里隨手寫。提示判斷是否泄漏的方法很簡單——把你做特征工程的代碼跑兩遍一遍用全量數(shù)據(jù)一遍只用訓(xùn)練集數(shù)據(jù)比較測試集指標(biāo)差異。差異超過 0.01 就要警惕泄漏了。5.2 現(xiàn)象準(zhǔn)確率 98%實(shí)際一張病人報(bào)告都不敢出原因陷入了 accuracy 的騙局。98% 的準(zhǔn)確率在 1.8% 的正例比例下毫無意義模型把所有樣本都預(yù)測為負(fù)例就能拿到 98%。這類數(shù)據(jù)集的正確打開方式是 PR-AUC 和假陽性率的業(yè)務(wù)代價(jià)分析——如果模型漏掉一個(gè)真正的中風(fēng)高風(fēng)險(xiǎn)患者代價(jià)遠(yuǎn)遠(yuǎn)高于把 10 個(gè)低風(fēng)險(xiǎn)者標(biāo)記為高風(fēng)險(xiǎn)。解決先和業(yè)務(wù)方確認(rèn)場景。如果這個(gè)模型是用來“篩選高風(fēng)險(xiǎn)人群做進(jìn)一步檢查”那寧可犧牲精確率也要提高召回率并設(shè)置一個(gè)比 0.5 更低的決策閾值。這個(gè)閾值的選擇不能看 AUC要看實(shí)際可用場景下的假陽性數(shù)量。比如驗(yàn)證集上有 200 個(gè)負(fù)例你能接受把它們中的多少個(gè)誤判為高風(fēng)險(xiǎn)反推閾值。5.3 現(xiàn)象LightGBM 訓(xùn)練集 PR-AUC 0.98測試集 0.61原因過擬合。這個(gè)數(shù)據(jù)集的真實(shí)信號能撐起的 PR-AUC 上限大約在 0.60 到 0.70 之間超過這個(gè)值大概率是在記憶噪聲。我在初調(diào) num_leaves 時(shí)拉到了 128訓(xùn)練集指標(biāo)直接逼近完美。解決把 num_leaves 限制在 16 到 31 之間并打開reg_alpha和reg_lambda做 L1/L2 正則。L2 正則能讓權(quán)重均勻化L1 正則能直接把某些噪聲特征的權(quán)重壓到 0。我在小樣本數(shù)據(jù)集上常用的組合是reg_alpha0.1、reg_lambda1.0。如果想更穩(wěn)妥在 eval_set 上打開early_stopping_rounds50一旦驗(yàn)證集指標(biāo)連續(xù) 50 輪不改進(jìn)就停止訓(xùn)練。5.4 現(xiàn)象bmi 填充后又出現(xiàn)大片缺失原因不是代碼問題是原始數(shù)據(jù)里有 bmi 0 的記錄0 被當(dāng)作真實(shí)值保留了下來隨后在特征工程中這些 0 沒有參與條件中位數(shù)填充的邏輯最后被模型當(dāng)成有意義的數(shù)值。中風(fēng)風(fēng)險(xiǎn)模型如果對 bmi0 的人產(chǎn)生極端預(yù)測說出來就是個(gè)笑話。解決清洗階段就把 bmi 中小于等于 0 的記錄視為缺失與真實(shí)缺失一并處理。用df[bmi].replace(0, np.nan, inplaceTrue)統(tǒng)一標(biāo)記再走填充流程。5.5 現(xiàn)象SHAP 值解釋里“從不吸煙”比“戒煙”風(fēng)險(xiǎn)更高原因這可能不是模型錯(cuò)而是“從不吸煙”群體年齡偏小年齡變量吸收了風(fēng)險(xiǎn)解釋模型給 smoking_status 的殘余權(quán)重就被扭曲了。如果 age 沒有老年人口抽樣偏差這個(gè)現(xiàn)象不會(huì)出現(xiàn)但公開數(shù)據(jù)集多半是從體檢記錄里扒下來的老年人體檢率高年輕人體檢率低。解決不糾結(jié)單個(gè)變量的方向而是用依賴圖看 smoking_status 與 age 的交互效應(yīng)。如果這個(gè)交互在圖中清晰可見說明模型學(xué)到的邏輯是合理的只是系數(shù)解釋起來要繞一層。你還可以訓(xùn)練一個(gè)去掉 age 的對比模型看看 smoking_status 的系數(shù)方向變化用這個(gè)差異來給業(yè)務(wù)方解釋。6. 用 SHAP 看預(yù)測理由用閾值換回可解釋性模型跑完不是結(jié)束業(yè)務(wù)方或臨床人員一定會(huì)問一句“你說這個(gè)人風(fēng)險(xiǎn)高依據(jù)是什么”如果你答不上來模型就進(jìn)不了正式的決策流程。我的做法是讓 SHAP 值說話它能把黑匣子的每一次預(yù)測拆成各個(gè)特征的貢獻(xiàn)度直接給出一個(gè)可復(fù)核的決策理由。import shap explainer shap.TreeExplainer(lgb) shap_values explainer.shap_values(X_test) # 強(qiáng)制解釋單個(gè)患者 shap.initjs() shap.force_plot(explainer.expected_value, shap_values[0, :], X_test.iloc[0, :])上面這段代碼輸出的是一個(gè) force plot它會(huì)顯示基線預(yù)測值全體樣本的平均預(yù)測概率和這個(gè)患者每個(gè)特征在上面的正向或負(fù)向拉力。比如基線概率是 0.02某個(gè)患者的 age 貢獻(xiàn)值 0.03hypertension 0.01bmi 貢獻(xiàn) -0.005最終預(yù)測概率就是大約 0.045。它比“模型權(quán)重”可靠得多因?yàn)闄?quán)重在高度相關(guān)特征之間會(huì)漂移而 SHAP 值是按特征實(shí)際貢獻(xiàn)計(jì)算的。接下來是閾值調(diào)整。這個(gè)模型默認(rèn)用 0.5 作為判定閾值會(huì)漏掉大量真正的高風(fēng)險(xiǎn)患者需要基于 PR 曲線找到業(yè)務(wù)上可接受的臨界點(diǎn)。在驗(yàn)證集上模擬一下分別嘗試 0.1、0.2、0.3 三個(gè)閾值計(jì)算每種閾值下的精確率和召回率。如果業(yè)務(wù)側(cè)的資源條件允許對預(yù)測為正例的患者做二次檢查偏向召回率的閾值完全可行。from sklearn.metrics import precision_recall_curve precision, recall, thresholds precision_recall_curve(y_test, y_prob_lgb) f1_scores 2 * precision * recall / (precision recall) best_idx np.argmax(f1_scores) best_threshold thresholds[best_idx] print(最優(yōu) F1 閾值: %.3f, F1: %.3f % (best_threshold, f1_scores[best_idx]))不過用 F1 最大化選出最優(yōu)閾值在醫(yī)學(xué)場景里未必合適。F1 把精確率和召回率等權(quán)看待但在腦卒中預(yù)測這個(gè)場景里漏診的代價(jià)遠(yuǎn)高于誤報(bào)的代價(jià)。我更習(xí)慣的做法是先和業(yè)務(wù)方確認(rèn)“可容忍的假陽性數(shù)量上限”再反推閾值。比如驗(yàn)證集有 300 個(gè)負(fù)例業(yè)務(wù)方說最多能承受 10 個(gè)假陽性那就在驗(yàn)證集上把閾值從小往大調(diào)第一次讓假陽性數(shù)小于 10 的閾值就是下限。我的個(gè)人習(xí)慣是把這整套流程沉淀成一個(gè)可復(fù)用的預(yù)測評價(jià)腳本包括交叉驗(yàn)證、PR 曲線、閾值選擇、SHAP 輸出四個(gè)部分。下次換一個(gè)疾病數(shù)據(jù)集只需要修改字段映射和業(yè)務(wù)閾值約束其他代碼原樣復(fù)用。stroke-prediction-model 最好的產(chǎn)出不是那份準(zhǔn)確率報(bào)告而是這套從原始 CSV 到可解釋預(yù)測的完整鏈路——模型能不能部署上線反而次要重要的是你已經(jīng)能讓一份體檢數(shù)據(jù)在幾分鐘內(nèi)變成一個(gè)有量化依據(jù)的風(fēng)險(xiǎn)判斷。希望幫到你。本文還有配套的精品資源點(diǎn)擊獲取