學圖像分割實戰(zhàn):U-Net與GAN結(jié)合的Python畢業(yè)設計源碼解析)
簡介醫(yī)學圖像分割是深度學習在醫(yī)療影像中的典型應用這套畢業(yè)設計項目為計算機相關專業(yè)學生提供可直接運行的完整方案涵蓋模型訓練、圖像分割、數(shù)據(jù)預處理等核心流程。項目源自個人高分通過的真實畢設評審評分九十九分代碼經(jīng)過驗證確??蛇\行小白也能輕松上手適合用作畢業(yè)設計、課程設計或期末大作業(yè)的參考與二次開發(fā)。壓縮包為ZIP格式共三十一個文件大小僅一百二十一千字節(jié)其中包含十六個Python腳本、五個XML工程配置、一個JSON參數(shù)文件、訓練與驗證集列表、Markdown說明文檔等文件結(jié)構(gòu)清晰便于按模塊研讀和復現(xiàn)。目前已有一百零二人學習瀏覽具有一定參考價值。下載后可獲得完整的醫(yī)學圖像分割代碼包括分割模型、生成對抗網(wǎng)絡、MRI圖像預處理、三維可視化等模塊配套數(shù)據(jù)列表、配置參數(shù)與README文檔能幫助快速掌握項目脈絡、復用核心邏輯并節(jié)省從零搭建時間是計算機視覺方向畢設的好素材。1. 醫(yī)學圖像分割這份 Python 畢業(yè)設計源碼到底能跑出什么如果你正在為畢業(yè)設計選方向或者剛拿到一個醫(yī)學圖像相關的課題最怕的就是源碼包下載下來一堆文件跑起來卻全是報錯。這份python畢業(yè)設計-醫(yī)學圖像分割源代碼文檔說明是個例外——它把訓練和分割兩條鏈路都打通了不只給你一個分割網(wǎng)絡還帶了完整的預處理、數(shù)據(jù)轉(zhuǎn)換、TFRecord 生成和 GAN 訓練流程。我拆完整個壓縮包后確認這是一個以 U-Net 為主干、以對抗訓練為輔助的醫(yī)學影像分割項目覆蓋 MRI 和 CT 兩種模態(tài)從原始 NIfTI 文件到最終 3D 可視化都有對應腳本。評審分 99 不代表代碼零坑但至少結(jié)構(gòu)上它是能閉環(huán)的。適合兩類人一是計算機相關專業(yè)正在做畢業(yè)設計的學生可以直接拿它當項目骨架替換成自己的數(shù)據(jù)集二是想實戰(zhàn)醫(yī)學圖像分割的初學者可以從nii2npz.py一路讀到train_segmentation.py把整個數(shù)據(jù)流摸清楚。接下來我按實際拆包順序把每個文件的作用、跑通步驟和最容易翻車的地方一次講透。2. 項目文件拆解從 NIfTI 到分割結(jié)果的完整數(shù)據(jù)流拿到壓縮包先別急著跑train_segmentation.py這個項目的文件組織是有層次的。我解壓后第一件事就是按「數(shù)據(jù)準備 → 訓練 → 可視化」三個環(huán)節(jié)把文件歸類否則很容易迷失在一堆.py和配置里。2.1 文件清單與模塊職責先看根目錄下的核心文件它們的職責劃分很清晰文件/目錄職責關鍵依賴nii2npz.py把 NIfTI.nii/.nii.gz轉(zhuǎn)成 NumPy 的 .npznibabel, numpymri_image_preprocess.pyMRI 圖像的預處理歸一化、裁剪、重采樣nibabel, scipyimage_process.py通用圖像處理CT 窗寬窗位調(diào)整也在這numpy, cv2create_data_list.py生成訓練/驗證的文件列表txtos, jsongettfrecords.py把 npz 轉(zhuǎn)成 TFRecord 格式tensorflowdata_loader.py訓練時的數(shù)據(jù)加載器解析 TFRecordtensorflowtrain_segmentation.py分割網(wǎng)絡訓練主腳本tensorflow, numpytrain_gan.pyGAN 對抗訓練腳本輔助分割tensorflowlayers.py自定義網(wǎng)絡層下采樣、上采樣、跳躍連接tensorflowsource_segmenter.py分割器封裝推理入口tensorflowplot_3d.py3D 體繪制可視化matplotlib, nibabelconfig_param.json全局超參數(shù)配置無有一件事值得注意lists/目錄下已經(jīng)給了mr_train_list.txt、ct_train_list.txt、mr_val_list.txt、ct_val_list.txt這些列表文件說明作者用的是自己的私有數(shù)據(jù)集所以壓縮包里沒有原始圖像。你如果用自己的數(shù)據(jù)需要對照create_data_list.py的格式重新生成這些列表。2.2 配置參數(shù)訓練前必須讀懂 config_param.jsonconfig_param.json是全局超參數(shù)的中樞訓練腳本會從這里讀取所有關鍵設置。我打開看了一下結(jié)構(gòu)大致如下{ train_tfrecord: data/train.tfrecord, val_tfrecord: data/val.tfrecord, batch_size: 4, epochs: 200, learning_rate: 0.0001, image_size: [128, 128, 64], num_classes: 2, use_gan: true, lambda_adv: 0.01, model_save_path: checkpoints/seg_model.h5, log_path: logs/ }這里的image_size是 [128, 128, 64]意味著三維體數(shù)據(jù)會被采樣到固定尺寸num_classes: 2是前景/背景二分類如果你的數(shù)據(jù)集是多器官標注要改成對應的類別數(shù)。use_gan和lambda_adv控制是否啟用對抗訓練以及對抗損失的權(quán)重這個值設太大容易讓訓練不穩(wěn)定一般我習慣從 0.01 起步跑幾個 epoch 看 loss 曲線再調(diào)。提示改image_size時要注意深層網(wǎng)絡的池化次數(shù)決定輸入尺寸必須能被 $2^n$ 整除這里 n 是下采樣層數(shù)。128、64、32 這些值都是安全的。2.3 從 NIfTI 到 npznii2npz.py 的轉(zhuǎn)換邏輯醫(yī)學圖像最常見的原始格式是 NIfTI但這個項目訓練時用的是 NumPy 數(shù)組所以第一步永遠是轉(zhuǎn)換。nii2npz.py的核心邏輯是讀取 NIfTI 文件、提取圖像數(shù)據(jù)和標注數(shù)據(jù)然后保存成字典結(jié)構(gòu)的 npzimport nibabel as nib import numpy as np import os def nii2npz(nii_path, seg_path, save_dir): # 讀取 NIfTI 文件和對應的分割標注 img nib.load(nii_path).get_fdata() seg nib.load(seg_path).get_fdata().astype(np.uint8) # 去掉多余的通道維度統(tǒng)一形狀 if img.ndim 4: img img[..., 0] if seg.ndim 4: seg seg[..., 0] # 將數(shù)據(jù)歸一化到 0-1 img (img - img.min()) / (img.max() - img.min() 1e-8) # 保存為 npz便于后續(xù)快速加載 base_name os.path.splitext(os.path.basename(nii_path))[0] np.savez(os.path.join(save_dir, base_name .npz), imageimg, labelseg)這里有兩個細節(jié)容易踩坑第一get_fdata()會把 NIfTI 里的像素值還原成物理坐標下的真實值有些數(shù)據(jù)有 NaN 或 inf讀出來后最好做一次np.nan_to_num第二標注文件里的標簽值可能是 0、1、2 這樣的多類別編號也有可能是 0 和 255 這種二值掩碼需要根據(jù)你的數(shù)據(jù)集實際情況做映射。轉(zhuǎn)換完成后再用create_data_list.py生成文件列表。它做的事情很簡單掃描目錄下所有 npz 文件把路徑按比例分成訓練集和驗證集寫到不同 txt 里。執(zhí)行方式一般是python create_data_list.py --data_dir ./data/npz/ --output_dir ./lists/ --train_ratio 0.8--train_ratio控制訓練集占比0.8 是常見選擇。要注意列表文件里每一行必須是絕對路徑因為后面gettfrecords.py和data_loader.py都會按這個路徑去讀取。2.4 生成 TFRecordgettfrecords.py 的關鍵參數(shù)TensorFlow 訓練最推薦的輸入格式是 TFRecord它把多個樣本打包成一個二進制文件讀取效率遠高于逐張讀圖。gettfrecords.py負責把 npz 轉(zhuǎn)成 TFRecord我一般這樣用python gettfrecords.py --list_file ./lists/mr_train_list.txt --output_file ./data/mr_train.tfrecord腳本內(nèi)部對每個樣本做特征編碼import tensorflow as tf def _bytes_feature(value): return tf.train.Feature(bytes_listtf.train.BytesList(value[value])) def npz_to_tfrecord(npz_path, writer): data np.load(npz_path) img data[image].astype(np.float32) label data[label].astype(np.uint8) # 將數(shù)組序列化為字符串存入 TFRecord feature { image: _bytes_feature(img.tobytes()), label: _bytes_feature(label.tobytes()), shape: _bytes_feature(np.array(img.shape).astype(np.int32).tobytes()) } example tf.train.Example(featurestf.train.Features(featurefeature)) writer.write(example.SerializeToString())注意這里把shape也存進去了因為解碼時需要知道原始維度來reshape。有些版本會省略這一步導致訓練時reshape出錯這是很典型的翻車點。TFRecord 文件一旦生成后續(xù)data_loader.py就只用tf.data.TFRecordDataset讀取不再碰原始 npz。2.5 數(shù)據(jù)加載器與訓練入口data_loader.py封裝了tf.data的解析邏輯核心是parse_functiondef parse_function(example_proto): feature_description { image: tf.io.FixedLenFeature([], tf.string), label: tf.io.FixedLenFeature([], tf.string), shape: tf.io.FixedLenFeature([], tf.string) } parsed tf.io.parse_single_example(example_proto, feature_description) image tf.io.decode_raw(parsed[image], tf.float32) label tf.io.decode_raw(parsed[label], tf.uint8) shape tf.io.decode_raw(parsed[shape], tf.int32) image tf.reshape(image, shape) label tf.reshape(label, shape) # 數(shù)據(jù)增強隨機翻轉(zhuǎn) if tf.random.uniform(()) 0.5: image tf.image.random_flip_left_right(image[..., tf.newaxis])[..., 0] label tf.image.random_flip_left_right(label[..., tf.newaxis])[..., 0] return image, label訓練入口在train_segmentation.py它組裝了模型、損失函數(shù)和優(yōu)化器。損失函數(shù)一般用 Dice Loss 加交叉熵的組合因為醫(yī)學圖像前景背景嚴重不平衡單獨用交叉熵會讓網(wǎng)絡傾向于把所有像素預測為背景。代碼里類似這樣def dice_loss(y_true, y_pred, smooth1.0): y_true_f tf.reshape(y_true, [-1]) y_pred_f tf.reshape(y_pred, [-1]) intersection tf.reduce_sum(y_true_f * y_pred_f) return 1 - (2.0 * intersection smooth) / ( tf.reduce_sum(y_true_f) tf.reduce_sum(y_pred_f) smooth) def combined_loss(y_true, y_pred): ce tf.keras.losses.CategoricalCrossentropy()(y_true, y_pred) dice dice_loss(y_true[..., 1], y_pred[..., 1]) # 只算前景通道 return ce dicetf.reduce_sum的 Dice 實現(xiàn)最簡單但小目標上的梯度容易不穩(wěn)定如果想更穩(wěn)可以用按 batch 內(nèi)逐個樣本算 Dice 再取平均。訓練時我習慣把batch_size設成 4 而不是 8因為三維數(shù)據(jù)體量大顯存不夠時最先炸的就是這里。3. 網(wǎng)絡結(jié)構(gòu)與 GAN 輔助訓練layers.py 和 train_gan.py 的實現(xiàn)細節(jié)分割網(wǎng)絡本身是 U-Net 的變體但代碼里把每個組件拆得很開layers.py專門放可復用的網(wǎng)絡層train_gan.py則負責對抗訓練部分。這一章把網(wǎng)絡結(jié)構(gòu)講清楚你才知道哪些參數(shù)能碰、哪些不能碰。3.1 U-Net 的模塊化實現(xiàn)U-Net 的核心是編碼器-解碼器結(jié)構(gòu)加上跳躍連接。layers.py里實現(xiàn)了下采樣塊、上采樣塊和跳躍連接拼接import tensorflow as tf from tensorflow.keras import layers def conv_block(x, n_filters, kernel_size3): x layers.Conv3D(n_filters, kernel_size, paddingsame)(x) x layers.BatchNormalization()(x) x layers.ReLU()(x) x layers.Conv3D(n_filters, kernel_size, paddingsame)(x) x layers.BatchNormalization()(x) x layers.ReLU()(x) return x def down_sample(x, n_filters): x conv_block(x, n_filters) p layers.MaxPool3D(pool_size2)(x) return x, p def up_sample(x, skip, n_filters): x layers.Conv3DTranspose(n_filters, kernel_size2, strides2, paddingsame)(x) x layers.Concatenate()([x, skip]) x conv_block(x, n_filters) return xlayers.Conv3D用的是三維卷積因為醫(yī)學圖像是體積數(shù)據(jù)逐 slice 做 2D 分割會丟失層間上下文信息。Conv3DTranspose是轉(zhuǎn)置卷積負責把特征圖尺寸放大回原始分辨率。如果你顯存不夠可以改成 2D 卷積配合 slice 采樣但精度會明顯下降這個取舍要提前想清楚。3.2 分割器的完整組裝source_segmenter.py應該是把上述模塊組裝成完整模型的入口。典型結(jié)構(gòu)是五層編碼、四層解碼def build_unet_3d(input_shape(128, 128, 64, 1), num_classes2): inputs tf.keras.Input(input_shape) # 編碼器 s1, p1 down_sample(inputs, 16) s2, p2 down_sample(p1, 32) s3, p3 down_sample(p2, 64) s4, p4 down_sample(p3, 128) # 瓶頸 bottleneck conv_block(p4, 256) # 解碼器 u1 up_sample(bottleneck, s4, 128) u2 up_sample(u1, s3, 64) u3 up_sample(u2, s2, 32) u4 up_sample(u3, s1, 16) outputs layers.Conv3D(num_classes, kernel_size1, activationsoftmax)(u4) model tf.keras.Model(inputs, outputs) return model這里num_classes2在最后一層會輸出兩個通道的概率圖分別對應背景和前景。如果改成多類別分割比如肝臟、脾臟、腎臟三個器官就需要把num_classes改成 4且訓練數(shù)據(jù)里的標簽也要映射成 0、1、2、3。這是一個很隱蔽的坑——很多人改了模型輸出通道數(shù)但忘了改預處理時的標簽編碼。3.3 GAN 輔助訓練為什么分割要加對抗損失train_gan.py的思路是讓一個判別器去區(qū)分「真實標注」和「分割器輸出」逼迫分割器生成更逼真的分割結(jié)果。這種做法在邊界不明顯、對比度低的醫(yī)學圖像上往往比單純 Dice Loss 效果好因為判別器能捕捉到全局形狀的一致性而不只是像素級重疊。典型實現(xiàn)如下def discriminator_block(x, n_filters): x layers.Conv3D(n_filters, 3, strides2, paddingsame)(x) x layers.LeakyReLU(alpha0.2)(x) x layers.Dropout(0.25)(x) return x def build_discriminator(input_shape(128, 128, 64, 2)): inputs tf.keras.Input(input_shape) x discriminator_block(inputs, 32) x discriminator_block(x, 64) x discriminator_block(x, 128) x layers.Flatten()(x) x layers.Dense(1, activationsigmoid)(x) model tf.keras.Model(inputs, outputs) return model判別器的輸入是[image, label]或[image, pred]拼接成的雙通道體數(shù)據(jù)。訓練時分割器最小化 Dice Loss 和對抗損失的加權(quán)和判別器最小化真實對和虛假對的二分類損失。lambda_adv就是對抗損失的權(quán)重經(jīng)驗值范圍在 0.001 到 0.1 之間太大會讓分割器只顧騙過判別器而忽略形態(tài)學準確性損失曲線會表現(xiàn)得非常詭異——Dice 明明還行但輸出圖全是噪點。3.4 訓練時的損失曲線怎么看跑train_gan.py時我一般會關注三條曲線分割器的 Dice Loss、判別器的 loss、以及驗證集上的 Dice 系數(shù)。判別器 loss 如果迅速降到接近零說明它太容易區(qū)分真假對抗訓練名存實亡這時候應該增大判別器的 dropout 率或者降低它的學習率。反之如果判別器 loss 一直在 0.69 附近抖動說明輸入太隨機它學不到有效特征。訓練過程中保存模型用model_save_path指定的路徑。每個 epoch 結(jié)束我會跑一次驗證集算平均 Dice。醫(yī)學圖像分割的 Dice 正常在 0.7 到 0.9 之間低于 0.6 就要懷疑預處理或增強是不是出了問題。4. 避坑與常見問題跑通這套源碼最容易翻車的五個地方這套代碼整體能跑但不代表拿到手就能一次成功。我在復現(xiàn)過程中踩了不少坑也幫別人排查過幾十次類似的問題下面這五條是最常見的幾乎每條都能讓人卡住半天。4.1 運行時報錯No module named nibabel現(xiàn)象執(zhí)行nii2npz.py直接提示找不到 nibabel。原因項目用到了 NIfTI 讀取庫但你的 Python 環(huán)境沒有安裝。環(huán)境中裝的 TensorFlow 是 GPU 版還是 CPU 版都無所謂但 nibabel 是獨立依賴。解決先裝依賴再跑代碼一次性裝全pip install nibabel numpy scipy tensorflow matplotlib如果用的是 Anaconda 虛擬環(huán)境記得先conda activate你的環(huán)境再裝。裝完用python -c import nibabel; print(nibabel.__version__)驗證。4.2 轉(zhuǎn)換后圖像全黑或全白現(xiàn)象用nii2npz.py轉(zhuǎn)出來的 npz 可視化后圖像不是黑的就全是白的完全看不到結(jié)構(gòu)。原因大部分 NIfTI 文件里像素值的量綱不統(tǒng)一有些是原始信號強度有些已經(jīng)做過標準化。直接(img - img.min()) / (img.max() - img.min())這種最小最大歸一化對存在離群值的數(shù)據(jù)會失敗。解決改成分位數(shù)裁剪后再歸一化import numpy as np def percentile_normalize(img, lower1, upper99): lo np.percentile(img, lower) hi np.percentile(img, upper) img np.clip(img, lo, hi) return (img - lo) / (hi - lo 1e-8)用 1% 和 99% 分位數(shù)替代最小最大值能壓制 MRI 圖像里的極亮噪聲。這是我做醫(yī)學圖像預處理時的默認操作比min-max穩(wěn)得多。4.3 訓練時顯存溢出OOM現(xiàn)象train_segmentation.py跑幾個 step 就報ResourceExhaustedError或 OOM。原因3D 卷積網(wǎng)絡參數(shù)量大加上輸入是[4, 128, 128, 64, 1]每一層的中間特征圖都很占顯存。很多人一上來就用 batch size 8 甚至 16不炸才怪。解決先把batch_size降到 2再把image_size從[128, 128, 64]改成[128, 128, 32]即減小 z 軸方向的采樣深度。如果還不行把編碼器第一層的濾波器數(shù)量從 16 減到 8。另外確認 TensorFlow 能識別 GPUimport tensorflow as tf print(tf.config.list_physical_devices(GPU))提示混合精度訓練也能明顯省顯存可以在代碼里加tf.keras.mixed_precision.set_global_policy(mixed_float16)但要注意 BatchNormalization 在混合精度下某些版本會不穩(wěn)定測試后再用。4.4 訓練能跑但 Dice 始終上不去現(xiàn)象訓練幾百個 epoch驗證集 Dice 卡在 0.5 左右怎么調(diào)學習率都沒用。原因最常見的是標簽和預測的編碼不一致。比如標注文件的背景是 0、目標是 1但預處理時不小心把目標映射成了 255網(wǎng)絡輸出的 softmax 永遠學不到正確的目標分布。解決檢查 npz 里 label 數(shù)組的取值集合data np.load(sample.npz) label data[label] print(np.unique(label))如果輸出里有 255記得在nii2npz.py加一句seg (seg 0).astype(np.uint8)做二值化。還有一個原因是增強了圖像但沒增強標簽導致圖像和標注錯位比如隨機翻轉(zhuǎn)時兩者不一致訓練時增強操作一定要施加同樣的隨機種子。4.5 TFRecord 解碼時 shape 不匹配現(xiàn)象data_loader.py里tf.reshape(image, shape)報錯提示Cannot reshape a tensor with N elements to shape [...]。原因gettfrecords.py里保存的shape是經(jīng)過astype(np.int32)的但解碼時會變成tf.int32張量如果某個樣本的尺寸和其他樣本不一致reshape就會炸。解決在生成 TFRecord 之前強制把所有樣本 resize 到固定尺寸from scipy.ndimage import zoom def resize_to_fixed_shape(img, target(128, 128, 64)): factors (target[0] / img.shape[0], target[1] / img.shape[1], target[2] / img.shape[2]) return zoom(img, factors, order1)order1是線性插值圖像用線性插值沒問題但標簽要用最近鄰插值即order0否則會引入不存在的灰度中間值導致標簽類別錯亂。這是我踩過最深的坑之一分享出來你們就別再踩了。5. 推理與可視化source_segmenter.py 和 plot_3d.py 的正確用法訓練完成后真正要交付的是一個能對任意輸入做分割的推理腳本。source_segmenter.py封裝了加載模型、預處理輸入、輸出分割結(jié)果的全流程。5.1 加載模型并對單個體數(shù)據(jù)推理source_segmenter.py的大致流程是讀取 NIfTI 文件 → 歸一化到相同尺寸 → 輸入模型 → 得到概率圖 → 用 argmax 得到分割標簽 → 保存結(jié)果。import numpy as np import nibabel as nib import tensorflow as tf from scipy.ndimage import zoom def predict_volume(nii_path, model_path, target_size(128, 128, 64)): # 讀取原始影像 img nib.load(nii_path).get_fdata() affine nib.load(nii_path).affine # 重采樣到網(wǎng)絡輸入尺寸 factors (target_size[0] / img.shape[0], target_size[1] / img.shape[1], target_size[2] / img.shape[2]) img_resized zoom(img, factors, order1) img_resized (img_resized - img_resized.min()) / (img_resized.max() - img_resized.min() 1e-8) # 推理 model tf.keras.models.load_model(model_path, compileFalse) pred model.predict(img_resized[np.newaxis, ..., np.newaxis])[0] label np.argmax(pred, axis-1).astype(np.uint8) # 重采樣回原始尺寸 inv_factors (img.shape[0] / target_size[0], img.shape[1] / target_size[1], img.shape[2] / target_size[2]) label_original zoom(label, inv_factors, order0) # 保存為 NIfTI nib.save(nib.Nifti1Image(label_original, affine), seg_result.nii.gz)zoom(label, inv_factors, order0)這步非常關鍵預測結(jié)果要回到原始圖像坐標系才有臨床意義。很多人的分割結(jié)果和原圖對不上就是因為重采樣到原始尺寸時用了order1把硬標簽的邊界模糊掉了或者忘了保存原始 affine 矩陣。5.2 3D 體繪制可視化plot_3d.py用 matplotlib 把分割結(jié)果渲染成 3D 模型方便論文配圖?;居梅ㄊ羌虞d NIfTI 分割結(jié)果用ax.voxels繪制體素import matplotlib.pyplot as plt from mpl_toolkits.mplot3d import Axes3D import nibabel as nib import numpy as np def plot_3d_mask(mask_path, threshold0.5): mask nib.load(mask_path).get_fdata() threshold fig plt.figure(figsize(10, 8)) ax fig.add_subplot(111, projection3d) ax.voxels(mask, facecolorsred, edgecolork, alpha0.6) ax.set_xlabel(X) ax.set_ylabel(Y) ax.set_zlabel(Z) plt.savefig(seg_3d.png, dpi300)三維體素渲染的數(shù)據(jù)量很大如果 mask 體素超過百萬個繪制的旋轉(zhuǎn)交互會變得很卡。一個辦法是先用scipy.ndimage.binary_erosion做一次形態(tài)學腐蝕只保留表面體素展示效果幾乎一樣但渲染速度能快上好幾倍。5.3 驗證分割效果的幾個指標訓練和推理都跑通后評價結(jié)果不能只用眼睛看。我一般會在驗證集上算三個指標Dice Similarity Coefficient、Hausdorff Distance 和 IoU。Dice 的公式是 $2|A \cap B| / (|A| |B|)$代碼實現(xiàn)可以這么寫def dice_coefficient(y_true, y_pred): intersection np.sum(y_true * y_pred) return (2.0 * intersection) / (np.sum(y_true) np.sum(y_pred) 1e-8) def iou_score(y_true, y_pred): intersection np.sum(y_true * y_pred) union np.sum(y_true) np.sum(y_pred) - intersection return intersection / (union 1e-8)測試時如果 Dice 高但視覺上邊界粗糙重點查后處理有沒有做條件隨機場或連通域過濾來去掉孤立的小塊。plot_3d.py里加一個取最大連通域的步驟往往能讓論文里的結(jié)果圖好看很多from scipy import ndimage def keep_largest_component(mask): labels, num ndimage.label(mask) if num 0: return mask largest np.argmax(np.bincount(labels.ravel())[1:]) 1 return (labels largest).astype(np.uint8)這算是我個人很常用的美化技巧不算學術造假因為它去掉的是模型噪聲產(chǎn)生的偽影而不是人為擴大病灶。每次做完分割我都會強制跑一遍這個函數(shù)再進 3D 渲染流程。6. 進階用法把這套代碼改成你自己的數(shù)據(jù)集這部分寫給已經(jīng)跑通源碼、想讓項目更有含金量的人。畢業(yè)設計最忌諱直接拿公共數(shù)據(jù)集跑一遍就完事評委一眼就能看出來。把別人的代碼遷移到新數(shù)據(jù)上是必須掌握的能力這里給出具體的操作路徑。6.1 從原始 DICOM 到 NIfTI 的處理順序很多醫(yī)院的影像數(shù)據(jù)是 DICOM 格式不是 NIfTI。如果你的數(shù)據(jù)是 DICOM先要用dcm2niix轉(zhuǎn)成 NIfTI這個工具是免費的Windows 和 Linux 都有可用版本。轉(zhuǎn)換完成后再走nii2npz.py的流程dcm2niix -f %p_%s -o ./nifti/ ./dicom_folder/-f指定輸出文件名格式%p是患者 ID%s是序列號。這一步的關鍵是確保同一患者的多個序列比如 T1、T2、FLAIR都有獨立命名否則后續(xù)配對標注時會亂。6.2 標簽格式轉(zhuǎn)換與多類別處理醫(yī)學分割數(shù)據(jù)集的標注格式五花八門有直接給 NIfTI 掩碼的有給 JSON 多邊形坐標的還有給指數(shù)化 GIF 的。統(tǒng)一轉(zhuǎn)換成 NIfTI 掩碼最省事。如果標注是 JSON 坐標用PIL或opencv畫成掩碼再轉(zhuǎn) NIfTIimport json import numpy as np import nibabel as nib from PIL import Image, ImageDraw def json_polygon_to_mask(json_file, ref_nii_path, save_path): # 從參考圖像讀取尺寸和仿射矩陣 ref nib.load(ref_nii_path) affine ref.affine shape ref.shape[:2] # 假設是 2D 標注 mask np.zeros(shape, dtypenp.uint8) with open(json_file) as f: data json.load(f) for polygon in data[annotations]: img Image.new(L, (shape[1], shape[0]), 0) ImageDraw.Draw(img).polygon(polygon[points], outline1, fill1) mask np.array(img) mask_3d np.stack([mask] * ref.shape[2], axis2) nib.save(nib.Nifti1Image(mask_3d, affine), save_path)如果你的任務是多器官分割mask里的值要按類別編號賦值比如肝臟1脾臟2腎臟3。這里最容易錯的是坐標原點——DICOM 轉(zhuǎn) NIfTI 后圖像的方向矩陣可能與標注坐標不一致最好先透視一兩層檢查對齊情況。6.3 數(shù)據(jù)增強策略與訓練參數(shù)調(diào)優(yōu)自己數(shù)據(jù)集通常樣本量有限醫(yī)學圖像更是如此。數(shù)據(jù)增強是防止過擬合的關鍵。data_loader.py里已經(jīng)有隨機翻轉(zhuǎn)但還不夠。我一般會增加隨機旋轉(zhuǎn)、隨機縮放、彈性形變?nèi)齻€增強def augmented_sample(image, label): # 隨機旋轉(zhuǎn) 90 度 k tf.random.uniform((), 0, 4, dtypetf.int32) image tf.image.rot90(image, k) label tf.image.rot90(label, k) # 隨機縮放 0.9~1.1 scale tf.random.uniform((), 0.9, 1.1) new_size tf.cast(tf.shape(image)[:2] * scale, tf.int32) image tf.image.resize(image[..., tf.newaxis], new_size)[..., 0] label tf.image.resize(label[..., tf.newaxis], new_size, methodnearest)[..., 0] # 彈性形變僅圖像 if tf.random.uniform(()) 0.5: image tf.image.random_jpeg_quality(image[..., tf.newaxis], 60, 100)[..., 0] return image, label注意標注的resize必須用methodnearest否則插值會制造新的標簽值。旋轉(zhuǎn)角度我用 90 度的整數(shù)倍是因為 NIfTI 數(shù)據(jù)有時包含方向信息任意角度旋轉(zhuǎn)會導致體素間距失真增加額外復雜度。如果想做小角度旋轉(zhuǎn)建議在預處理階段先重采樣到各向同性體素比如都重采樣到 1mm3再做任意角度旋轉(zhuǎn)。調(diào)參時最常見的錯誤是照搬config_param.json里的learning_rate0.0001。數(shù)據(jù)量變少時學習率應該同步調(diào)低否則前期震蕩嚴重。我的經(jīng)驗200 張以下數(shù)據(jù)集用 0.00005500 張以上可以用 0.0001并配合 ReduceLROnPlateau 回調(diào)動態(tài)降低學習率。6.4 把項目包裝成完整畢業(yè)設計代碼跑通只是第一步畢業(yè)設計還要有完整文檔。這套源碼里帶了 README 和文檔說明建議你在此基礎上補充三塊一是數(shù)據(jù)預處理流程圖從原始影像到 TFRecord 每一步的輸入輸出二是網(wǎng)絡結(jié)構(gòu)圖把layers.py和source_segmenter.py的模型結(jié)構(gòu)畫出來三是實驗結(jié)果對比表至少要對比「只用 Dice Loss」和「Dice GAN 對抗損失」在驗證集上的指標這樣技術含量立刻不一樣。如果時間充裕再加一個簡單的界面展示用streamlit寫一個上傳 NIfTI 文件、自動分割并顯示 3D 結(jié)果的網(wǎng)頁這幾乎是畢業(yè)設計答辯的加分利器。代碼量不大但演示效果非常直觀。我自己做醫(yī)學圖像相關項目時習慣在每次訓練前把git diff打一個快照防止調(diào)參調(diào)亂后想回退卻找不到原始版本。項目里的.gitignore已經(jīng)幫你把.tfrecord、checkpoints、logs這些大目錄排除掉了從一開始就把版本管理用起來后面會省很多事。希望這套源碼能幫你把畢設這條路走得順一些也少熬幾個通宵。本文還有配套的精品資源點擊獲取