別:從數(shù)據(jù)到部署的完整實(shí)踐指南)
簡(jiǎn)介這是一套面向Python期末大作業(yè)的人臉表情識(shí)別項(xiàng)目資源基于ResNet模型實(shí)現(xiàn)定位為高校學(xué)生課程設(shè)計(jì)、畢業(yè)設(shè)計(jì)或自學(xué)人臉識(shí)別的入門參考。壓縮包共一百零三個(gè)文件整體大小約五十四點(diǎn)一一兆字節(jié)內(nèi)容涵蓋十九個(gè)py源碼腳本和十個(gè)pyc編譯文件、三十二張png圖片與十七張jpg或jpeg圖像樣本、三個(gè)hdf5模型權(quán)重、兩個(gè)mp4演示視頻另有md說明文檔、xml工程配置、gif動(dòng)態(tài)圖等輔助材料。資源已經(jīng)過本地編譯與嚴(yán)格調(diào)試評(píng)審分達(dá)到九十五分以上訓(xùn)練、推理和演示流程均可直接復(fù)現(xiàn)。目前已有一百三十五人學(xué)習(xí)下載。隨資源提供完整數(shù)據(jù)集和說明文檔能幫助理解ResNet在表情識(shí)別任務(wù)中的網(wǎng)絡(luò)搭建、數(shù)據(jù)預(yù)處理和模型評(píng)估方法適合需要交付可靠期末項(xiàng)目或系統(tǒng)學(xué)習(xí)人臉表情識(shí)別的同學(xué)參考使用。1. 一個(gè)期末大作業(yè)為什么值得按工程標(biāo)準(zhǔn)做完把“python期末大作業(yè)基于ResNet的人臉表情識(shí)別”這行字拆開看它其實(shí)是一個(gè)相當(dāng)完整的 CV 入門閉環(huán)數(shù)據(jù)集、預(yù)處理、模型、訓(xùn)練、推理、說明書全齊。很多同學(xué)拿到這類 zip 包只想改個(gè)名字交差但這恰恰是錯(cuò)的——人臉表情識(shí)別是典型的“小圖、多類、類間差異細(xì)微、類別不均衡”任務(wù)用 ResNet 當(dāng)骨架能一口氣把遷移學(xué)習(xí)、數(shù)據(jù)增強(qiáng)、類別權(quán)重、模型可視化這些面試??键c(diǎn)全部串起來。這篇筆記我就按自己落地這類項(xiàng)目的順序把 ResNet 表情識(shí)別的數(shù)據(jù)組織、訓(xùn)練參數(shù)、踩坑記錄一次講透。適合正在做課設(shè)的學(xué)生也適合想把表情識(shí)別快速接到自己 demo 里的工程師。2. ResNet 憑什么成為表情識(shí)別的主力骨架選型理由與網(wǎng)絡(luò)結(jié)構(gòu)拆解2.1 表情識(shí)別任務(wù)對(duì)模型的三點(diǎn)苛刻要求先說清楚為什么表情識(shí)別不像貓狗分類那樣隨便選個(gè)網(wǎng)絡(luò)就能跑。第一表情數(shù)據(jù)集的原始分辨率通常很低FER2013 這類公開數(shù)據(jù)集都是 48x48 的灰度圖就算自己爬數(shù)據(jù)做人臉對(duì)齊后也就 64x64 到 96x96。圖像小意味著網(wǎng)絡(luò)不能一開始就瘋狂下采樣否則特征圖還沒成形就縮小到 4x4全局信息全丟了。第二表情類別之間的差異極度細(xì)微生氣和厭惡的嘴部線條差異可能只有幾個(gè)像素中性臉和微表情之間的邊界更模糊這要求網(wǎng)絡(luò)必須具備很強(qiáng)的中高層語義抽象能力。第三類別天然不均衡自然場(chǎng)景里“開心”“中性”出現(xiàn)的頻率遠(yuǎn)高于“厭惡”“恐懼”模型稍微偷懶一點(diǎn)就會(huì)把所有樣本都往多數(shù)類別上推。ResNet 恰好在這三點(diǎn)上都有優(yōu)勢(shì)。它的殘差結(jié)構(gòu)讓網(wǎng)絡(luò)可以在保持較高分辨率特征圖的同時(shí)堆深18 層 ResNet 在 48x48 輸入下依然能保留較完整的空間信息。而殘差連接又保證了梯度可以順暢地從最后一層傳到第一層訓(xùn)練深層模型不像 VGG 那樣讓人提心吊膽。更關(guān)鍵的是ResNet 在 ImageNet 上的預(yù)訓(xùn)練權(quán)重非常成熟torchvision 一行代碼就能加載這對(duì)小數(shù)據(jù)集任務(wù)幾乎是決定性的——表情識(shí)別公開數(shù)據(jù)集通常只有幾萬張圖從零訓(xùn)練一個(gè)深層網(wǎng)絡(luò)很容易過擬合而用預(yù)訓(xùn)練權(quán)重做遷移學(xué)習(xí)可以大幅壓低對(duì)數(shù)據(jù)量的需求。2.2 殘差結(jié)構(gòu)到底解決了什么退化不是過擬合很多資料喜歡把 ResNet 的貢獻(xiàn)概括成“解決梯度消失”但做過實(shí)驗(yàn)的人會(huì)告訴你更準(zhǔn)確的描述是“解決深層網(wǎng)絡(luò)的退化問題”。梯度消失會(huì)被 Batch Normalization 很大程度上緩解但網(wǎng)絡(luò)加深到幾十層時(shí)訓(xùn)練誤差反而會(huì)先降后升——這不是過擬合過擬合是訓(xùn)練誤差低、測(cè)試誤差高而是純粹的優(yōu)化困難。恒等映射路徑的引入改變了游戲規(guī)則哪怕后面的殘差塊什么都沒學(xué)到網(wǎng)絡(luò)也至少能保持前層已提取的特征相當(dāng)于給深層網(wǎng)絡(luò)加了一條“后悔藥”通道學(xué)到有用信息時(shí)再把殘差疊加進(jìn)去。表情識(shí)別里這個(gè)特性的具體收益是你可以放心地把 ResNet-34、ResNet-50 這類更深的變體用在表情任務(wù)上而不必?fù)?dān)心網(wǎng)絡(luò)深了反而學(xué)不動(dòng)。我實(shí)際對(duì)比過在 48x48 輸入下 ResNet-18 和 ResNet-34 的最終準(zhǔn)確率差距可能只有 1 到 2 個(gè)點(diǎn)但 ResNet-34 的收斂穩(wěn)定性更好中期波動(dòng)明顯更小。如果你的機(jī)器顯存有限ResNet-18 夠用如果追求最終指標(biāo)ResNet-34 是性價(jià)比最高的選擇。ResNet-50 在小圖上收益不明顯因?yàn)樗钠款i結(jié)構(gòu)本身是為 224x224 左右的大圖設(shè)計(jì)的。2.3 用 torchvision 加載 ResNet替換分類頭的兩種寫法不管用什么后端框架加載 ResNet 并替換分類頭都是第一步。以 PyTorch 為例我一般這樣處理import torch import torchvision.models as models # 方式一加載預(yù)訓(xùn)練權(quán)重替換最后一層分類頭 model models.resnet18(weightsmodels.ResNet18_Weights.IMAGENET1K_V1) num_features model.fc.in_features # 原分類頭輸入維度是 512resnet18或 2048resnet50 model.fc torch.nn.Linear(num_features, 7) # 7 類表情生氣、厭惡、恐懼、開心、中性、難過、驚訝 # 方式二把 ResNet 當(dāng)特征提取器只訓(xùn)練分類頭適合數(shù)據(jù)量極小的情況 for param in model.parameters(): param.requires_grad False model.fc torch.nn.Linear(num_features, 7) # 后續(xù)優(yōu)化器只傳入 model.fc.parameters()這里的核心參數(shù)是weightsmodels.ResNet18_Weights.IMAGENET1K_V1它表示加載在 ImageNet-1K 上預(yù)訓(xùn)練好的權(quán)重。ImageNet 預(yù)訓(xùn)練模型學(xué)到的是通用的邊緣、紋理、形狀特征這些底層特征對(duì)人臉和表情同樣有效所以遷移到表情任務(wù)時(shí)只需要讓網(wǎng)絡(luò)重新學(xué)“高層語義組合方式”也就是分類頭附近的那幾層。方式二之所以有效是因?yàn)楸砬閿?shù)據(jù)集往往只有幾萬張甚至幾千張圖全量微調(diào)容易讓底層特征被帶偏。我個(gè)人的習(xí)慣是數(shù)據(jù)量少于 1 萬張時(shí)用方式二先訓(xùn)出一個(gè)能用的基線數(shù)據(jù)量超過 2 萬張?jiān)俳怄i全部層微調(diào)。提示torchvision新版本里weightsmodels.ResNet18_Weights.IMAGENET1K_V1是推薦寫法舊寫法pretrainedTrue會(huì)在新版本里被移除。如果你用的是舊代碼報(bào)錯(cuò)優(yōu)先檢查這一行。3. 把人臉表情數(shù)據(jù)集喂進(jìn) ResNet目錄組織、標(biāo)簽對(duì)齊與預(yù)處理3.1 數(shù)據(jù)集目錄結(jié)構(gòu)與標(biāo)簽對(duì)齊最常見的翻車點(diǎn)表情識(shí)別數(shù)據(jù)集的來源很雜有 CSV 文件如 FER2013也有按文件夾分好的圖片目錄。不管原始格式是什么我強(qiáng)烈建議你先把數(shù)據(jù)統(tǒng)一整理成train/val/test三個(gè)文件夾每個(gè)文件夾下按類別分子目錄最終結(jié)構(gòu)長(zhǎng)這樣face_data/ ├── train/ │ ├── angry/ # 0 │ ├── disgust/ # 1 │ ├── fear/ # 2 │ ├── happy/ # 3 │ ├── neutral/ # 4 │ ├── sad/ # 5 │ └── surprise/ # 6 ├── val/ └── test/這個(gè)結(jié)構(gòu)的最大好處是torchvision.datasets.ImageFolder可以直接讀取類別標(biāo)簽按文件夾名的字母順序自動(dòng)從 0 開始編號(hào)。但注意字母順序意味著angry0, disgust1, fear2, happy3, neutral4, sad5, surprise6和你預(yù)想的順序可能不一樣。如果你后面要打印混淆矩陣或者計(jì)算每個(gè)類別的準(zhǔn)確率一定要先打印dataset.class_to_idx確認(rèn)映射關(guān)系否則經(jīng)常出現(xiàn)“模型把恐懼識(shí)別成厭惡但你在混淆矩陣?yán)锟村e(cuò)了行列”這種烏龍。我在這上面吃過虧當(dāng)時(shí)按自己以為的順序解析 CSV 標(biāo)簽訓(xùn)練集準(zhǔn)確率虛高到 99%換了測(cè)試集立刻崩到 40%查了半天才發(fā)現(xiàn)是標(biāo)簽錯(cuò)位。3.2 預(yù)處理與數(shù)據(jù)增強(qiáng)48x48 小圖的參數(shù)怎么設(shè)表情識(shí)別的輸入分辨率普遍偏低預(yù)處理階段有兩個(gè)選擇一是直接喂 48x48 原始分辨率二是先放大到 224x224 再輸入。直接喂小圖會(huì)丟失細(xì)節(jié)放大到 224x224 又會(huì)讓 ResNet 的預(yù)訓(xùn)練權(quán)重更“舒服”。我的做法是折中先用 OpenCV 的人臉檢測(cè)器把臉摳出來對(duì)齊然后縮放到 64x64最后在訓(xùn)練時(shí)隨機(jī)裁剪成 48x48 并做水平翻轉(zhuǎn)。這樣既保留了原始分辨率又給模型引入了平移不變性。數(shù)據(jù)增強(qiáng)參數(shù)上我常用的組合是隨機(jī)水平翻轉(zhuǎn)p0.5隨機(jī)旋轉(zhuǎn)正負(fù) 10 度隨機(jī)裁剪加 padding 4 像素以及輕微的顏色抖動(dòng)因?yàn)榛叶葓D轉(zhuǎn)三通道后亮度變化是主要擾動(dòng)因素。歸一化方面如果用了 ImageNet 預(yù)訓(xùn)練權(quán)重必須用 ImageNet 的均值和標(biāo)準(zhǔn)差否則預(yù)訓(xùn)練權(quán)重的統(tǒng)計(jì)量會(huì)被破壞from torchvision import transforms train_transform transforms.Compose([ transforms.Grayscale(num_output_channels3), # 灰度圖轉(zhuǎn) 3 通道匹配 ResNet 輸入 transforms.RandomHorizontalFlip(p0.5), transforms.RandomRotation(10), transforms.RandomCrop(48, padding4), transforms.ToTensor(), transforms.Normalize(mean[0.485, 0.456, 0.406], std[0.229, 0.224, 0.225]) ]) val_transform transforms.Compose([ transforms.Grayscale(num_output_channels3), transforms.ToTensor(), transforms.Normalize(mean[0.485, 0.456, 0.406], std[0.229, 0.224, 0.225]) ])上面的Grayscale(num_output_channels3)很關(guān)鍵。ResNet 的預(yù)訓(xùn)練權(quán)重第一個(gè)卷積層接受 3 通道輸入而表情數(shù)據(jù)集很多是單通道灰度圖必須復(fù)制成三通道再喂進(jìn)去。如果你用的數(shù)據(jù)集本身就是彩色人臉圖這一步可以去掉。RandomCrop(48, padding4)的意思是在原圖四周補(bǔ) 4 像素的 0 值后再隨機(jī)裁剪 48x48等效于給模型看稍微偏移后的同一張臉能有效抑制過擬合。注意驗(yàn)證集和測(cè)試集不能做隨機(jī)增強(qiáng)只能做縮放和中值裁剪之類確定性變換否則同一張圖每次評(píng)估結(jié)果都不一樣你沒法判斷訓(xùn)練過程中的波動(dòng)是模型問題還是數(shù)據(jù)擾動(dòng)問題。3.3 自定義 Dataset處理 CSV 格式表情數(shù)據(jù)的標(biāo)準(zhǔn)寫法如果你的數(shù)據(jù)是 FER2013 那種 CSV 格式第一列是像素值第二列是標(biāo)簽或者需要從數(shù)據(jù)庫讀圖片ImageFolder就不好使了。這時(shí)候?qū)懸粋€(gè)自定義Dataset子類是最穩(wěn)的。我之前處理這類 CSV 數(shù)據(jù)的模板代碼如下import torch from torch.utils.data import Dataset from PIL import Image import numpy as np import os class FerCsvDataset(Dataset): 讀取 emotion CSV 數(shù)據(jù)集每行 label, pixels像素以空格分隔的灰度值 def __init__(self, csv_path, transformNone): self.samples [] self.transform transform with open(csv_path, r) as f: lines f.read().strip().splitlines()[1:] # 跳過表頭 for line in lines: parts line.split(,) label int(parts[0]) pixels np.array(parts[1].split(), dtypenp.uint8) self.samples.append((pixels, label)) def __len__(self): return len(self.samples) def __getitem__(self, idx): pixels, label self.samples[idx] # 48x48 灰度圖重建 img Image.fromarray(pixels.reshape(48, 48)) if self.transform: img self.transform(img) return img, label這里兩個(gè)操作要注意。第一lines[1:]跳過表頭如果數(shù)據(jù)文件本身沒有表頭這個(gè)切片會(huì)誤刪第一行樣本所以打開文件后先打印前兩行確認(rèn)格式再?zèng)Q定要不要跳。第二像素用空格分隔時(shí)parts[1].split()會(huì)得到一長(zhǎng)串字符串轉(zhuǎn)成np.uint8數(shù)組后 reshape 成 48x48。有些 CSV 的像素分隔符是逗號(hào)那split(,)和split()的處理就完全相反——先確認(rèn)再寫代碼別猜。訓(xùn)練時(shí)配合DataLoader使用from torch.utils.data import DataLoader train_dataset FerCsvDataset(data/fer2013/train.csv, transformtrain_transform) val_dataset FerCsvDataset(data/fer2013/val.csv, transformval_transform) train_loader DataLoader(train_dataset, batch_size64, shuffleTrue, num_workers4, pin_memoryTrue) val_loader DataLoader(val_dataset, batch_size64, shuffleFalse, num_workers4, pin_memoryTrue)batch_size的選擇要結(jié)合顯存和 BN 層特性下一章細(xì)說。shuffleTrue對(duì)訓(xùn)練集是必須的否則每個(gè) epoch 內(nèi)樣本順序固定BN 的統(tǒng)計(jì)量估計(jì)會(huì)偏差。4. 訓(xùn)練與微調(diào)從 ImageNet 預(yù)訓(xùn)練權(quán)重到表情分類的落地參數(shù)4.1 遷移學(xué)習(xí) vs 從零訓(xùn)練預(yù)訓(xùn)練權(quán)重到底帶來了多少收益直接說結(jié)論在表情識(shí)別這種小數(shù)據(jù)集任務(wù)上用 ImageNet 預(yù)訓(xùn)練權(quán)重的 ResNet-18 比從零訓(xùn)練的 ResNet-18 最終準(zhǔn)確率能高出 8 到 15 個(gè)百分點(diǎn)而且收斂速度快一倍以上。原因是底層卷積核的可遷移性ImageNet 上學(xué)到的邊緣檢測(cè)、紋理模式、顏色統(tǒng)計(jì)對(duì)人臉同樣適用表情識(shí)別真正需要學(xué)的是“嘴部線條的組合方式”這類高層特征。從零訓(xùn)練意味著網(wǎng)絡(luò)得重新摸索這些底層特征幾萬張表情圖根本不夠。但預(yù)訓(xùn)練權(quán)重也不是沒有副作用。ImageNet 權(quán)重是平均臉朝向居中、尺度相對(duì)固定的自然圖像上訓(xùn)練出來的表情數(shù)據(jù)集里的人臉往往有偏轉(zhuǎn)、遮擋、夸張角度這會(huì)導(dǎo)致預(yù)訓(xùn)練階段學(xué)到的某些對(duì)“貓耳朵”“車輪”敏感的高層神經(jīng)元被激活產(chǎn)生干擾。我在實(shí)際項(xiàng)目里觀察到直接用預(yù)訓(xùn)練權(quán)重微調(diào)時(shí)前一兩個(gè) epoch 的損失會(huì)比從零訓(xùn)練更低但隨后會(huì)有一段“平臺(tái)期”——這是在修正高層的偏置。這個(gè)過程很正常不要因?yàn)閾p失不降就急著調(diào)學(xué)習(xí)率耐心讓網(wǎng)絡(luò)自己洗掉那些與表情無關(guān)的激活模式。4.2 三個(gè)必調(diào)的參數(shù)學(xué)習(xí)率、batch size 和類別權(quán)重學(xué)習(xí)率是整個(gè)訓(xùn)練里最玄學(xué)的參數(shù)。遷移學(xué)習(xí)場(chǎng)景下我一般用1e-4起步比從零訓(xùn)練的1e-3要低一個(gè)量級(jí)——因?yàn)轭A(yù)訓(xùn)練權(quán)重已經(jīng)在一個(gè)很低的損失區(qū)域步子邁太大容易一步跨出好位置。優(yōu)化器我推薦 AdamW權(quán)重衰減設(shè)1e-4或5e-5它比 SGD 對(duì)學(xué)習(xí)率更寬容適合非資深玩家如果你想要極限精度可以把模型訓(xùn)練到后半段切到 SGDmomentum 繼續(xù)調(diào)。學(xué)習(xí)率調(diào)度用余弦退火CosineAnnealingLR或者按 epoch 手動(dòng)衰減每 10 個(gè) epoch 乘 0.1。表情識(shí)別的訓(xùn)練 epoch 數(shù)不用太多30 到 50 個(gè) epoch 足夠收斂再多就會(huì)陷入過擬合區(qū)間。batch size 的取值受限于 BN 層ResNet 的 BatchNorm 在一個(gè) batch 內(nèi)統(tǒng)計(jì)均值和方差batch size 太小小于 16會(huì)導(dǎo)致 BN 統(tǒng)計(jì)不穩(wěn)定損失曲線像鋸齒一樣抖batch size 太大又會(huì)超出顯存。我一般用 64顯存小于 4GB 時(shí)降到 32。另一個(gè)關(guān)鍵點(diǎn)是如果加載了預(yù)訓(xùn)練權(quán)重前幾個(gè) epoch 最好凍結(jié)所有 BN 層的 running_mean 和 running_var因?yàn)檫@些統(tǒng)計(jì)量是 ImageNet 數(shù)據(jù)的分布小 batch 上更新會(huì)污染它們。PyTorch 里凍結(jié) BN 的寫法是def set_bn_eval(model): for m in model.modules(): if isinstance(m, torch.nn.BatchNorm2d): m.eval() # 使用 running_mean / running_var不再更新 # 在訓(xùn)練循環(huán)里前 5 個(gè) epoch 凍結(jié) BN之后恢復(fù)訓(xùn)練模式 if epoch 5: set_bn_eval(model) else: model.train()類別權(quán)重是表情任務(wù)不能省的一步。我用torch.nn.CrossEntropyLoss(weightclass_weights)權(quán)重的計(jì)算方式最常見的是1 / 類別樣本數(shù)然后歸一化也可以直接用torch.sqrt(1 / 類別頻率)來壓低少數(shù)類的影響。類別不均衡嚴(yán)重時(shí)比如“厭惡”樣本只有“開心”的十分之一不加權(quán)重的話模型會(huì)把所有不確定樣本都判成“開心”混淆矩陣會(huì)難看得讓你懷疑人生。4.3 訓(xùn)練主循環(huán)從數(shù)據(jù)加載到模型保存的完整骨架下面給一份可以直接跑的訓(xùn)練代碼骨架我做課設(shè)或小項(xiàng)目時(shí)一般就用這個(gè)底子改。注意代碼里的device判斷、驗(yàn)證階段的torch.no_grad()和最終模型保存方式這三個(gè)地方最容易寫錯(cuò)。import torch import torch.nn as nn from torch.optim import AdamW from torch.optim.lr_scheduler import CosineAnnealingLR device torch.device(cuda if torch.cuda.is_available() else cpu) model model.to(device) # 類別權(quán)重按訓(xùn)練集各類別樣本數(shù)反比計(jì)算 import numpy as np train_labels [label for _, label in train_dataset.samples] counts np.bincount(train_labels, minlength7) weights torch.tensor(1.0 / (counts 1e-6), dtypetorch.float32).to(device) criterion nn.CrossEntropyLoss(weightweights) # 如果你覺得上述權(quán)重太激進(jìn)可以用 sqrt 平滑 # smooth_weights torch.sqrt(weights / weights.sum()) * 7 optimizer AdamW(model.parameters(), lr1e-4, weight_decay1e-4) scheduler CosineAnnealingLR(optimizer, T_max40) best_val_acc 0.0 for epoch in range(40): model.train() if epoch 3: set_bn_eval(model) # 凍結(jié) BN 統(tǒng)計(jì)量 total_loss 0.0 correct 0 total 0 for images, labels in train_loader: images, labels images.to(device), labels.to(device) outputs model(images) loss criterion(outputs, labels) optimizer.zero_grad() loss.backward() optimizer.step() total_loss loss.item() * images.size(0) _, preds torch.max(outputs, 1) correct (preds labels).sum().item() total labels.size(0) train_acc correct / total val_acc evaluate(model, val_loader, device) scheduler.step() print(fEpoch {epoch1:02d} | Loss {total_loss/total:.4f} | fTrain Acc {train_acc:.4f} | Val Acc {val_acc:.4f}) if val_acc best_val_acc: best_val_acc val_acc torch.save({model_state_dict: model.state_dict(), class_to_idx: train_dataset.class_to_idx if hasattr(train_dataset, class_to_idx) else None}, best_model.pth)配合的驗(yàn)證函數(shù)def evaluate(model, val_loader, device): model.eval() correct 0 total 0 with torch.no_grad(): # 驗(yàn)證階段不計(jì)算梯度節(jié)省顯存且加速 for images, labels in val_loader: images, labels images.to(device), labels.to(device) outputs model(images) _, preds torch.max(outputs, 1) correct (preds labels).sum().item() total labels.size(0) return correct / total關(guān)于模型保存方式我見過好多人只存model.state_dict()結(jié)果推理時(shí)不知道輸入尺寸和類別數(shù)還得回頭翻代碼。所以我習(xí)慣把class_to_idx和num_classes一起存進(jìn) pth 文件這樣部署和復(fù)現(xiàn)時(shí)一眼就能確認(rèn)。另外torch.save一個(gè)包含state_dict的字典比直接torch.save(model, ...)安全得多——后者會(huì)連著類和設(shè)備信息一起序列化換臺(tái)機(jī)器經(jīng)常報(bào)錯(cuò)。提示如果訓(xùn)練時(shí)顯卡顯存不夠把batch_size減半的同時(shí)記得把num_workers調(diào)小比如從 4 降到 2。num_workers過大和 batch size 過小同時(shí)出現(xiàn)時(shí)數(shù)據(jù)加載會(huì)成為新瓶頸GPU 利用率上不去。5. 常見問題與避坑訓(xùn)練崩潰、過擬合和推理翻車的 5 個(gè)案例5.1 訓(xùn)練第一個(gè) epoch 損失直接變成 NaN現(xiàn)象是 loss 打印出來就是nan或者從某個(gè) batch 開始突然變成nan之后再也回不來了。最常見的原因是學(xué)習(xí)率太大導(dǎo)致梯度爆炸但 ResNet 加 BN 對(duì)梯度爆炸容忍度其實(shí)不低所以八成是別的問題。我之前排查過的一個(gè)隱藏原因是輸入圖片里含有全黑或全白的異常樣本經(jīng)過Normalize后這些像素值變成極端大數(shù)把第一層卷積的數(shù)值范圍直接頂爆。解決辦法是數(shù)據(jù)加載完后跑一遍完整性檢查for i, (img, label) in enumerate(train_dataset): if img is None or (img 0).all(): print(fBad sample at index {i}, label {label}) break如果數(shù)據(jù)本身沒問題就把學(xué)習(xí)率降到1e-5重試一步步往上加。還有一種情況是損失函數(shù)里的weight參數(shù)包含了 0 值導(dǎo)致某些類別的梯度恒為 0從而讓對(duì)應(yīng) logit 瘋長(zhǎng)最后數(shù)值溢出。給權(quán)重加一個(gè)極小值1e-6就能避免。5.2 訓(xùn)練集準(zhǔn)確率 98%驗(yàn)證集卡在 60%這是表情識(shí)別項(xiàng)目里最經(jīng)典的血淚經(jīng)驗(yàn)過擬合。癥狀是前 10 個(gè) epoch 訓(xùn)練集和驗(yàn)證集同步上升之后訓(xùn)練集繼續(xù)漲驗(yàn)證集開始震蕩甚至下降。原因有兩個(gè)一是數(shù)據(jù)量太少表情數(shù)據(jù)集和 ImageNet 的規(guī)模差距太大二是模型參數(shù)太多ResNet-50 在小數(shù)據(jù)集上比 ResNet-18 更容易過擬合。解決辦法按優(yōu)先級(jí)排先加強(qiáng)數(shù)據(jù)增強(qiáng)加光照擾動(dòng)、隨機(jī)遮擋再砍模型換小一點(diǎn)的 ResNet-18最后考慮加 dropout。表情識(shí)別這種任務(wù)測(cè)試集準(zhǔn)確率比“訓(xùn)練集做到完美”重要得多因?yàn)槟愕哪P妥罱K是要在別人的照片上跑的。還有個(gè)容易被忽略的原因驗(yàn)證集和訓(xùn)練集的人臉來源重疊。很多表情數(shù)據(jù)集是按幀從視頻里切出來的同一個(gè)人的相鄰幀被分進(jìn)訓(xùn)練集和驗(yàn)證集導(dǎo)致模型“記住”了這個(gè)人而不是學(xué)會(huì)了表情。正確做法是按視頻或人物 ID 劃分?jǐn)?shù)據(jù)集而不是按幀隨機(jī)分。遇到這種情況重劃驗(yàn)證集后準(zhǔn)確率會(huì)掉下來但這才是真實(shí)水平。5.3 攝像頭推理卡頓幀率只有 5 FPS訓(xùn)練好的模型拿到攝像頭實(shí)時(shí)推理時(shí)卡頓90% 的問題不在模型計(jì)算本身而在預(yù)處理鏈路。常見的是每幀都用 PIL 加載、轉(zhuǎn)格式、單張送 GPU來回切換損耗巨大。正確的推理流程是用 OpenCV 讀幀 → 人臉檢測(cè)器定位 → 裁剪對(duì)齊 → 單張推理。并且必須開啟 eval 模式和torch.no_grad()import cv2 import torch model.eval() cap cv2.VideoCapture(0) with torch.no_grad(): while True: ret, frame cap.read() if not ret: break # 假設(shè) face 人臉檢測(cè)器返回的裁剪后 48x48 圖像 face preprocess_face(frame) # 返回 tensorshape [1,3,48,48] face face.to(device) logits model(face) _, pred torch.max(logits, 1) # 在 frame 上畫框和標(biāo)簽顯示這里有兩個(gè)隱性坑如果model.eval()忘了調(diào)BN 層還在用 batch 統(tǒng)計(jì)量單張推理時(shí)統(tǒng)計(jì)量方差巨大輸出會(huì)變得很怪如果忘了torch.no_grad()模型前向會(huì)保存中間激活用于反向傳播顯存被慢慢吃滿幾十幀后開始卡頓甚至崩潰。人臉檢測(cè)器本身也很耗計(jì)算用 OpenCV 自帶的 Haar Cascade 或者移動(dòng)端友好的檢測(cè)模型別一上來就接 YOLO。5.4 測(cè)試集準(zhǔn)確率虛高標(biāo)簽對(duì)齊問題的典型癥狀癥狀是訓(xùn)練過程一切正常訓(xùn)練/驗(yàn)證準(zhǔn)確率都很像樣子但換到真實(shí)照片上識(shí)別錯(cuò)誤百出或者測(cè)試集準(zhǔn)確率和驗(yàn)證集差一截。這種“黑匣子”式的問題十有八九是類別標(biāo)簽映射錯(cuò)位。我在章節(jié) 3.1 提到過按字母排序的問題這里再舉一個(gè)更隱蔽的場(chǎng)景CSV 數(shù)據(jù)集的 label 和文件夾的類別序號(hào)不一致。比如你的 CSV 里0angry但torchvision.datasets.ImageFolder給你分的是0angry嗎不一定如果val文件夾里子目錄順序不同同一個(gè)標(biāo)簽號(hào)對(duì)應(yīng)的類別就變了。排查辦法很簡(jiǎn)單訓(xùn)練前打印一份映射表存進(jìn)日志class_names train_dataset.classes class_to_idx train_dataset.class_to_idx print(class_to_idx) # 輸出類似 {angry: 0, disgust: 1, fear: 2, ...}訓(xùn)練完成后用這段映射表寫一個(gè)小的評(píng)估腳本單獨(dú)跑測(cè)試集并打印每一類的準(zhǔn)確率和混淆矩陣。如果某一類的準(zhǔn)確率顯著低于其他類優(yōu)先懷疑是標(biāo)簽錯(cuò)位而不是模型沒學(xué)好。血淚經(jīng)驗(yàn)這個(gè)檢查花不了 5 分鐘但能救回你一下午的調(diào)參時(shí)間。5.5 類別不均衡把“厭惡”和“恐懼”直接淹沒在自然場(chǎng)景采集的表情數(shù)據(jù)里“開心”“中性”可能各占 30%“厭惡”“恐懼”各占 5%如果不處理模型會(huì)把后兩者學(xué)成一團(tuán)噪聲?,F(xiàn)象是混淆矩陣?yán)镉幸徽袔缀醵际?0也就是“厭惡”類從未被預(yù)測(cè)過。解決手段有三層第一層是章節(jié) 4.2 說的類別權(quán)重這是最省事的第二層是過采樣每個(gè) epoch 對(duì)少數(shù)類樣本重復(fù)采樣讓每個(gè) batch 里各類別盡量均勻第三層是數(shù)據(jù)增強(qiáng)時(shí)對(duì)少數(shù)類用更強(qiáng)的擾動(dòng)。我推薦至少做到前兩層。用WeightedRandomSampler可以方便地做過采樣from torch.utils.data import WeightedRandomSampler sample_weights torch.zeros(len(train_dataset)) for i, (_, label) in enumerate(train_dataset.samples): sample_weights[i] 1.0 / counts[label] sampler WeightedRandomSampler(sample_weights, num_sampleslen(sample_weights), replacementTrue) train_loader DataLoader(train_dataset, batch_size64, samplersampler, num_workers4)注意用了sampler之后就不能再傳shuffleTrue這是DataLoader的硬性約束。num_samples通常保持和原數(shù)據(jù)集一樣大讓每個(gè) epoch 的總步數(shù)不變化。6. 讓表情識(shí)別再進(jìn)一步用 Grad-CAM 驗(yàn)證模型在看哪里表情識(shí)別做到 80% 出頭的準(zhǔn)確率后光看指標(biāo)無法判斷模型學(xué)到的策略是否合理。最常見的隱藏 bug 是模型學(xué)會(huì)“看背景”而不是“看臉”——訓(xùn)練集里”開心“的照片恰好背景偏亮”難過“的恰好偏暗模型就轉(zhuǎn)向了捷徑。Grad-CAM 是檢查這個(gè)問題的輕量工具它能生成一張熱力圖告訴我們模型做決策時(shí)重點(diǎn)關(guān)注的是輸入圖像的哪些區(qū)域。一個(gè)合理的表情識(shí)別模型熱力圖應(yīng)該集中在上半臉的眼部周圍微笑時(shí)眼輪匝肌變化和下半臉的嘴部附近如果熱力圖大面積集中在背景、額頭或者衣領(lǐng)上說明模型學(xué)歪了。用 PyTorch 計(jì)算 Grad-CAM 并不需要完整復(fù)現(xiàn)原版流程核心做法是記錄目標(biāo)特征圖對(duì)目標(biāo)類別的 logit 反向傳播取梯度對(duì)特征圖求通道平均再上采樣到輸入尺寸。以 ResNet-18 為例我通常取model.layer4[-1]的輸出作為特征圖import torch import torch.nn.functional as F def grad_cam(model, tensor, target_classNone): 返回與輸入同尺寸的熱力圖0~1shape: [H, W] device next(model.parameters()).device model.eval() feature_map None gradient None def forward_hook(module, input, output): nonlocal feature_map feature_map output.detach() def backward_hook(module, grad_input, grad_output): nonlocal gradient gradient grad_output[0].detach() # ResNet-18 的 layer4 是最后一個(gè)殘差塊組成的 stage target_layer model.layer4[-1] fh target_layer.register_forward_hook(forward_hook) bh target_layer.register_full_backward_hook(backward_hook) tensor tensor.unsqueeze(0).to(device) # [1, 3, 48, 48] logits model(tensor) if target_class is None: target_class logits.argmax(dim1).item() # 對(duì)目標(biāo)類別得分反向傳播 model.zero_grad() one_hot torch.zeros_like(logits) one_hot[0, target_class] 1.0 logits.backward(gradientone_hot) weights gradient.mean(dim(2, 3), keepdimTrue) # 通道平均權(quán)重 cam (weights * feature_map).sum(dim1, keepdimTrue) # 加權(quán)求和 cam F.relu(cam) # 只保留正向影響區(qū)域 cam F.interpolate(cam, size(48, 48), modebilinear, align_cornersFalse) fh.remove() bh.remove() return cam[0, 0].cpu().numpy()register_full_backward_hook是 PyTorch 新版本推薦寫法舊版本的register_backward_hook在nn.Module上已被棄用。gradient拿到的是目標(biāo)層輸出的梯度mean(dim(2,3))是 Grad-CAM 的經(jīng)典加權(quán)操作把高寬的梯度平均成一個(gè)通道權(quán)重。最后F.relu過濾掉負(fù)貢獻(xiàn)區(qū)域因?yàn)樨?fù)的 CAM 值對(duì)應(yīng)的像素對(duì)目標(biāo)類別是抑制作用不在可視化范圍里。實(shí)際使用時(shí)把熱力圖和原圖疊加透明度設(shè) 0.4 左右然后逐個(gè)看測(cè)試集里每個(gè)類別的 sample。我自己的教訓(xùn)是模型的準(zhǔn)確率達(dá)標(biāo)不代表決策可信有一次我訓(xùn)練出的模型對(duì)”恐懼“類識(shí)別準(zhǔn)確率很高但 Grad-CAM 顯示它重點(diǎn)看的是背景里的窗戶邊緣——原因是數(shù)據(jù)里”恐懼“表情的樣本恰好全來自同一個(gè)室內(nèi)場(chǎng)景。發(fā)現(xiàn)這個(gè)問題后我把那批背景重復(fù)的樣本清洗掉重新訓(xùn)練后準(zhǔn)確率掉了 3 個(gè)百分點(diǎn)但換到真實(shí)場(chǎng)景照片上的表現(xiàn)反而提升了一截。這是我認(rèn)為整個(gè)項(xiàng)目里最有價(jià)值的一次排查也讓我養(yǎng)成了每次訓(xùn)完分類模型必看 Grad-CAM 的習(xí)慣。希望幫到你。本文還有配套的精品資源點(diǎn)擊獲取