據(jù)到部署的完整實踐指南)
簡介這是一套面向Python期末大作業(yè)的人臉表情識別項目資源基于ResNet模型實現(xiàn)定位為高校學(xué)生課程設(shè)計、畢業(yè)設(shè)計或自學(xué)人臉識別的入門參考。壓縮包共一百零三個文件整體大小約五十四點一一兆字節(jié)內(nèi)容涵蓋十九個py源碼腳本和十個pyc編譯文件、三十二張png圖片與十七張jpg或jpeg圖像樣本、三個hdf5模型權(quán)重、兩個mp4演示視頻另有md說明文檔、xml工程配置、gif動態(tài)圖等輔助材料。資源已經(jīng)過本地編譯與嚴(yán)格調(diào)試評審分達到九十五分以上訓(xùn)練、推理和演示流程均可直接復(fù)現(xiàn)。目前已有一百三十五人學(xué)習(xí)下載。隨資源提供完整數(shù)據(jù)集和說明文檔能幫助理解ResNet在表情識別任務(wù)中的網(wǎng)絡(luò)搭建、數(shù)據(jù)預(yù)處理和模型評估方法適合需要交付可靠期末項目或系統(tǒng)學(xué)習(xí)人臉表情識別的同學(xué)參考使用。1. 一個期末大作業(yè)為什么值得按工程標(biāo)準(zhǔn)做完把“python期末大作業(yè)基于ResNet的人臉表情識別”這行字拆開看它其實是一個相當(dāng)完整的 CV 入門閉環(huán)數(shù)據(jù)集、預(yù)處理、模型、訓(xùn)練、推理、說明書全齊。很多同學(xué)拿到這類 zip 包只想改個名字交差但這恰恰是錯的——人臉表情識別是典型的“小圖、多類、類間差異細(xì)微、類別不均衡”任務(wù)用 ResNet 當(dāng)骨架能一口氣把遷移學(xué)習(xí)、數(shù)據(jù)增強、類別權(quán)重、模型可視化這些面試??键c全部串起來。這篇筆記我就按自己落地這類項目的順序把 ResNet 表情識別的數(shù)據(jù)組織、訓(xùn)練參數(shù)、踩坑記錄一次講透。適合正在做課設(shè)的學(xué)生也適合想把表情識別快速接到自己 demo 里的工程師。2. ResNet 憑什么成為表情識別的主力骨架選型理由與網(wǎng)絡(luò)結(jié)構(gòu)拆解2.1 表情識別任務(wù)對模型的三點苛刻要求先說清楚為什么表情識別不像貓狗分類那樣隨便選個網(wǎng)絡(luò)就能跑。第一表情數(shù)據(jù)集的原始分辨率通常很低FER2013 這類公開數(shù)據(jù)集都是 48x48 的灰度圖就算自己爬數(shù)據(jù)做人臉對齊后也就 64x64 到 96x96。圖像小意味著網(wǎng)絡(luò)不能一開始就瘋狂下采樣否則特征圖還沒成形就縮小到 4x4全局信息全丟了。第二表情類別之間的差異極度細(xì)微生氣和厭惡的嘴部線條差異可能只有幾個像素中性臉和微表情之間的邊界更模糊這要求網(wǎng)絡(luò)必須具備很強的中高層語義抽象能力。第三類別天然不均衡自然場景里“開心”“中性”出現(xiàn)的頻率遠(yuǎn)高于“厭惡”“恐懼”模型稍微偷懶一點就會把所有樣本都往多數(shù)類別上推。ResNet 恰好在這三點上都有優(yōu)勢。它的殘差結(jié)構(gòu)讓網(wǎng)絡(luò)可以在保持較高分辨率特征圖的同時堆深18 層 ResNet 在 48x48 輸入下依然能保留較完整的空間信息。而殘差連接又保證了梯度可以順暢地從最后一層傳到第一層訓(xùn)練深層模型不像 VGG 那樣讓人提心吊膽。更關(guān)鍵的是ResNet 在 ImageNet 上的預(yù)訓(xùn)練權(quán)重非常成熟torchvision 一行代碼就能加載這對小數(shù)據(jù)集任務(wù)幾乎是決定性的——表情識別公開數(shù)據(jù)集通常只有幾萬張圖從零訓(xùn)練一個深層網(wǎng)絡(luò)很容易過擬合而用預(yù)訓(xùn)練權(quán)重做遷移學(xué)習(xí)可以大幅壓低對數(shù)據(jù)量的需求。2.2 殘差結(jié)構(gòu)到底解決了什么退化不是過擬合很多資料喜歡把 ResNet 的貢獻概括成“解決梯度消失”但做過實驗的人會告訴你更準(zhǔn)確的描述是“解決深層網(wǎng)絡(luò)的退化問題”。梯度消失會被 Batch Normalization 很大程度上緩解但網(wǎng)絡(luò)加深到幾十層時訓(xùn)練誤差反而會先降后升——這不是過擬合過擬合是訓(xùn)練誤差低、測試誤差高而是純粹的優(yōu)化困難。恒等映射路徑的引入改變了游戲規(guī)則哪怕后面的殘差塊什么都沒學(xué)到網(wǎng)絡(luò)也至少能保持前層已提取的特征相當(dāng)于給深層網(wǎng)絡(luò)加了一條“后悔藥”通道學(xué)到有用信息時再把殘差疊加進去。表情識別里這個特性的具體收益是你可以放心地把 ResNet-34、ResNet-50 這類更深的變體用在表情任務(wù)上而不必?fù)?dān)心網(wǎng)絡(luò)深了反而學(xué)不動。我實際對比過在 48x48 輸入下 ResNet-18 和 ResNet-34 的最終準(zhǔn)確率差距可能只有 1 到 2 個點但 ResNet-34 的收斂穩(wěn)定性更好中期波動明顯更小。如果你的機器顯存有限ResNet-18 夠用如果追求最終指標(biāo)ResNet-34 是性價比最高的選擇。ResNet-50 在小圖上收益不明顯因為它的瓶頸結(jié)構(gòu)本身是為 224x224 左右的大圖設(shè)計的。2.3 用 torchvision 加載 ResNet替換分類頭的兩種寫法不管用什么后端框架加載 ResNet 并替換分類頭都是第一步。以 PyTorch 為例我一般這樣處理import torch import torchvision.models as models # 方式一加載預(yù)訓(xùn)練權(quán)重替換最后一層分類頭 model models.resnet18(weightsmodels.ResNet18_Weights.IMAGENET1K_V1) num_features model.fc.in_features # 原分類頭輸入維度是 512resnet18或 2048resnet50 model.fc torch.nn.Linear(num_features, 7) # 7 類表情生氣、厭惡、恐懼、開心、中性、難過、驚訝 # 方式二把 ResNet 當(dāng)特征提取器只訓(xùn)練分類頭適合數(shù)據(jù)量極小的情況 for param in model.parameters(): param.requires_grad False model.fc torch.nn.Linear(num_features, 7) # 后續(xù)優(yōu)化器只傳入 model.fc.parameters()這里的核心參數(shù)是weightsmodels.ResNet18_Weights.IMAGENET1K_V1它表示加載在 ImageNet-1K 上預(yù)訓(xùn)練好的權(quán)重。ImageNet 預(yù)訓(xùn)練模型學(xué)到的是通用的邊緣、紋理、形狀特征這些底層特征對人臉和表情同樣有效所以遷移到表情任務(wù)時只需要讓網(wǎng)絡(luò)重新學(xué)“高層語義組合方式”也就是分類頭附近的那幾層。方式二之所以有效是因為表情數(shù)據(jù)集往往只有幾萬張甚至幾千張圖全量微調(diào)容易讓底層特征被帶偏。我個人的習(xí)慣是數(shù)據(jù)量少于 1 萬張時用方式二先訓(xùn)出一個能用的基線數(shù)據(jù)量超過 2 萬張再解鎖全部層微調(diào)。提示torchvision新版本里weightsmodels.ResNet18_Weights.IMAGENET1K_V1是推薦寫法舊寫法pretrainedTrue會在新版本里被移除。如果你用的是舊代碼報錯優(yōu)先檢查這一行。3. 把人臉表情數(shù)據(jù)集喂進 ResNet目錄組織、標(biāo)簽對齊與預(yù)處理3.1 數(shù)據(jù)集目錄結(jié)構(gòu)與標(biāo)簽對齊最常見的翻車點表情識別數(shù)據(jù)集的來源很雜有 CSV 文件如 FER2013也有按文件夾分好的圖片目錄。不管原始格式是什么我強烈建議你先把數(shù)據(jù)統(tǒng)一整理成train/val/test三個文件夾每個文件夾下按類別分子目錄最終結(jié)構(gòu)長這樣face_data/ ├── train/ │ ├── angry/ # 0 │ ├── disgust/ # 1 │ ├── fear/ # 2 │ ├── happy/ # 3 │ ├── neutral/ # 4 │ ├── sad/ # 5 │ └── surprise/ # 6 ├── val/ └── test/這個結(jié)構(gòu)的最大好處是torchvision.datasets.ImageFolder可以直接讀取類別標(biāo)簽按文件夾名的字母順序自動從 0 開始編號。但注意字母順序意味著angry0, disgust1, fear2, happy3, neutral4, sad5, surprise6和你預(yù)想的順序可能不一樣。如果你后面要打印混淆矩陣或者計算每個類別的準(zhǔn)確率一定要先打印dataset.class_to_idx確認(rèn)映射關(guān)系否則經(jīng)常出現(xiàn)“模型把恐懼識別成厭惡但你在混淆矩陣?yán)锟村e了行列”這種烏龍。我在這上面吃過虧當(dāng)時按自己以為的順序解析 CSV 標(biāo)簽訓(xùn)練集準(zhǔn)確率虛高到 99%換了測試集立刻崩到 40%查了半天才發(fā)現(xiàn)是標(biāo)簽錯位。3.2 預(yù)處理與數(shù)據(jù)增強48x48 小圖的參數(shù)怎么設(shè)表情識別的輸入分辨率普遍偏低預(yù)處理階段有兩個選擇一是直接喂 48x48 原始分辨率二是先放大到 224x224 再輸入。直接喂小圖會丟失細(xì)節(jié)放大到 224x224 又會讓 ResNet 的預(yù)訓(xùn)練權(quán)重更“舒服”。我的做法是折中先用 OpenCV 的人臉檢測器把臉摳出來對齊然后縮放到 64x64最后在訓(xùn)練時隨機裁剪成 48x48 并做水平翻轉(zhuǎn)。這樣既保留了原始分辨率又給模型引入了平移不變性。數(shù)據(jù)增強參數(shù)上我常用的組合是隨機水平翻轉(zhuǎn)p0.5隨機旋轉(zhuǎn)正負(fù) 10 度隨機裁剪加 padding 4 像素以及輕微的顏色抖動因為灰度圖轉(zhuǎn)三通道后亮度變化是主要擾動因素。歸一化方面如果用了 ImageNet 預(yù)訓(xùn)練權(quán)重必須用 ImageNet 的均值和標(biāo)準(zhǔn)差否則預(yù)訓(xùn)練權(quán)重的統(tǒng)計量會被破壞from torchvision import transforms train_transform transforms.Compose([ transforms.Grayscale(num_output_channels3), # 灰度圖轉(zhuǎn) 3 通道匹配 ResNet 輸入 transforms.RandomHorizontalFlip(p0.5), transforms.RandomRotation(10), transforms.RandomCrop(48, padding4), transforms.ToTensor(), transforms.Normalize(mean[0.485, 0.456, 0.406], std[0.229, 0.224, 0.225]) ]) val_transform transforms.Compose([ transforms.Grayscale(num_output_channels3), transforms.ToTensor(), transforms.Normalize(mean[0.485, 0.456, 0.406], std[0.229, 0.224, 0.225]) ])上面的Grayscale(num_output_channels3)很關(guān)鍵。ResNet 的預(yù)訓(xùn)練權(quán)重第一個卷積層接受 3 通道輸入而表情數(shù)據(jù)集很多是單通道灰度圖必須復(fù)制成三通道再喂進去。如果你用的數(shù)據(jù)集本身就是彩色人臉圖這一步可以去掉。RandomCrop(48, padding4)的意思是在原圖四周補 4 像素的 0 值后再隨機裁剪 48x48等效于給模型看稍微偏移后的同一張臉能有效抑制過擬合。注意驗證集和測試集不能做隨機增強只能做縮放和中值裁剪之類確定性變換否則同一張圖每次評估結(jié)果都不一樣你沒法判斷訓(xùn)練過程中的波動是模型問題還是數(shù)據(jù)擾動問題。3.3 自定義 Dataset處理 CSV 格式表情數(shù)據(jù)的標(biāo)準(zhǔn)寫法如果你的數(shù)據(jù)是 FER2013 那種 CSV 格式第一列是像素值第二列是標(biāo)簽或者需要從數(shù)據(jù)庫讀圖片ImageFolder就不好使了。這時候?qū)懸粋€自定義Dataset子類是最穩(wěn)的。我之前處理這類 CSV 數(shù)據(jù)的模板代碼如下import torch from torch.utils.data import Dataset from PIL import Image import numpy as np import os class FerCsvDataset(Dataset): 讀取 emotion CSV 數(shù)據(jù)集每行 label, pixels像素以空格分隔的灰度值 def __init__(self, csv_path, transformNone): self.samples [] self.transform transform with open(csv_path, r) as f: lines f.read().strip().splitlines()[1:] # 跳過表頭 for line in lines: parts line.split(,) label int(parts[0]) pixels np.array(parts[1].split(), dtypenp.uint8) self.samples.append((pixels, label)) def __len__(self): return len(self.samples) def __getitem__(self, idx): pixels, label self.samples[idx] # 48x48 灰度圖重建 img Image.fromarray(pixels.reshape(48, 48)) if self.transform: img self.transform(img) return img, label這里兩個操作要注意。第一lines[1:]跳過表頭如果數(shù)據(jù)文件本身沒有表頭這個切片會誤刪第一行樣本所以打開文件后先打印前兩行確認(rèn)格式再決定要不要跳。第二像素用空格分隔時parts[1].split()會得到一長串字符串轉(zhuǎn)成np.uint8數(shù)組后 reshape 成 48x48。有些 CSV 的像素分隔符是逗號那split(,)和split()的處理就完全相反——先確認(rèn)再寫代碼別猜。訓(xùn)練時配合DataLoader使用from torch.utils.data import DataLoader train_dataset FerCsvDataset(data/fer2013/train.csv, transformtrain_transform) val_dataset FerCsvDataset(data/fer2013/val.csv, transformval_transform) train_loader DataLoader(train_dataset, batch_size64, shuffleTrue, num_workers4, pin_memoryTrue) val_loader DataLoader(val_dataset, batch_size64, shuffleFalse, num_workers4, pin_memoryTrue)batch_size的選擇要結(jié)合顯存和 BN 層特性下一章細(xì)說。shuffleTrue對訓(xùn)練集是必須的否則每個 epoch 內(nèi)樣本順序固定BN 的統(tǒng)計量估計會偏差。4. 訓(xùn)練與微調(diào)從 ImageNet 預(yù)訓(xùn)練權(quán)重到表情分類的落地參數(shù)4.1 遷移學(xué)習(xí) vs 從零訓(xùn)練預(yù)訓(xùn)練權(quán)重到底帶來了多少收益直接說結(jié)論在表情識別這種小數(shù)據(jù)集任務(wù)上用 ImageNet 預(yù)訓(xùn)練權(quán)重的 ResNet-18 比從零訓(xùn)練的 ResNet-18 最終準(zhǔn)確率能高出 8 到 15 個百分點而且收斂速度快一倍以上。原因是底層卷積核的可遷移性ImageNet 上學(xué)到的邊緣檢測、紋理模式、顏色統(tǒng)計對人臉同樣適用表情識別真正需要學(xué)的是“嘴部線條的組合方式”這類高層特征。從零訓(xùn)練意味著網(wǎng)絡(luò)得重新摸索這些底層特征幾萬張表情圖根本不夠。但預(yù)訓(xùn)練權(quán)重也不是沒有副作用。ImageNet 權(quán)重是平均臉朝向居中、尺度相對固定的自然圖像上訓(xùn)練出來的表情數(shù)據(jù)集里的人臉往往有偏轉(zhuǎn)、遮擋、夸張角度這會導(dǎo)致預(yù)訓(xùn)練階段學(xué)到的某些對“貓耳朵”“車輪”敏感的高層神經(jīng)元被激活產(chǎn)生干擾。我在實際項目里觀察到直接用預(yù)訓(xùn)練權(quán)重微調(diào)時前一兩個 epoch 的損失會比從零訓(xùn)練更低但隨后會有一段“平臺期”——這是在修正高層的偏置。這個過程很正常不要因為損失不降就急著調(diào)學(xué)習(xí)率耐心讓網(wǎng)絡(luò)自己洗掉那些與表情無關(guān)的激活模式。4.2 三個必調(diào)的參數(shù)學(xué)習(xí)率、batch size 和類別權(quán)重學(xué)習(xí)率是整個訓(xùn)練里最玄學(xué)的參數(shù)。遷移學(xué)習(xí)場景下我一般用1e-4起步比從零訓(xùn)練的1e-3要低一個量級——因為預(yù)訓(xùn)練權(quán)重已經(jīng)在一個很低的損失區(qū)域步子邁太大容易一步跨出好位置。優(yōu)化器我推薦 AdamW權(quán)重衰減設(shè)1e-4或5e-5它比 SGD 對學(xué)習(xí)率更寬容適合非資深玩家如果你想要極限精度可以把模型訓(xùn)練到后半段切到 SGDmomentum 繼續(xù)調(diào)。學(xué)習(xí)率調(diào)度用余弦退火CosineAnnealingLR或者按 epoch 手動衰減每 10 個 epoch 乘 0.1。表情識別的訓(xùn)練 epoch 數(shù)不用太多30 到 50 個 epoch 足夠收斂再多就會陷入過擬合區(qū)間。batch size 的取值受限于 BN 層ResNet 的 BatchNorm 在一個 batch 內(nèi)統(tǒng)計均值和方差batch size 太小小于 16會導(dǎo)致 BN 統(tǒng)計不穩(wěn)定損失曲線像鋸齒一樣抖batch size 太大又會超出顯存。我一般用 64顯存小于 4GB 時降到 32。另一個關(guān)鍵點是如果加載了預(yù)訓(xùn)練權(quán)重前幾個 epoch 最好凍結(jié)所有 BN 層的 running_mean 和 running_var因為這些統(tǒng)計量是 ImageNet 數(shù)據(jù)的分布小 batch 上更新會污染它們。PyTorch 里凍結(jié) BN 的寫法是def set_bn_eval(model): for m in model.modules(): if isinstance(m, torch.nn.BatchNorm2d): m.eval() # 使用 running_mean / running_var不再更新 # 在訓(xùn)練循環(huán)里前 5 個 epoch 凍結(jié) BN之后恢復(fù)訓(xùn)練模式 if epoch 5: set_bn_eval(model) else: model.train()類別權(quán)重是表情任務(wù)不能省的一步。我用torch.nn.CrossEntropyLoss(weightclass_weights)權(quán)重的計算方式最常見的是1 / 類別樣本數(shù)然后歸一化也可以直接用torch.sqrt(1 / 類別頻率)來壓低少數(shù)類的影響。類別不均衡嚴(yán)重時比如“厭惡”樣本只有“開心”的十分之一不加權(quán)重的話模型會把所有不確定樣本都判成“開心”混淆矩陣會難看得讓你懷疑人生。4.3 訓(xùn)練主循環(huán)從數(shù)據(jù)加載到模型保存的完整骨架下面給一份可以直接跑的訓(xùn)練代碼骨架我做課設(shè)或小項目時一般就用這個底子改。注意代碼里的device判斷、驗證階段的torch.no_grad()和最終模型保存方式這三個地方最容易寫錯。import torch import torch.nn as nn from torch.optim import AdamW from torch.optim.lr_scheduler import CosineAnnealingLR device torch.device(cuda if torch.cuda.is_available() else cpu) model model.to(device) # 類別權(quán)重按訓(xùn)練集各類別樣本數(shù)反比計算 import numpy as np train_labels [label for _, label in train_dataset.samples] counts np.bincount(train_labels, minlength7) weights torch.tensor(1.0 / (counts 1e-6), dtypetorch.float32).to(device) criterion nn.CrossEntropyLoss(weightweights) # 如果你覺得上述權(quán)重太激進可以用 sqrt 平滑 # smooth_weights torch.sqrt(weights / weights.sum()) * 7 optimizer AdamW(model.parameters(), lr1e-4, weight_decay1e-4) scheduler CosineAnnealingLR(optimizer, T_max40) best_val_acc 0.0 for epoch in range(40): model.train() if epoch 3: set_bn_eval(model) # 凍結(jié) BN 統(tǒng)計量 total_loss 0.0 correct 0 total 0 for images, labels in train_loader: images, labels images.to(device), labels.to(device) outputs model(images) loss criterion(outputs, labels) optimizer.zero_grad() loss.backward() optimizer.step() total_loss loss.item() * images.size(0) _, preds torch.max(outputs, 1) correct (preds labels).sum().item() total labels.size(0) train_acc correct / total val_acc evaluate(model, val_loader, device) scheduler.step() print(fEpoch {epoch1:02d} | Loss {total_loss/total:.4f} | fTrain Acc {train_acc:.4f} | Val Acc {val_acc:.4f}) if val_acc best_val_acc: best_val_acc val_acc torch.save({model_state_dict: model.state_dict(), class_to_idx: train_dataset.class_to_idx if hasattr(train_dataset, class_to_idx) else None}, best_model.pth)配合的驗證函數(shù)def evaluate(model, val_loader, device): model.eval() correct 0 total 0 with torch.no_grad(): # 驗證階段不計算梯度節(jié)省顯存且加速 for images, labels in val_loader: images, labels images.to(device), labels.to(device) outputs model(images) _, preds torch.max(outputs, 1) correct (preds labels).sum().item() total labels.size(0) return correct / total關(guān)于模型保存方式我見過好多人只存model.state_dict()結(jié)果推理時不知道輸入尺寸和類別數(shù)還得回頭翻代碼。所以我習(xí)慣把class_to_idx和num_classes一起存進 pth 文件這樣部署和復(fù)現(xiàn)時一眼就能確認(rèn)。另外torch.save一個包含state_dict的字典比直接torch.save(model, ...)安全得多——后者會連著類和設(shè)備信息一起序列化換臺機器經(jīng)常報錯。提示如果訓(xùn)練時顯卡顯存不夠把batch_size減半的同時記得把num_workers調(diào)小比如從 4 降到 2。num_workers過大和 batch size 過小同時出現(xiàn)時數(shù)據(jù)加載會成為新瓶頸GPU 利用率上不去。5. 常見問題與避坑訓(xùn)練崩潰、過擬合和推理翻車的 5 個案例5.1 訓(xùn)練第一個 epoch 損失直接變成 NaN現(xiàn)象是 loss 打印出來就是nan或者從某個 batch 開始突然變成nan之后再也回不來了。最常見的原因是學(xué)習(xí)率太大導(dǎo)致梯度爆炸但 ResNet 加 BN 對梯度爆炸容忍度其實不低所以八成是別的問題。我之前排查過的一個隱藏原因是輸入圖片里含有全黑或全白的異常樣本經(jīng)過Normalize后這些像素值變成極端大數(shù)把第一層卷積的數(shù)值范圍直接頂爆。解決辦法是數(shù)據(jù)加載完后跑一遍完整性檢查for i, (img, label) in enumerate(train_dataset): if img is None or (img 0).all(): print(fBad sample at index {i}, label {label}) break如果數(shù)據(jù)本身沒問題就把學(xué)習(xí)率降到1e-5重試一步步往上加。還有一種情況是損失函數(shù)里的weight參數(shù)包含了 0 值導(dǎo)致某些類別的梯度恒為 0從而讓對應(yīng) logit 瘋長最后數(shù)值溢出。給權(quán)重加一個極小值1e-6就能避免。5.2 訓(xùn)練集準(zhǔn)確率 98%驗證集卡在 60%這是表情識別項目里最經(jīng)典的血淚經(jīng)驗過擬合。癥狀是前 10 個 epoch 訓(xùn)練集和驗證集同步上升之后訓(xùn)練集繼續(xù)漲驗證集開始震蕩甚至下降。原因有兩個一是數(shù)據(jù)量太少表情數(shù)據(jù)集和 ImageNet 的規(guī)模差距太大二是模型參數(shù)太多ResNet-50 在小數(shù)據(jù)集上比 ResNet-18 更容易過擬合。解決辦法按優(yōu)先級排先加強數(shù)據(jù)增強加光照擾動、隨機遮擋再砍模型換小一點的 ResNet-18最后考慮加 dropout。表情識別這種任務(wù)測試集準(zhǔn)確率比“訓(xùn)練集做到完美”重要得多因為你的模型最終是要在別人的照片上跑的。還有個容易被忽略的原因驗證集和訓(xùn)練集的人臉來源重疊。很多表情數(shù)據(jù)集是按幀從視頻里切出來的同一個人的相鄰幀被分進訓(xùn)練集和驗證集導(dǎo)致模型“記住”了這個人而不是學(xué)會了表情。正確做法是按視頻或人物 ID 劃分?jǐn)?shù)據(jù)集而不是按幀隨機分。遇到這種情況重劃驗證集后準(zhǔn)確率會掉下來但這才是真實水平。5.3 攝像頭推理卡頓幀率只有 5 FPS訓(xùn)練好的模型拿到攝像頭實時推理時卡頓90% 的問題不在模型計算本身而在預(yù)處理鏈路。常見的是每幀都用 PIL 加載、轉(zhuǎn)格式、單張送 GPU來回切換損耗巨大。正確的推理流程是用 OpenCV 讀幀 → 人臉檢測器定位 → 裁剪對齊 → 單張推理。并且必須開啟 eval 模式和torch.no_grad()import cv2 import torch model.eval() cap cv2.VideoCapture(0) with torch.no_grad(): while True: ret, frame cap.read() if not ret: break # 假設(shè) face 人臉檢測器返回的裁剪后 48x48 圖像 face preprocess_face(frame) # 返回 tensorshape [1,3,48,48] face face.to(device) logits model(face) _, pred torch.max(logits, 1) # 在 frame 上畫框和標(biāo)簽顯示這里有兩個隱性坑如果model.eval()忘了調(diào)BN 層還在用 batch 統(tǒng)計量單張推理時統(tǒng)計量方差巨大輸出會變得很怪如果忘了torch.no_grad()模型前向會保存中間激活用于反向傳播顯存被慢慢吃滿幾十幀后開始卡頓甚至崩潰。人臉檢測器本身也很耗計算用 OpenCV 自帶的 Haar Cascade 或者移動端友好的檢測模型別一上來就接 YOLO。5.4 測試集準(zhǔn)確率虛高標(biāo)簽對齊問題的典型癥狀癥狀是訓(xùn)練過程一切正常訓(xùn)練/驗證準(zhǔn)確率都很像樣子但換到真實照片上識別錯誤百出或者測試集準(zhǔn)確率和驗證集差一截。這種“黑匣子”式的問題十有八九是類別標(biāo)簽映射錯位。我在章節(jié) 3.1 提到過按字母排序的問題這里再舉一個更隱蔽的場景CSV 數(shù)據(jù)集的 label 和文件夾的類別序號不一致。比如你的 CSV 里0angry但torchvision.datasets.ImageFolder給你分的是0angry嗎不一定如果val文件夾里子目錄順序不同同一個標(biāo)簽號對應(yīng)的類別就變了。排查辦法很簡單訓(xùn)練前打印一份映射表存進日志class_names train_dataset.classes class_to_idx train_dataset.class_to_idx print(class_to_idx) # 輸出類似 {angry: 0, disgust: 1, fear: 2, ...}訓(xùn)練完成后用這段映射表寫一個小的評估腳本單獨跑測試集并打印每一類的準(zhǔn)確率和混淆矩陣。如果某一類的準(zhǔn)確率顯著低于其他類優(yōu)先懷疑是標(biāo)簽錯位而不是模型沒學(xué)好。血淚經(jīng)驗這個檢查花不了 5 分鐘但能救回你一下午的調(diào)參時間。5.5 類別不均衡把“厭惡”和“恐懼”直接淹沒在自然場景采集的表情數(shù)據(jù)里“開心”“中性”可能各占 30%“厭惡”“恐懼”各占 5%如果不處理模型會把后兩者學(xué)成一團噪聲?,F(xiàn)象是混淆矩陣?yán)镉幸徽袔缀醵际?0也就是“厭惡”類從未被預(yù)測過。解決手段有三層第一層是章節(jié) 4.2 說的類別權(quán)重這是最省事的第二層是過采樣每個 epoch 對少數(shù)類樣本重復(fù)采樣讓每個 batch 里各類別盡量均勻第三層是數(shù)據(jù)增強時對少數(shù)類用更強的擾動。我推薦至少做到前兩層。用WeightedRandomSampler可以方便地做過采樣from torch.utils.data import WeightedRandomSampler sample_weights torch.zeros(len(train_dataset)) for i, (_, label) in enumerate(train_dataset.samples): sample_weights[i] 1.0 / counts[label] sampler WeightedRandomSampler(sample_weights, num_sampleslen(sample_weights), replacementTrue) train_loader DataLoader(train_dataset, batch_size64, samplersampler, num_workers4)注意用了sampler之后就不能再傳shuffleTrue這是DataLoader的硬性約束。num_samples通常保持和原數(shù)據(jù)集一樣大讓每個 epoch 的總步數(shù)不變化。6. 讓表情識別再進一步用 Grad-CAM 驗證模型在看哪里表情識別做到 80% 出頭的準(zhǔn)確率后光看指標(biāo)無法判斷模型學(xué)到的策略是否合理。最常見的隱藏 bug 是模型學(xué)會“看背景”而不是“看臉”——訓(xùn)練集里”開心“的照片恰好背景偏亮”難過“的恰好偏暗模型就轉(zhuǎn)向了捷徑。Grad-CAM 是檢查這個問題的輕量工具它能生成一張熱力圖告訴我們模型做決策時重點關(guān)注的是輸入圖像的哪些區(qū)域。一個合理的表情識別模型熱力圖應(yīng)該集中在上半臉的眼部周圍微笑時眼輪匝肌變化和下半臉的嘴部附近如果熱力圖大面積集中在背景、額頭或者衣領(lǐng)上說明模型學(xué)歪了。用 PyTorch 計算 Grad-CAM 并不需要完整復(fù)現(xiàn)原版流程核心做法是記錄目標(biāo)特征圖對目標(biāo)類別的 logit 反向傳播取梯度對特征圖求通道平均再上采樣到輸入尺寸。以 ResNet-18 為例我通常取model.layer4[-1]的輸出作為特征圖import torch import torch.nn.functional as F def grad_cam(model, tensor, target_classNone): 返回與輸入同尺寸的熱力圖0~1shape: [H, W] device next(model.parameters()).device model.eval() feature_map None gradient None def forward_hook(module, input, output): nonlocal feature_map feature_map output.detach() def backward_hook(module, grad_input, grad_output): nonlocal gradient gradient grad_output[0].detach() # ResNet-18 的 layer4 是最后一個殘差塊組成的 stage target_layer model.layer4[-1] fh target_layer.register_forward_hook(forward_hook) bh target_layer.register_full_backward_hook(backward_hook) tensor tensor.unsqueeze(0).to(device) # [1, 3, 48, 48] logits model(tensor) if target_class is None: target_class logits.argmax(dim1).item() # 對目標(biāo)類別得分反向傳播 model.zero_grad() one_hot torch.zeros_like(logits) one_hot[0, target_class] 1.0 logits.backward(gradientone_hot) weights gradient.mean(dim(2, 3), keepdimTrue) # 通道平均權(quán)重 cam (weights * feature_map).sum(dim1, keepdimTrue) # 加權(quán)求和 cam F.relu(cam) # 只保留正向影響區(qū)域 cam F.interpolate(cam, size(48, 48), modebilinear, align_cornersFalse) fh.remove() bh.remove() return cam[0, 0].cpu().numpy()register_full_backward_hook是 PyTorch 新版本推薦寫法舊版本的register_backward_hook在nn.Module上已被棄用。gradient拿到的是目標(biāo)層輸出的梯度mean(dim(2,3))是 Grad-CAM 的經(jīng)典加權(quán)操作把高寬的梯度平均成一個通道權(quán)重。最后F.relu過濾掉負(fù)貢獻區(qū)域因為負(fù)的 CAM 值對應(yīng)的像素對目標(biāo)類別是抑制作用不在可視化范圍里。實際使用時把熱力圖和原圖疊加透明度設(shè) 0.4 左右然后逐個看測試集里每個類別的 sample。我自己的教訓(xùn)是模型的準(zhǔn)確率達標(biāo)不代表決策可信有一次我訓(xùn)練出的模型對”恐懼“類識別準(zhǔn)確率很高但 Grad-CAM 顯示它重點看的是背景里的窗戶邊緣——原因是數(shù)據(jù)里”恐懼“表情的樣本恰好全來自同一個室內(nèi)場景。發(fā)現(xiàn)這個問題后我把那批背景重復(fù)的樣本清洗掉重新訓(xùn)練后準(zhǔn)確率掉了 3 個百分點但換到真實場景照片上的表現(xiàn)反而提升了一截。這是我認(rèn)為整個項目里最有價值的一次排查也讓我養(yǎng)成了每次訓(xùn)完分類模型必看 Grad-CAM 的習(xí)慣。希望幫到你。本文還有配套的精品資源點擊獲取