習(xí)的蘋果葉病害識(shí)別方法:圖像分類與模型部署指南)
簡(jiǎn)介面向智慧農(nóng)業(yè)與計(jì)算機(jī)視覺畢設(shè)場(chǎng)景這套基于PythonOpenCV的蘋果葉病害識(shí)別檢測(cè)系統(tǒng)源碼包可精準(zhǔn)識(shí)別赤霉病、枯葉病、鐵銹病等常見葉片病變適合高校學(xué)生、科研人員及農(nóng)業(yè)智能開發(fā)者使用既可直接運(yùn)行也能修改代碼訓(xùn)練其他植物病害。壓縮包共382個(gè)文件約54.26MB主要包含162張標(biāo)注病害圖像、161個(gè)標(biāo)簽txt文件、16個(gè)Python源碼、3個(gè)訓(xùn)練好的pt模型以及20個(gè)YAML配置文件并附帶清晰的操作說明與評(píng)估指標(biāo)曲線大幅降低復(fù)現(xiàn)門檻。目前已有508人學(xué)習(xí)下載實(shí)操價(jià)值獲得認(rèn)可。整體設(shè)計(jì)兼顧教學(xué)與落地從環(huán)境配置、推理檢測(cè)到自定義訓(xùn)練均有完整指引幫助快速跑通檢測(cè)流程尤其適合畢業(yè)設(shè)計(jì)、課程項(xiàng)目或農(nóng)業(yè)病害識(shí)別應(yīng)用的原型驗(yàn)證是一份高性價(jià)比的完整參考資料。1. 這個(gè)畢設(shè)題目的本質(zhì)不是檢測(cè)是圖像分類打開壓縮包之前先明確一件事標(biāo)題寫的是“蘋果葉病害識(shí)別檢測(cè)”但按數(shù)據(jù)集的組織方式——按病害類別分文件夾、每張圖對(duì)應(yīng)一個(gè)標(biāo)簽——這實(shí)際上是一個(gè)圖像分類任務(wù)或者說“判別式識(shí)別”任務(wù)。它不是YOLO那種畫檢測(cè)框的定位任務(wù)。這個(gè)區(qū)分很重要因?yàn)樗苯記Q定了你要不要再接一個(gè)檢測(cè)頭的訓(xùn)練流程還是老老實(shí)實(shí)把分類準(zhǔn)確率做上去再疊加一個(gè)滑動(dòng)窗口來做“檢測(cè)”的觀感。對(duì)這種畢設(shè)項(xiàng)目來說最穩(wěn)的落地路徑是用OpenCV做圖像預(yù)處理和傳統(tǒng)特征提取再用OpenCV的DNN模塊加載訓(xùn)練好的深度模型做推理。你不需要從頭搭建一套深度學(xué)習(xí)訓(xùn)練管線也不需要用OpenCV去硬寫一個(gè)CNN訓(xùn)練器而是把兩者結(jié)合起來用Python生態(tài)訓(xùn)練用OpenCV做工程化部署。這個(gè)方案適合誰(shuí)適合那些需要短時(shí)間跑通、能演示、能答辯、能寫系統(tǒng)架構(gòu)圖的本科畢設(shè)。它不追求刷榜級(jí)別的準(zhǔn)確率但要求你清楚每一行代碼在干什么模型失效的時(shí)候你能給出合理解釋。蘋果葉病害本身有清晰的表觀特征——病斑顏色、紋理、分布區(qū)域——這讓傳統(tǒng)特征方法也能拿到不錯(cuò)的下限。2. 環(huán)境和數(shù)據(jù)集把“帶標(biāo)注的文件夾”變成可訓(xùn)練的數(shù)據(jù)管線2.1 Python和OpenCV環(huán)境搭建三個(gè)坑一次講清打開壓縮包第一步不是看模型文件是先把環(huán)境跑通。項(xiàng)目基于Python那就從python官網(wǎng)下載對(duì)應(yīng)版本。注意畢設(shè)項(xiàng)目普遍對(duì)版本敏感建議用Python 3.8到3.10之間的版本太新的版本有時(shí)候會(huì)遇到某些依賴庫(kù)沒有預(yù)編譯wheel的問題。安裝時(shí)勾選“Add Python to PATH”這一步漏掉的后果是你打開命令行敲python提示不是內(nèi)部或外部命令這不是Python沒裝好是環(huán)境變量沒配。裝好Python后用pip安裝依賴python -m pip install --upgrade pip python -m pip install opencv-python4.8.0.76 python -m pip install numpy matplotlib scikit-learnopencv-python的版本我建議固定到4.8.x原因是這個(gè)版本線對(duì)ONNX模型的DNN推理支持已經(jīng)非常成熟同時(shí)不會(huì)像4.10那樣在某些老筆記本上出現(xiàn)奇怪的解碼器兼容問題。安裝完成后驗(yàn)證一下python -c import cv2; print(cv2.__version__)這一步能過說明OpenCV主庫(kù)沒問。如果你遇到ModuleNotFoundError: No module named opencv那大概率是裝成了opencv-contrib-python但沒有正確import記住import名永遠(yuǎn)是cv2不是opencv。還有一個(gè)高頻報(bào)錯(cuò)是cv2.error: OpenCV(4.4.0)這通常指你用了太老的預(yù)編譯包同時(shí)你的Python版本是3.11以上兩個(gè)版本之間ABI不兼容。解決方式是升級(jí)OpenCV版本到4.8以上而不是去網(wǎng)上找老版本的whl文件硬裝。這個(gè)報(bào)錯(cuò)我當(dāng)年也卡過結(jié)果發(fā)現(xiàn)是pip給了一個(gè)緩存里的老版本加--no-cache-dir重新裝就干凈了。2.2 數(shù)據(jù)集結(jié)構(gòu)檢查先統(tǒng)計(jì)再訓(xùn)練解壓數(shù)據(jù)集之后第一步是寫一個(gè)統(tǒng)計(jì)腳本看看每個(gè)類別的圖片數(shù)量、尺寸分布、格式是否統(tǒng)一。很多標(biāo)好名的數(shù)據(jù)集并不規(guī)范——有的葉子是整片葉有的是打了孔的局部葉有的圖片帶水印或者EXIF旋轉(zhuǎn)信息。下面這段代碼我每次拿到新數(shù)據(jù)集都會(huì)先跑一遍import os import cv2 from collections import Counter dataset_root ./dataset # 假設(shè)目錄下按類別分子文件夾 exts (.jpg, .jpeg, .png, .bmp) category_stats {} size_stats [] for cls_name in os.listdir(dataset_root): cls_path os.path.join(dataset_root, cls_name) if not os.path.isdir(cls_path): continue imgs [f for f in os.listdir(cls_path) if f.lower().endswith(exts)] category_stats[cls_name] len(imgs) for im in imgs[:50]: # 抽樣看尺寸分布 img cv2.imread(os.path.join(cls_path, im)) if img is not None: h, w img.shape[:2] size_stats.append((w, h)) print(category_stats) print(Counter(size_stats).most_common(10))這段代碼的意圖很直白統(tǒng)計(jì)每類圖片數(shù)量抽樣看尺寸。邏輯上用os.listdir遍歷類目用cv2.imread讀圖取寬高全部存進(jìn)列表后用Counter看尺寸分布。如果你看到某個(gè)類的數(shù)量明顯偏少比如只有別類的三分之一那么訓(xùn)練時(shí)就必須做類別加權(quán)或者少采樣策略。如果你看到尺寸極端分散比如有1920x1080的也有256x256的預(yù)處理階段就要統(tǒng)一縮放不要指望模型自己對(duì)尺度不變性有多好的魯棒性。還有一個(gè)容易被忽略的點(diǎn)有些數(shù)據(jù)集里混有灰度圖單通道讀入后shape是(h,w)不是(h,w,3)后續(xù)特征提取或者CNN輸入會(huì)直接報(bào)維度錯(cuò)誤。這個(gè)時(shí)候在讀取時(shí)統(tǒng)一轉(zhuǎn)成三通道用cv2.cvtColor(img, cv2.COLOR_GRAY2BGR)做轉(zhuǎn)換即可。2.3 劃分訓(xùn)練集和驗(yàn)證集不洗牌等于白練畢設(shè)數(shù)據(jù)集規(guī)模一般在小幾千張這個(gè)規(guī)模下直接用train_test_split做個(gè)按類別分層的劃分就好。注意要用stratify參數(shù)保證每個(gè)類在訓(xùn)練集和驗(yàn)證集中的比例一致否則一個(gè)類如果全跑到驗(yàn)證集訓(xùn)練的時(shí)候模型沒見過這個(gè)類分?jǐn)?shù)直接崩掉。我一般會(huì)把全部數(shù)據(jù)按7:2:1拆成訓(xùn)練集、驗(yàn)證集、測(cè)試集測(cè)試集從頭到尾不參與訓(xùn)練只用來做最終評(píng)估。import os import shutil import random from sklearn.model_selection import train_test_split random.seed(42) dataset_root ./dataset train_dir, val_dir, test_dir ./train, ./val, ./test classes [d for d in os.listdir(dataset_root) if os.path.isdir(os.path.join(dataset_root, d))] for cls in classes: imgs os.listdir(os.path.join(dataset_root, cls)) # 保證路徑完整 full_paths [os.path.join(dataset_root, cls, i) for i in imgs] tr, tmp train_test_split(full_paths, test_size0.3, random_state42, stratifyNone if len(imgs) 2 else [1]*len(full_paths)) va, te train_test_split(tmp, test_size0.33, random_state42) for split, dir_name in [(tr, train_dir), (va, val_dir), (te, test_dir)]: out_dir os.path.join(dir_name, cls) os.makedirs(out_dir, exist_okTrue) for src in split: shutil.copy(src, os.path.join(out_dir, os.path.basename(src)))這段代碼先按7:3拆出訓(xùn)練集和臨時(shí)集再?gòu)呐R時(shí)集按2:3拆出驗(yàn)證集和測(cè)試集合成下來就是7:2:1。random_state42固定后每次跑出來劃分一致論文里寫“隨機(jī)劃分固定種子”這句就是你代碼的注腳。注意我這里的stratify參數(shù)寫得很潦草因?yàn)槊總€(gè)類的圖片數(shù)量不多強(qiáng)行分層可能報(bào)錯(cuò)所以直接給了一個(gè)全1的假標(biāo)簽讓它不報(bào)錯(cuò)。如果你每個(gè)類都有幾十張以上可以把第二個(gè)參數(shù)改成類別標(biāo)簽數(shù)組做真正的分層抽樣。2.4 數(shù)據(jù)增強(qiáng)用OpenCV做平移、旋轉(zhuǎn)、縮放訓(xùn)練過程如果直接拿原圖喂進(jìn)去模型會(huì)過擬合到背景和葉子的擺放位置。畢設(shè)數(shù)據(jù)集通常不夠大增強(qiáng)是必須的步驟。這里不引入imgaug這種大庫(kù)就用OpenCV自帶的方法好處是能在答辯的時(shí)候直接說“全部基于OpenCV實(shí)現(xiàn)”。簡(jiǎn)單的增強(qiáng)組合是隨機(jī)水平翻轉(zhuǎn)、小角度旋轉(zhuǎn)、亮度擾動(dòng)。import cv2 import numpy as np def augment_image(img, angle_range15, brightness_range30): h, w img.shape[:2] # 隨機(jī)旋轉(zhuǎn) angle np.random.uniform(-angle_range, angle_range) M cv2.getRotationMatrix2D((w/2, h/2), angle, 1.0) rotated cv2.warpAffine(img, M, (w, h), flagscv2.INTER_LINEAR, borderModecv2.BORDER_REFLECT_101) # 隨機(jī)亮度擾動(dòng) brightness np.random.randint(-brightness_range, brightness_range) hsv cv2.cvtColor(rotated, cv2.COLOR_BGR2HSV).astype(np.float32) hsv[:, :, 2] np.clip(hsv[:, :, 2] brightness, 0, 255) aug cv2.cvtColor(hsv.astype(np.uint8), cv2.COLOR_HSV2BGR) return aug這里旋轉(zhuǎn)用的getRotationMatrix2D生成旋轉(zhuǎn)矩陣warpAffine做仿射變換borderModeBORDER_REFLECT_101是為了讓邊緣在旋轉(zhuǎn)時(shí)不是補(bǔ)黑邊而是反射葉片本身的像素補(bǔ)黑邊會(huì)讓模型學(xué)到“邊框等于背景”這種假特征。亮度擾動(dòng)放在HSV空間是對(duì)明度通道直接加減轉(zhuǎn)換回BGR后色彩基本不受影響。注意這里有個(gè)隱藏細(xì)節(jié)先旋轉(zhuǎn)再調(diào)亮度旋轉(zhuǎn)會(huì)產(chǎn)生插值噪聲調(diào)亮暗不會(huì)引入新的空間結(jié)構(gòu)所以順序不要反。如果你還想做縮放裁剪可以在這個(gè)函數(shù)里再加一步cv2.resize到(224,224)然后在推理的時(shí)候也用相同尺寸保證訓(xùn)練和部署的input size一致。輸出尺寸不一致是畢設(shè)里最常見的翻車點(diǎn)后面推理章節(jié)里還會(huì)遇到。3. 模型選型和訓(xùn)練從傳統(tǒng)特征到深度學(xué)習(xí)推理3.1 兩條路線怎么選SVM上線快CNN上限高拿到標(biāo)好的數(shù)據(jù)集之后你面臨一個(gè)選擇用傳統(tǒng)特征工程加SVM還是上CNN。這個(gè)選擇不是看心情而是看你數(shù)據(jù)集規(guī)模和部署形態(tài)。如果數(shù)據(jù)量在每類兩三百?gòu)堃詢?nèi)傳統(tǒng)特征加SVM的訓(xùn)練速度是秒級(jí)而且可解釋性強(qiáng)論文里可以畫特征可視化圖。如果數(shù)據(jù)量在每類五百?gòu)堃陨匣蛘弑尘皬?fù)雜葉片姿態(tài)多變CNN遷移學(xué)習(xí)的準(zhǔn)確率優(yōu)勢(shì)會(huì)非常明顯。這個(gè)項(xiàng)目標(biāo)題里帶了“模型”這個(gè)詞通常默認(rèn)給的預(yù)訓(xùn)練權(quán)重是按CNN路線訓(xùn)練的那么你在系統(tǒng)里就要用OpenCV的DNN模塊去加載推理而不是重新訓(xùn)練一個(gè)SVM去替代它。但我建議你把兩條路線都跑一遍基線SVM結(jié)果作為baseline寫進(jìn)論文對(duì)比表最終部署用CNN。這樣既能體現(xiàn)工作量又能在答辯被問“為什么不用傳統(tǒng)方法”的時(shí)候給出一個(gè)量化對(duì)比答案。3.2 用OpenCV提取HOG特征訓(xùn)練SVM把原理寫進(jìn)代碼HOG特征的核心思想是統(tǒng)計(jì)圖像局部區(qū)域的梯度方向分布。葉片病斑的邊緣和健康區(qū)域在梯度方向上會(huì)有明顯差異所以HOG對(duì)這類紋理型病害是比較經(jīng)典的表征方式。用OpenCV提取HOG特征加SVM訓(xùn)練下面這個(gè)流程是完整的import cv2 import numpy as np from sklearn.svm import SVC from sklearn.preprocessing import StandardScaler import os def extract_hog(img, cell_size(8, 8), block_size(2, 2), nbins9): img_resized cv2.resize(img, (128, 128)) img_gray cv2.cvtColor(img_resized, cv2.COLOR_BGR2GRAY) if img_resized.ndim 3 else img_resized hog cv2.HOGDescriptor((128, 128), (16, 16), (8, 8), cell_size, nbins) return hog.compute(img_gray).flatten() X, y [], [] for cls_idx, cls_name in enumerate(os.listdir(train_dir)): cls_path os.path.join(train_dir, cls_name) for fname in os.listdir(cls_path): img cv2.imread(os.path.join(cls_path, fname)) if img is None: continue X.append(extract_hog(img)) y.append(cls_idx) X np.array(X) scaler StandardScaler() X_scaled scaler.fit_transform(X) svm SVC(kernelrbf, C10, gammascale, probabilityTrue) svm.fit(X_scaled, y)HOGDescriptor的四個(gè)參數(shù)依次是winSize、blockSize、blockStride、cellSize。winSize設(shè)為128x128意味著整圖作為一個(gè)檢測(cè)窗口cellSize 8x8和nbins 9是經(jīng)典配置。每個(gè)block歸一化后能把光照變化的影響壓下去這對(duì)戶外拍蘋果葉的場(chǎng)景很重要因?yàn)樽匀还庀峦黄~子的亮度差異很大。SVM用RBF核C10意思是誤分類懲罰適中g(shù)ammascale讓模型自己根據(jù)特征標(biāo)準(zhǔn)差決定核寬這是我們平時(shí)調(diào)參時(shí)最穩(wěn)的起點(diǎn)。如果你發(fā)現(xiàn)準(zhǔn)確率卡在80%上下優(yōu)先調(diào)整的是cell_size從8改到16特征是少了但泛化往往更好然后再懷疑SVM參數(shù)。3.3 CNN遷移學(xué)習(xí)用torch訓(xùn)練再導(dǎo)出ONNX部署端用OpenCV讀模型訓(xùn)練端卻不必局限于OpenCV。常見做法是用PyTorch寫一個(gè)遷移學(xué)習(xí)腳本用ImageNet預(yù)訓(xùn)練的ResNet18做骨干網(wǎng)絡(luò)把最后一層全連接替換成病害類別數(shù)。之所以選ResNet18而不是更深的ResNet50是因?yàn)樘O果葉病害數(shù)據(jù)量不足以支撐深網(wǎng)絡(luò)的微調(diào)而且推理速度在CPU上更快演示的時(shí)候不會(huì)卡頓。下面這段是核心訓(xùn)練腳本的骨架import torch import torch.nn as nn import torchvision.models as models import torchvision.transforms as transforms from torch.utils.data import DataLoader, Dataset from PIL import Image import os class LeafDataset(Dataset): def __init__(self, root): self.classes sorted(os.listdir(root)) self.samples [] for cls_idx, cls_name in enumerate(self.classes): cls_path os.path.join(root, cls_name) for f in os.listdir(cls_path): self.samples.append((os.path.join(cls_path, f), cls_idx)) self.transform transforms.Compose([ transforms.Resize((224, 224)), transforms.RandomHorizontalFlip(), transforms.ToTensor(), transforms.Normalize(mean[0.485, 0.456, 0.406], std[0.229, 0.224, 0.225]) ]) def __len__(self): return len(self.samples) def __getitem__(self, idx): path, label self.samples[idx] img Image.open(path).convert(RGB) return self.transform(img), label model models.resnet18(weightsmodels.ResNet18_Weights.IMAGENET1K_V1) num_ftrs model.fc.in_features model.fc nn.Linear(num_ftrs, 5) # 假設(shè)5類病害 device torch.device(cuda if torch.cuda.is_available() else cpu) model model.to(device) criterion nn.CrossEntropyLoss() optimizer torch.optim.SGD(model.parameters(), lr0.001, momentum0.9) for epoch in range(10): model.train() for imgs, labels in DataLoader(LeafDataset(train_dir), batch_size32, shuffleTrue): imgs, labels imgs.to(device), labels.to(device) optimizer.zero_grad() outputs model(imgs) loss criterion(outputs, labels) loss.backward() optimizer.step() print(fepoch {epoch1}, loss {loss.item():.4f})這里weightsIMAGENET1K_V1表示加載預(yù)訓(xùn)練權(quán)重fc層從默認(rèn)的1000類輸出改成自己的類別數(shù)這部分權(quán)重隨機(jī)初始化backbone保持預(yù)訓(xùn)練。學(xué)習(xí)率設(shè)置0.001對(duì)于微調(diào)來說不算激進(jìn)SGD加momentum適合小數(shù)據(jù)集。10個(gè)epoch足夠看到收斂趨勢(shì)如果loss還沒降下去問題大概率在數(shù)據(jù)讀取或者歸一化參數(shù)上而不是網(wǎng)絡(luò)結(jié)構(gòu)。訓(xùn)練完的模型要導(dǎo)出成ONNXOpenCV的DNN模塊不支持直接讀.pt文件dummy_input torch.randn(1, 3, 224, 224).to(device) torch.onnx.export( model, dummy_input, apple_leaf.onnx, input_names[input], output_names[output], dynamic_axesNone, opset_version11 )導(dǎo)出時(shí)opset_version11是一個(gè)平衡點(diǎn)太低有些算子不支持太高OpenCV的ONNX解析器可能遇到不認(rèn)識(shí)的算子。固定輸入尺寸224x224的好處是導(dǎo)出時(shí)不用動(dòng)態(tài)軸推理時(shí)也不用做尺寸適配省掉一整套坐標(biāo)映射邏輯。3.4 評(píng)估指標(biāo)別只報(bào)準(zhǔn)確率要報(bào)混淆矩陣做評(píng)估的時(shí)候單看準(zhǔn)確率在病害識(shí)別項(xiàng)目里是自欺欺人。因?yàn)樘O果葉病害有些類之間差異很小比如炭疽葉枯病和褐斑病人眼都要仔細(xì)分辨模型如果誤判一兩張會(huì)把準(zhǔn)確率拖下去兩個(gè)點(diǎn)。正確的評(píng)估是驗(yàn)證集上的混淆矩陣加每類precision、recall、F1。代碼實(shí)現(xiàn)可以直接用scikit-learnfrom sklearn.metrics import confusion_matrix, classification_report y_true, y_pred [], [] model.eval() with torch.no_grad(): for imgs, labels in DataLoader(LeafDataset(val_dir), batch_size32, shuffleFalse): outputs model(imgs.to(device)) _, preds torch.max(outputs, 1) y_true.extend(labels.numpy()) y_pred.extend(preds.cpu().numpy()) print(classification_report(y_true, y_pred, target_namesdataset.classes)) print(confusion_matrix(y_true, y_pred))torch.no_grad()這里很關(guān)鍵它告訴PyTorch不需要為推理過程構(gòu)建計(jì)算圖內(nèi)存占用降到原來的十分之一。推理時(shí)如果你的模型在CPU上跑一個(gè)batch 32張224x224的圖耗時(shí)大約一兩秒足夠支撐實(shí)時(shí)演示。如果某個(gè)類的recall明顯低于其他類那就是數(shù)據(jù)不足或者特征重疊太大回到第2章去查這個(gè)類的影像數(shù)量大概率是樣本太少。畢設(shè)論文里這個(gè)評(píng)估結(jié)果是你所有結(jié)論的支撐不要在這塊偷懶。4. 部署與展示讓OpenCV DNN把模型跑起來4.1 加載ONNX模型并推理OpenCV做識(shí)別的核心代碼訓(xùn)練和推理分離是這個(gè)項(xiàng)目的常態(tài)訓(xùn)練在PyTorch里完成部署在OpenCV DNN模塊里完成。OpenCV的cv2.dnn.readNetFromONNX可以直接加載導(dǎo)出的模型然后通過blobFromImage把圖像轉(zhuǎn)成模型需要的輸入格式前向推理得到輸出向量。整個(gè)過程不依賴PyTorch也就是說部署機(jī)上只需要openv-python。import cv2 import numpy as np net cv2.dnn.readNetFromONNX(apple_leaf.onnx) class_names [healthy, alternaria, rust, scab, frogeye] def predict(img): img_resized cv2.resize(img, (224, 224)) blob cv2.dnn.blobFromImage(img_resized, scalefactor1.0/255.0, size(224, 224), mean(0.485*255, 0.456*255, 0.406*255), swapRBTrue) net.setInput(blob) outputs net.forward() # 輸出形狀 (1, num_classes)softmax后取最大索引 scores outputs[0] scores np.exp(scores - np.max(scores)) scores / np.sum(scores) pred_idx int(np.argmax(scores)) conf scores[pred_idx] return class_names[pred_idx], confblobFromImage的參數(shù)團(tuán)是這里最容易出問題的地方。scalefactor1/255是把像素從0-255縮放到0-1mean必須和訓(xùn)練時(shí)用的Normalize參數(shù)嚴(yán)格對(duì)應(yīng)。PyTorch里Normalize(mean[0.485,0.456,0.406], std[0.229,0.224,0.225])是ImageNet的統(tǒng)計(jì)均值這些數(shù)值在訓(xùn)練時(shí)會(huì)把每個(gè)通道減均值再除標(biāo)準(zhǔn)差。但OpenCV的blobFromImage只支持減均值不支持除標(biāo)準(zhǔn)差所以這里要把std乘進(jìn)mean里再減。你把(0.485*255, 0.456*255, 0.406*255)算出來大約是(123.675, 116.28, 103.53)這幾個(gè)數(shù)在論文的實(shí)驗(yàn)設(shè)置部分必須交代。注意swapRBTrue是因?yàn)镺penCV讀圖是BGR順序而PyTorch訓(xùn)練時(shí)用的是RGB順序不交換的話模型的輸入通道語(yǔ)義就反了效果會(huì)斷崖式下跌準(zhǔn)確率甚至不如隨機(jī)猜。推理輸出的分?jǐn)?shù)向量直接做softmax歸一化。雖然ONNX里沒有帶softmax層導(dǎo)出時(shí)候沒加手動(dòng)實(shí)現(xiàn)只用了np.exp加歸一化數(shù)值穩(wěn)定性上用np.max先平移一下防止exp溢出后全是NaN。如果你要的是更快的前100類預(yù)測(cè)或者閾值過濾在這段邏輯上加一個(gè)conf 0.6什么也不返回的兜底邏輯就行。4.2 批量預(yù)測(cè)和輸出可視化畫出病斑圈畢設(shè)系統(tǒng)要演示除了終端打印類別名之外最好能把識(shí)別結(jié)果畫在圖上。OpenCV在這塊的優(yōu)勢(shì)就體現(xiàn)出來了不需要額外工具庫(kù)直接畫框和文字。雖然分類模型本身沒有邊界框輸出但可以結(jié)合一個(gè)滑窗策略把圖劃分成多個(gè)區(qū)域分別預(yù)測(cè)預(yù)測(cè)置信度高的區(qū)域就畫個(gè)紅框這樣在視覺上就有了“檢測(cè)”的效果。def draw_prediction(img, pred_label, conf, top_k3): out img.copy() label_text f{pred_label} ({conf:.2f}) cv2.rectangle(out, (0, 0), (out.shape[1], 40), (0, 0, 255), -1) cv2.putText(out, label_text, (5, 28), cv2.FONT_HERSHEY_SIMPLEX, 0.8, (255, 255, 255), 2) return out def multi_crop_predict(img, net, class_names, crop_size224): h, w img.shape[:2] results [] for y in range(0, max(h - crop_size, 1), crop_size // 2): for x in range(0, max(w - crop_size, 1), crop_size // 2): crop img[y:ycrop_size, x:xcrop_size] if crop.shape[0] crop_size or crop.shape[1] crop_size: crop cv2.resize(crop, (crop_size, crop_size)) cls, conf predict(crop) results.append((x, y, cls, conf)) return [r for r in results if r[3] 0.7]這段邏輯用一個(gè)步長(zhǎng)為crop_size//2的滑窗每隔半個(gè)窗口取一次裁片每張裁片獨(dú)立做一次推理然后按置信度過濾高于0.7的視為病害區(qū)域?;安介L(zhǎng)設(shè)置為一半窗口大小是為了相鄰裁片有50%重疊重疊區(qū)域即使只在一張裁片里被判定為病害也不容易漏掉。這個(gè)策略的代價(jià)是計(jì)算量翻倍但對(duì)單張圖片的演示場(chǎng)景完全可以接受。如果你在batch預(yù)測(cè)時(shí)發(fā)現(xiàn)效果不如單張檢查一下是不是crop內(nèi)部又做了一次resize有些裁片本身就是224x224再resize一次不會(huì)變但如果是小目標(biāo)病害裁片尺寸小于224這時(shí)直接resize會(huì)讓病斑變形。正確的做法是原尺寸小于224的裁片直接pad到224而不是縮放保留病斑相對(duì)大小。4.3 做一個(gè)能答辯的界面OpenCV窗口直連攝像頭如果答辯現(xiàn)場(chǎng)能演示實(shí)時(shí)識(shí)別效果遠(yuǎn)好于只放PPT截圖。用OpenCV的VideoCapture打開電腦攝像頭循環(huán)讀取每一幀用上面的predict函數(shù)識(shí)別后疊加顯示識(shí)別結(jié)果。下面是最簡(jiǎn)界面邏輯cap cv2.VideoCapture(0) if not cap.isOpened(): print(camera not found) exit() while True: ret, frame cap.read() if not ret: break # 實(shí)時(shí)推理時(shí)不要做滑窗直接整幅圖預(yù)測(cè) label, conf predict(frame) display frame.copy() cv2.putText(display, f{label} {conf:.2f}, (10, 30), cv2.FONT_HERSHEY_SIMPLEX, 1.0, (0, 0, 255), 2) cv2.imshow(Apple Leaf Disease Recognition, display) key cv2.waitKey(1) 0xFF if key ord(q): break cap.release() cv2.destroyAllWindows()實(shí)時(shí)識(shí)別場(chǎng)景下要犧牲掉滑窗策略因?yàn)槊繋评硪淮我呀?jīng)耗時(shí)約100到200毫秒CPU再疊加滑窗會(huì)掉幀到?jīng)]法看。一個(gè)折中做法是每推理5幀做一次完整滑窗中間4幀沿用最近一次結(jié)果這樣滾動(dòng)的感覺還在計(jì)算壓力卻小得多。waitKey(1)的1毫秒延遲是讓OpenCV窗口能正常處理鍵盤事件和重繪設(shè)成0會(huì)發(fā)生什么問題呢窗口界面會(huì)卡到想砸電腦因?yàn)槭录h(huán)被徹底堵住了。答辯現(xiàn)場(chǎng)要提前試一下攝像頭編號(hào)VideoCapture(0)是筆記本內(nèi)置攝像頭外接USB攝像頭可能是1或者2這個(gè)編號(hào)在設(shè)備管理器里能看到但OpenCV只按順序探測(cè)不要以為下標(biāo)從0開始就一定能打開。4.4 模型性能基準(zhǔn)跑分之前先給CPU降頻演示之前要在你的電腦上先做個(gè)基準(zhǔn)測(cè)試記錄單幀推理耗時(shí)和FPS這個(gè)數(shù)據(jù)答辯時(shí)可以直接展示證明你的系統(tǒng)滿足實(shí)時(shí)性。測(cè)速代碼很簡(jiǎn)單循環(huán)推理100次統(tǒng)計(jì)平均耗時(shí)import time start time.time() for _ in range(100): fake_input np.zeros((224, 224, 3), dtypenp.uint8) predict(fake_input) avg_ms (time.time() - start) * 10 print(favg inference time: {avg_ms:.1f} ms)這里用全零圖測(cè)得的耗時(shí)和真實(shí)圖片相差不大因?yàn)橛?jì)算量主要在網(wǎng)絡(luò)前向推理不在圖像解碼。測(cè)出來的數(shù)字如果在200毫秒左右說明CPU是普通筆記本級(jí)別演示時(shí)把輸入分辨率從224降到160會(huì)提速到100毫秒以下但精度損失可以接受。如果數(shù)字超過500毫秒不要先懷疑OpenCV先看模型導(dǎo)出時(shí)是否意外加上了softmax或者多余的算子用onnx.checker做一次模型檢查排掉多余計(jì)算節(jié)點(diǎn)再測(cè)。很多人在測(cè)速時(shí)開著后臺(tái)瀏覽器、IDE跑出來的數(shù)字波動(dòng)大得離譜解決辦法是關(guān)掉所有其他應(yīng)用這個(gè)測(cè)出來的數(shù)據(jù)才有說服力。5. 避坑記錄復(fù)原數(shù)據(jù)集和模型過程中最常見的五個(gè)問題5.1 opencv-python版本沖突導(dǎo)致DNN報(bào)錯(cuò)現(xiàn)象是跑模型推理時(shí)報(bào)cv2.error: OpenCV(4.4.0) ...找不到readNetFromONNX。原因是你pip默認(rèn)解析出來的opencv-python版本還是舊版或者本機(jī)同時(shí)存在過conda的opencv和pip的opencv兩個(gè)版本混在一起。解決方式是徹底卸載后重裝pip uninstall opencv-python opencv-contrib-python再pip install --no-cache-dir opencv-python4.8.0.76。另外確認(rèn)cv2.__version__是你期望的版本不要只看import不報(bào)錯(cuò)就認(rèn)為環(huán)境沒問題。5.2 訓(xùn)練時(shí)圖讀成None半路崩掉現(xiàn)象是訓(xùn)練到一半報(bào)AttributeError: NoneType object has no attribute shape或者圖集統(tǒng)計(jì)出來的尺寸分布里混了一堆(0,0)。原因通常是數(shù)據(jù)集里有損壞的圖片文件或者圖片路徑里有中文字符OpenCV的imread在win平臺(tái)下解析含中文路徑的文件會(huì)失敗。解決方式是在數(shù)據(jù)加載時(shí)加一層防御邏輯img cv2.imdecode(np.fromfile(full_path, dtypenp.uint8), cv2.IMREAD_COLOR)np.fromfile讀出來的字節(jié)流不經(jīng)過文件路徑的編碼解析imdecode直接解碼繞開中文路徑問題。加載數(shù)據(jù)時(shí)凡遇到None就打印路徑并跳過不要直接中斷訓(xùn)練循環(huán)。5.3 模型在驗(yàn)證集上準(zhǔn)確率很高測(cè)試集上崩現(xiàn)象是驗(yàn)證集準(zhǔn)確率0.95測(cè)試集直接掉到0.6。原因是驗(yàn)證集劃分時(shí)不小心把同一株蘋果樹不同角度的照片拆到了兩邊數(shù)據(jù)泄漏了。解決方式是重新劃分按“圖片所在子目錄”作為分組依據(jù)確保同一來源的圖片不會(huì)同時(shí)出現(xiàn)在訓(xùn)練和測(cè)試?yán)?。很多?biāo)好病害的數(shù)據(jù)集文件名本身就是拍攝時(shí)間加序號(hào)同一批次拍攝的圖片特征高度相似這種泄漏在畢設(shè)中防不勝防但答辯老師一問就能戳穿你。5.4 導(dǎo)出ONNX后推理結(jié)果和PyTorch完全不一致現(xiàn)象是在PyTorch里預(yù)測(cè)某個(gè)類是銹病信心0.9用OpenCV讀ONNX后同一個(gè)圖預(yù)測(cè)成健康信心0.98。原因是blobFromImage的均值處理不對(duì)或者swapRB順序錯(cuò)位。解決方式是做一張固定測(cè)試圖在PyTorch推理時(shí)打印預(yù)處理后的像素第一個(gè)值再在OpenCV里打印blob的第一個(gè)值兩者對(duì)比就能定位是哪個(gè)步驟出問題。這種問題查起來不要靠猜打印數(shù)值來對(duì)比最靠譜。5.5 攝像頭打不開但報(bào)錯(cuò)信息不明顯現(xiàn)象是cap.isOpened()返回False但沒有具體錯(cuò)誤。原因一般是攝像頭被占用比如你打開過微信、釘釘?shù)臄z像頭預(yù)覽或者上次程序沒有cap.release()資源沒有被釋放。解決方式是關(guān)掉所有占用攝像頭的程序重啟IDE的進(jìn)程在命令行里單獨(dú)跑一下打開攝像頭的測(cè)試腳本。如果還能打開那就是進(jìn)程級(jí)資源占用如果打不開檢查設(shè)備是不是被Windows的隱私設(shè)置禁用了。6. 進(jìn)階技巧類別增量學(xué)習(xí)和置信度閾值自適應(yīng)的一個(gè)習(xí)慣如果你想把項(xiàng)目做到答辯中段亮點(diǎn)我建議你加一個(gè)類別增量學(xué)習(xí)的演示模塊。具體做法是把模型輸出的softmax分布保存下來每當(dāng)識(shí)別結(jié)果的置信度低于某個(gè)閾值時(shí)自動(dòng)彈出窗口讓用戶確認(rèn)這張圖屬于哪個(gè)類確認(rèn)后把新樣本追加到數(shù)據(jù)集并做一次簡(jiǎn)易的增量微調(diào)。對(duì)于數(shù)據(jù)集是標(biāo)注好的畢設(shè)項(xiàng)目來說這個(gè)增量模塊本質(zhì)上是把訓(xùn)練流程封裝成可交互界面但它在答辯時(shí)的展示效果比一個(gè)靜態(tài)模型強(qiáng)很多。核心代碼只要在原來的預(yù)測(cè)函數(shù)基礎(chǔ)上加一個(gè)回傳def interactive_feedback(img, pred_label, conf, threshold0.6): label, conf predict(img) if conf threshold: # 彈窗讓用戶二選一接受機(jī)器預(yù)測(cè) or 人工指定 # 簡(jiǎn)單做法收集到 wrong_samples/ 目錄 cv2.imwrite(./feedback/unknown_{}.jpg.format(time.strftime(%Y%m%d_%H%M%S)), img) return label, conf, needs_label return label, conf, ok閾值0.6是一個(gè)經(jīng)驗(yàn)值。蘋果葉病害類間相似度高0.6的閾值能在保持召回的同時(shí)把不確定樣本攔下來。如果你發(fā)現(xiàn)攔下來的樣本中有一半人眼也分不清那說明數(shù)據(jù)集標(biāo)注質(zhì)量本身有問題而不是模型問題這時(shí)不要硬調(diào)模型回看數(shù)據(jù)統(tǒng)計(jì)。這個(gè)小模塊寫到論文里就是“人機(jī)協(xié)同標(biāo)注流程”聽起來比單純“訓(xùn)練了五個(gè)類”有層次得多。我自己做這類畢設(shè)項(xiàng)目的習(xí)慣是模型權(quán)重文件放一個(gè)目錄訓(xùn)練日志放一個(gè)目錄誤判樣本收集目錄單獨(dú)建目錄結(jié)構(gòu)從一開始就固定好后面寫論文的時(shí)候回找任何實(shí)驗(yàn)結(jié)果都能3分鐘內(nèi)翻到。很多同學(xué)跑完代碼模型文件丟了數(shù)據(jù)增強(qiáng)代碼改了十版分不清最終版是哪個(gè)然后論文里的實(shí)驗(yàn)圖和代碼對(duì)不上這才是最受罪的。這個(gè)方向如果你做得順可以繼續(xù)往多病害共存的判別上延伸——同一片葉子同時(shí)得兩種病分類模型只能輸出一個(gè)類但滑窗可以把不同窗口判成不同類別這已經(jīng)是細(xì)粒度識(shí)別的雛形。對(duì)于畢設(shè)把現(xiàn)有流程跑穩(wěn)、把坑填平、把評(píng)估做扎實(shí)就已經(jīng)是拿得出手的水平了。希望幫到你。本文還有配套的精品資源點(diǎn)擊獲取