實(shí)戰(zhàn):從數(shù)據(jù)集標(biāo)注到PyQt界面部署)
簡(jiǎn)介面向玉米葉病害智能檢測(cè)方向的開(kāi)發(fā)者與農(nóng)業(yè)人工智能學(xué)習(xí)者這份實(shí)用資源提供了YOLOv8病害檢測(cè)權(quán)重、PyQt可視化界面以及1500張玉米葉病害標(biāo)注數(shù)據(jù)集幫助解決從數(shù)據(jù)準(zhǔn)備、模型訓(xùn)練到結(jié)果界面化展示的完整流程。數(shù)據(jù)集已預(yù)先劃分train、val、test三個(gè)子目錄并附上data.yaml配置文件標(biāo)簽采用txt格式覆蓋blight、common_rust、gray_leaf_spot、healthy四類常見(jiàn)玉米葉片狀態(tài)借助目錄中已有的py腳本與yaml配置YOLOv5、YOLOv7、YOLOv8、YOLOv9等算法可以直接開(kāi)始訓(xùn)練無(wú)需二次整理數(shù)據(jù)。壓縮包共2000個(gè)文件以1700個(gè)txt文件、171個(gè)Python腳本、56個(gè)yaml配置為主輔以jpg圖片、ui界面文件、pt權(quán)重文件及pdf說(shuō)明整體約182.28MB結(jié)構(gòu)劃分清晰便于按需查找與調(diào)用。目前已有436人瀏覽學(xué)習(xí)對(duì)于需要快速搭建玉米葉病害檢測(cè)項(xiàng)目、完成課程設(shè)計(jì)或畢業(yè)設(shè)計(jì)的讀者是一份可直接落地的配套資源。1. 玉米葉病害檢測(cè)項(xiàng)目為什么說(shuō)權(quán)重、界面、數(shù)據(jù)集三件套才是完整方案手頭拿到一個(gè)yolov8玉米葉病害檢測(cè)權(quán)重 pyqt界面 1500數(shù)據(jù)集的打包項(xiàng)目很多人第一反應(yīng)是“這不就是訓(xùn)練個(gè)模型再套個(gè)界面嗎”。實(shí)際動(dòng)過(guò)手的人都知道模型訓(xùn)練只占整個(gè)工作量的一小半真正耗時(shí)間的是把 1500 張葉片圖整理成能喂給 YOLOv8 的格式、調(diào)出能用的權(quán)重、再把推理邏輯接進(jìn) PyQt 界面里不卡死。這套方案最典型的用途是農(nóng)業(yè)院校的畢業(yè)設(shè)計(jì)、植保部門的病害識(shí)別演示系統(tǒng)、或者小規(guī)模田間采集工具的快速原型——它解決的問(wèn)題是“沒(méi)有算法團(tuán)隊(duì)也能在桌面上跑起一個(gè)病害檢測(cè)工具”。適合兩類人一類是想基于 YOLOv8 做完整落地方案、但不想從零造輪子的開(kāi)發(fā)者另一類是手里有玉米葉圖片、想把識(shí)別能力做成可視化工具的農(nóng)業(yè)信息化從業(yè)者。下面按數(shù)據(jù)、訓(xùn)練、界面、排查的順序把這套東西完整拆開(kāi)講。2. 1500 張玉米葉數(shù)據(jù)集從采集、標(biāo)注到劃分的完整鏈路2.1 病害類別怎么定先從病斑形態(tài)反推標(biāo)注方案玉米葉病害檢測(cè)的數(shù)據(jù)集類別劃分直接決定標(biāo)注工作量。常見(jiàn)的做法是分 4 類健康葉片healthy、銹病rust、灰斑病gray_leaf_spot、北方葉枯病northern_leaf_blight。銹病是葉片上散生的鐵銹色粉狀斑點(diǎn)灰斑病是長(zhǎng)條狀灰褐色病斑葉枯病是大面積枯黃壞死斑——這三類形態(tài)差異明顯YOLOv8 學(xué)起來(lái)相對(duì)容易。如果分類太細(xì)比如把不同嚴(yán)重程度也拆成單獨(dú)類1500 張圖根本不夠分標(biāo)注返工率會(huì)很高。我一般建議拿到圖先做一輪“可標(biāo)注性檢查”把所有圖批量縮略圖瀏覽一遍剔除模糊、嚴(yán)重過(guò)曝、葉片占畫面比例太小低于 10%的圖。葉片檢測(cè)和日常目標(biāo)檢測(cè)不一樣病斑是小目標(biāo)原圖分辨率如果低于 800×600縮到 YOLOv8 的 640 輸入尺寸后小病斑就只剩幾個(gè)像素后期怎么調(diào)參都救不回來(lái)。標(biāo)注方案上有個(gè)關(guān)鍵決策點(diǎn)一張葉片上有多個(gè)病斑是框整片葉子還是框單個(gè)病斑從檢測(cè)邏輯講框單個(gè)病斑更合理因?yàn)槟繕?biāo)就是“找出病害位置”。實(shí)際標(biāo)注時(shí)小病斑用矩形框病斑連成片時(shí)框它的外邊緣輪廓。建議一圖多框不要害怕標(biāo)注密度大YOLOv8 對(duì)密集小目標(biāo)的支持比舊版 YOLO 好很多。2.2 labelme 標(biāo)注到 YOLO 格式轉(zhuǎn)換腳本與四個(gè)邊界坑數(shù)據(jù)集處理是這套項(xiàng)目里第一個(gè)翻車高發(fā)區(qū)。1500 張圖用 labelme 標(biāo)注”labelme標(biāo)注用于yolov8“這一步繞不開(kāi)產(chǎn)出的是 json 文件而 YOLOv8 訓(xùn)練需要的是 txt 格式的歸一化坐標(biāo)。這個(gè)轉(zhuǎn)換沒(méi)做好“yolov8訓(xùn)練自己的數(shù)據(jù)集”這一步直接卡死。labelme 標(biāo)注完成后每張圖對(duì)應(yīng)一個(gè)同名的 json 文件。轉(zhuǎn)換腳本的核心邏輯是讀取 json 里的 shapes 數(shù)組取出每個(gè)標(biāo)注框的 xy 坐標(biāo)換算成歸一化的 cx, cy, w, h 寫入 txt。下面這個(gè)腳本是我一直在用的簡(jiǎn)化版import json import os from pathlib import Path def convert_labelme_to_yolo(json_path, img_width, img_height, class_dict, out_dir): json_path: labelme 標(biāo)注產(chǎn)出的 json 文件 img_width, img_height: 原圖尺寸必須從原圖讀取不能依賴 json 字段 class_dict: {rust: 0, gray_leaf_spot: 1, northern_leaf_blight: 2, healthy: 3} out_dir: 輸出 txt 文件的目錄 with open(json_path, r, encodingutf-8) as f: data json.load(f) txt_path Path(out_dir) / (Path(json_path).stem .txt) with open(txt_path, w, encodingutf-8) as out: for shape in data[shapes]: label shape[label] if label not in class_dict: continue # 未定義的類別直接跳過(guò) points shape[points] # [[x1, y1], [x2, y2]] x1, y1 points[0] x2, y2 points[1] # 有的標(biāo)注工具會(huì)畫出反向框統(tǒng)一取左上右下 x_left min(x1, x2) y_top min(y1, y2) x_right max(x1, x2) y_bottom max(y1, y2) # 歸一化到 0~1 x_center (x_left x_right) / 2.0 / img_width y_center (y_top y_bottom) / 2.0 / img_height width (x_right - x_left) / img_width height (y_bottom - y_top) / img_height # 過(guò)濾掉無(wú)效框?qū)捇蚋咝∮?3 像素的框丟不掉會(huì)拉低訓(xùn)練質(zhì)量 if width * img_width 3 or height * img_height 3: continue out.write(f{class_dict[label]} {x_center:.6f} {y_center:.6f} {width:.6f} {height:.6f}\n)這個(gè)腳本的邏輯核心在三點(diǎn)一是原圖尺寸一定要從圖像文件本身讀取cv2.imread或 PIL不要信任 json 里的imageWidth字段——我遇到過(guò)一次 labelme 版本差異導(dǎo)致該字段缺失二是類別索引必須和后續(xù) data.yaml 里的 names 順序嚴(yán)格一致否則訓(xùn)練時(shí)類別標(biāo)簽錯(cuò)位模型 loss 能降但預(yù)測(cè)結(jié)果全對(duì)不上三是小框過(guò)濾邏輯病斑標(biāo)注里很容易出現(xiàn)只有幾個(gè)像素的碎框留著只會(huì)讓正樣本質(zhì)量變差。轉(zhuǎn)換完要做一次反向校驗(yàn)。寫個(gè)幾行的腳本把 txt 里的坐標(biāo)畫回到原圖上用 OpenCV 的rectangle函數(shù)按歸一化坐標(biāo)反算像素坐標(biāo)隨機(jī)抽樣 20 張肉眼過(guò)一遍。這一步叫“標(biāo)注自檢”能發(fā)現(xiàn) 90% 的坐標(biāo)轉(zhuǎn)換錯(cuò)誤。常見(jiàn)的錯(cuò)誤包括 x_center 算成了 x_left、寬高寫成了 x2-x1 與 y2-y1 的原始像素值沒(méi)有歸一化等。2.3 數(shù)據(jù)集劃分與增強(qiáng)別讓驗(yàn)證集成了玄學(xué)1500 張圖在“處理數(shù)據(jù)集用于yolov8訓(xùn)練”這一步劃分比例建議按 7:2:1 拆訓(xùn)練、驗(yàn)證、測(cè)試。關(guān)鍵在于要按目錄級(jí)別的維度打亂而不是簡(jiǎn)單random.shuffle后切片。import random import shutil from pathlib import Path random.seed(42) # 固定種子保證可復(fù)現(xiàn) src_dir Path(path/to/labeled_images) train_dir Path(dataset/images/train) val_dir Path(dataset/images/val) test_dir Path(dataset/images/test) # 按文件名分組防止同名不同后綴導(dǎo)致標(biāo)注錯(cuò)位 image_files list(src_dir.glob(*.jpg)) list(src_dir.glob(*.png)) random.shuffle(image_files) total len(image_files) train_split int(total * 0.7) val_split int(total * 0.9) for i, img_path in enumerate(image_files): if i train_split: dest train_dir elif i val_split: dest val_dir else: dest test_dir # 圖片和同名 txt 標(biāo)注必須一起搬運(yùn) shutil.copy(img_path, dest / img_path.name) label_path Path(path/to/labeled_txt) / (img_path.stem .txt) if label_path.exists(): shutil.copy(label_path, Path(str(dest).replace(images, labels)) / label_path.name) print(f訓(xùn)練集 {train_split} 張驗(yàn)證集 {val_split - train_split} 張測(cè)試集 {total - val_split} 張)劃分里有三個(gè)細(xì)節(jié)直接影響訓(xùn)練效果。第一個(gè)是固定隨機(jī)種子——不固定的話每次劃分結(jié)果不同模型對(duì)比實(shí)驗(yàn)就失去了意義。第二個(gè)是復(fù)制時(shí)要同時(shí)復(fù)制圖片和同名 txt目錄結(jié)構(gòu)必須是images/train和labels/train這種平行目錄YOLOv8 會(huì)按圖片路徑自動(dòng)找同名標(biāo)簽。第三個(gè)是驗(yàn)證集和訓(xùn)練集的類別分布要保持一致比如銹病圖占比 30%驗(yàn)證集里也基本是 30%否則驗(yàn)證集 mAP 就變成了隨機(jī)波動(dòng)。增強(qiáng)方面1500 張圖直接訓(xùn)練容易過(guò)擬合。我一般用 YOLOv8 自帶的數(shù)據(jù)增強(qiáng)配置不開(kāi)額外腳本。主要調(diào)這三個(gè)參數(shù)hsv_h 0.015做顏色擾動(dòng)模擬不同光照translate 0.1做平移增強(qiáng)模擬葉片在畫面中位置變化mosaic 1.0保持打開(kāi)——Mosaic 把四張圖拼成一張訓(xùn)練對(duì)提升小病斑的檢測(cè)能力很有幫助。注意驗(yàn)證集不要做增強(qiáng)數(shù)據(jù)增強(qiáng)只作用于訓(xùn)練集。3. 訓(xùn)練玉米葉病害權(quán)重YOLOv8 配置、參數(shù)與損失曲線3.1 環(huán)境與預(yù)訓(xùn)練權(quán)重選擇CPU 也能跑但要有耐心“ubuntu20.04搭建yolov8環(huán)境cpu版本”和“yolov8預(yù)訓(xùn)練權(quán)重下載”是訓(xùn)練前繞不開(kāi)的兩個(gè)現(xiàn)實(shí)問(wèn)題。環(huán)境搭建有個(gè)血淚經(jīng)驗(yàn)優(yōu)先用pip install ultralytics而不是從源碼編譯源碼編譯在 PyTorch 版本適配上的坑太多。CPU 版本環(huán)境的核心命令是# 創(chuàng)建虛擬環(huán)境避免污染系統(tǒng) Python python3 -m venv yolov8_env source yolov8_env/bin/activate # 安裝 CPU 版 PyTorch務(wù)必加 --index-url 指定 CPU 源 pip install torch torchvision --index-url https://download.pytorch.org/whl/cpu pip install ultralytics # 驗(yàn)證安裝 python -c from ultralytics import YOLO; print(YOLO.__name__)裝完驗(yàn)證一下import torch; print(torch.cuda.is_available())輸出 False 是正常的——CPU 版安裝成功就是這個(gè)結(jié)果。很多人看到 False 以為裝錯(cuò)了其實(shí)這是預(yù)期狀態(tài)。預(yù)訓(xùn)練權(quán)重選哪個(gè)取決于你的顯存/內(nèi)存和訓(xùn)練時(shí)長(zhǎng)預(yù)期。yolov8n.pt 是最輕量的CPU 訓(xùn)練 1500 張圖、640 分辨率、100 epochs大概需要 8 到 12 小時(shí)yolov8s.pt 精度好一些但時(shí)間翻倍yolov8m.pt 以上就不建議 CPU 跑了等一整天都未必收斂。GTX 1660 Ti 這類 6G 顯存顯卡跑 yolov8s 開(kāi) batch 16 沒(méi)有問(wèn)題這是我踩過(guò)的最低配置線。從 ultralytics 官方 release 下載預(yù)訓(xùn)練權(quán)重時(shí)注意下載對(duì)應(yīng)版本的 .pt 文件——YOLOv8 的權(quán)重文件是 PyTorch 序列化格式版本太舊或太新都可能加載失敗。還有一個(gè)關(guān)鍵選擇是從頭訓(xùn)練還是遷移學(xué)習(xí)。玉米葉病害不是 COCO 里的類別但 COCO 預(yù)訓(xùn)練權(quán)重里學(xué)到的紋理、邊緣、小目標(biāo)特征遷移過(guò)來(lái)依然有效。所以直接model YOLO(yolov8s.pt)讓 ultralytics 自動(dòng)加載預(yù)訓(xùn)練權(quán)重訓(xùn)練時(shí)會(huì)自動(dòng)適配新的類別數(shù)不要手動(dòng)改權(quán)重文件的最后一層。3.2 訓(xùn)練參數(shù)怎么設(shè)從 data.yaml 到訓(xùn)練命令“yolov8模型訓(xùn)練參數(shù)含義”對(duì)新手來(lái)說(shuō)是最容易糊涂的。先搞定 data.yaml這是數(shù)據(jù)集和訓(xùn)練的橋梁# dataset.yaml path: /path/to/dataset # 數(shù)據(jù)集根目錄建議用絕對(duì)路徑 train: images/train # 訓(xùn)練集相對(duì)路徑 val: images/val # 驗(yàn)證集相對(duì)路徑 test: images/test # 測(cè)試集相對(duì)路徑 nc: 4 # 類別數(shù) names: [rust, gray_leaf_spot, northern_leaf_blight, healthy]注意names的索引順序必須和上一章轉(zhuǎn)換腳本里的class_dict值一一對(duì)應(yīng)。我遇到過(guò)一次把 healthy 放在最前面導(dǎo)致索引錯(cuò)位訓(xùn)練完全正常但推理輸出張冠李戴檢查了很久才發(fā)現(xiàn)是這里的問(wèn)題。訓(xùn)練命令本身不長(zhǎng)但每個(gè)參數(shù)都要心里有數(shù)yolo detect train \ data/path/to/dataset.yaml \ modelyolov8s.pt \ epochs100 \ imgsz640 \ batch16 \ lr00.01 \ patience15 \ device0 # CPU 環(huán)境改成 devicecpu幾個(gè)關(guān)鍵參數(shù)的落地經(jīng)驗(yàn)epochs100對(duì) 1500 張圖來(lái)說(shuō)足夠配合patience15早停機(jī)制驗(yàn)證集指標(biāo)連續(xù) 15 輪不提升就自動(dòng)停止可以避免多余等待。imgsz640是默認(rèn)值但值得解釋——玉米葉病斑很多是幾十像素的小目標(biāo)上調(diào)到 960 理論上能提升小目標(biāo)召回率但訓(xùn)練時(shí)間和顯存占用翻倍不止1500 張圖的體量先用 640 跑通再看情況調(diào)。batch設(shè)置原則是顯存能承受的最大值CPU 環(huán)境 8 到 16 就夠。lr0是初始學(xué)習(xí)率1e-2 是 YOLOv8 的默認(rèn)值如果訓(xùn)練過(guò)程中發(fā)現(xiàn) loss 震蕩劇烈優(yōu)先降到 5e-3 而不是去調(diào)別的參數(shù)。3.3 訓(xùn)練過(guò)程看什么損失曲線和驗(yàn)證指標(biāo)的正確讀法訓(xùn)練啟動(dòng)后不要只是干等。YOLOv8 會(huì)在runs/detect/train/目錄下輸出results.csv里面記錄了每一輪的 box_loss、cls_loss、dfl_loss 以及驗(yàn)證集的 metrics。用下面這個(gè)腳本可以把損失曲線畫出來(lái)比盯著控制臺(tái)輸出直觀得多import pandas as pd import matplotlib.pyplot as plt # 訓(xùn)練完成后運(yùn)行results.csv 在 ultralytics 每次訓(xùn)練的獨(dú)立目錄下 df pd.read_csv(runs/detect/train/results.csv) plt.figure(figsize(10, 6)) plt.plot(df[epoch], df[train/box_loss], labeltrain box_loss, linewidth1) plt.plot(df[epoch], df[val/box_loss], labelval box_loss, linewidth1) plt.plot(df[epoch], df[train/cls_loss], labeltrain cls_loss, linewidth1) plt.plot(df[epoch], df[val/cls_loss], labelval cls_loss, linewidth1) plt.xlabel(epoch) plt.ylabel(loss) plt.title(YOLOv8 Corn Leaf Disease Training Loss) plt.legend() plt.grid(True) plt.savefig(loss_curve.png, dpi150)“yolov8畫損失函數(shù)曲線圖”其實(shí)就這么幾行代碼。讀曲線有兩條實(shí)戰(zhàn)經(jīng)驗(yàn)一是 train loss 和 val loss 的差距訓(xùn)練后期越拉越大說(shuō)明過(guò)擬合了此時(shí)應(yīng)該提前終止或者加大數(shù)據(jù)增強(qiáng)二是 val box_loss 在訓(xùn)練 20 輪左右開(kāi)始不再下降甚至反彈說(shuō)明模型容量接近上限繼續(xù)跑只是浪費(fèi)時(shí)間這時(shí)候去調(diào) batch、lr 的意義不大不如回頭檢查標(biāo)注質(zhì)量。訓(xùn)練結(jié)束后的驗(yàn)收指標(biāo)不要只看 mAP50。玉米葉病害檢測(cè)的驗(yàn)收重點(diǎn)要看三個(gè)指標(biāo)mAP50、mAP50-95、以及每個(gè)類別的單獨(dú) AP。健康葉片這類負(fù)樣本很容易拉高整體 mAP但銹病和灰斑病這種小目標(biāo)的 AP 才是真正決定可用性的。如果 rust 類的 AP 明顯低于其他類最常見(jiàn)的兩個(gè)原因是標(biāo)注框太小、標(biāo)注數(shù)量不均衡前者要重新標(biāo)后者要補(bǔ)圖或者做過(guò)采樣。4. 把權(quán)重接進(jìn) PyQt 界面推理邏輯與線程設(shè)計(jì)4.1 界面框架加載權(quán)重、選圖、顯示結(jié)果的最小結(jié)構(gòu)PyQt 界面的價(jià)值不在好看在于把訓(xùn)練好的權(quán)重包裝成一個(gè)“非算法人員也能操作”的工具。我見(jiàn)過(guò)很多項(xiàng)目把界面寫得很復(fù)雜各種側(cè)邊欄、歷史記錄、數(shù)據(jù)庫(kù)存儲(chǔ)實(shí)際上最核心的交互只有三個(gè)動(dòng)作加載權(quán)重、選擇圖片、顯示檢測(cè)結(jié)果。下面是最小可用骨架import sys from PyQt5.QtWidgets import (QApplication, QMainWindow, QLabel, QPushButton, QVBoxLayout, QWidget, QFileDialog) from PyQt5.QtGui import QPixmap class MainWindow(QMainWindow): def __init__(self): super().__init__() self.setWindowTitle(玉米葉病害檢測(cè)) self.setMinimumSize(800, 600) # 三個(gè)核心控件按鈕 圖片顯示標(biāo)簽 結(jié)果文本標(biāo)簽 self.btn_load_model QPushButton(加載權(quán)重) self.btn_select_image QPushButton(選擇圖片) self.image_label QLabel(圖片顯示區(qū)域) self.image_label.setAlignment(__import__(Qt).QtCore.Qt.AlignCenter) self.result_label QLabel(檢測(cè)結(jié)果將在此顯示) layout QVBoxLayout() layout.addWidget(self.btn_load_model) layout.addWidget(self.btn_select_image) layout.addWidget(self.image_label) layout.addWidget(self.result_label) container QWidget() container.setLayout(layout) self.setCentralWidget(container) # 信號(hào)連接 self.btn_load_model.clicked.connect(self.load_model) self.btn_select_image.clicked.connect(self.select_image) def load_model(self): # 打開(kāi)文件對(duì)話框選擇 .pt 權(quán)重文件 path, _ QFileDialog.getOpenFileName( self, 選擇權(quán)重文件, , PyTorch Weight (*.pt)) if path: self.result_label.setText(f已加載: {path.split(/)[-1]}) def select_image(self): path, _ QFileDialog.getOpenFileName( self, 選擇圖片, , Images (*.jpg *.jpeg *.png)) if path: pixmap QPixmap(path) scaled pixmap.scaled(self.image_label.size(), __import__(Qt).QtCore.Qt.KeepAspectRatio) self.image_label.setPixmap(scaled) self.result_label.setText(f待檢測(cè): {path.split(/)[-1]}) if __name__ __main__: app QApplication(sys.argv) window MainWindow() window.show() sys.exit(app.exec_())這段代碼里要注意的是圖片縮放scaled()按 label 尺寸等比縮放否則大圖會(huì)超出界面。load_model里目前只更新了文字真正加載權(quán)重放在后面的推理初始化里不要在這里反復(fù)加載模型模型初始化耗時(shí)可能有幾秒鐘做成獨(dú)立動(dòng)作更合理。QMainWindow 繼承是 PyQt 桌面應(yīng)用的固定做法QVBoxLayout 垂直布局保證控件從上到下排列。這個(gè)骨架跑通后再往界面里加“檢測(cè)置信度閾值滑條”“結(jié)果導(dǎo)出按鈕”都只是往 layout 里追加控件的事。4.2 推理代碼從權(quán)重文件到畫框顯示的完整路徑界面選圖后要調(diào)用的核心推理函數(shù)這是整個(gè) PyQt 界面里技術(shù)含量最高的部分。不推薦在界面里直接用model.predict(sourcepath)一把梭因?yàn)?predict 方法返回的結(jié)果對(duì)象需要解析才能拿到坐標(biāo)和類別from ultralytics import YOLO import cv2 import numpy as np class DiseaseDetector: def __init__(self, weight_path): # 模型只初始化一次多個(gè)控件共用同一實(shí)例 self.model YOLO(weight_path) self.class_names [銹病, 灰斑病, 葉枯病, 健康] def detect_and_draw(self, image_path, conf_thres0.25): 返回畫好框的圖像 numpy 數(shù)組和檢測(cè)結(jié)果字符串 results self.model.predict( sourceimage_path, confconf_thres, # 置信度閾值越高越嚴(yán)格 imgsz640, # 推理尺寸訓(xùn)練時(shí)多少這里就用多少 device0, # CPU 環(huán)境改成 cpu verboseFalse # 不打印推理日志 ) # 注意results 是列表一張圖時(shí)取 [0] result results[0] img cv2.imread(image_path) # 解析檢測(cè)結(jié)果 if result.boxes is None or len(result.boxes) 0: return img, 未檢測(cè)到病害 boxes result.boxes.xyxy.cpu().numpy() # Nx4 的框坐標(biāo) classes result.boxes.cls.cpu().numpy().astype(int) # N 個(gè)類別索引 confs result.boxes.conf.cpu().numpy() # N 個(gè)置信度 det_text [] for box, cls, conf in zip(boxes, classes, confs): x1, y1, x2, y2 [int(v) for v in box] # 在原始圖上畫矩形框和標(biāo)簽 color (0, 0, 255) # BGR 格式紅色框比較醒目 cv2.rectangle(img, (x1, y1), (x2, y2), color, 2) label f{self.class_names[cls]} {conf:.2f} cv2.putText(img, label, (x1, max(0, y1-8)), cv2.FONT_HERSHEY_SIMPLEX, 0.7, color, 2) det_text.append(label) return img, ; .join(det_text)這段代碼里有三個(gè)變量名很容易寫錯(cuò)result.boxes.xyxy、result.boxes.cls、result.boxes.conf三個(gè)都帶.boxes前綴結(jié)構(gòu)是 ultralytics 封裝好的張量對(duì)象。.cpu().numpy()是因?yàn)?GPU 推理時(shí)這些張量在顯存上必須先拷回 CPU 再轉(zhuǎn) numpy否則后面cv2.rectangle會(huì)報(bào)類型錯(cuò)誤。device0在 GPU 環(huán)境是 0 號(hào)顯卡CPU 環(huán)境必須顯式寫devicecpu否則 ultralytics 會(huì)嘗試初始化 CUDA 然后報(bào)錯(cuò)。推理尺寸和訓(xùn)練尺寸必須一致。訓(xùn)練時(shí)imgsz640推理時(shí)也用 640因?yàn)槟P蛯W(xué)到的是 640 尺度下的特征表達(dá)突然改成 960 會(huì)讓檢測(cè)框位置偏移。置信度閾值conf_thres0.25是一個(gè)比較通用的起點(diǎn)實(shí)測(cè)發(fā)現(xiàn)玉米葉病斑在 0.25 下能召回大部分但誤檢也多界面里做成滑條讓用戶自己調(diào)更實(shí)用。4.3 別讓界面卡死QThread 處理推理的必要性PyQt 新手最大的翻車現(xiàn)場(chǎng)是點(diǎn)擊“選擇圖片”后如果直接在槽函數(shù)里調(diào)用detect_and_draw程序會(huì)卡住 5 到 10 秒CPU 推理更久期間窗口無(wú)法拖動(dòng)、按鈕無(wú)法點(diǎn)擊操作系統(tǒng)甚至?xí)棾觥俺绦蛭错憫?yīng)”的提示。原因很簡(jiǎn)單推理是阻塞操作把 GUI 主線程堵死了。解決辦法是開(kāi)一個(gè)工作線程用 QThread 的 run 方法執(zhí)行推理完成后發(fā)信號(hào)回主線程更新界面from PyQt5.QtCore import QThread, pyqtSignal class InferenceThread(QThread): # 信號(hào)定義在類屬性中在 run 中 emit finished_signal pyqtSignal(object, str) # 第一個(gè)是結(jié)果圖像 numpy 數(shù)組 def __init__(self, detector, image_path, conf_thres0.25): super().__init__() self.detector detector self.image_path image_path self.conf_thres conf_thres def run(self): # 這里執(zhí)行的是耗時(shí)推理不阻塞主線程 img, det_text self.detector.detect_and_draw( self.image_path, self.conf_thres) self.finished_signal.emit(img, det_text) class MainWindow(QMainWindow): # ... 之前的界面代碼省略 ... def start_detection(self): # 點(diǎn)擊檢測(cè)按鈕后調(diào)用 self.btn_select_image.setEnabled(False) # 防止重復(fù)點(diǎn)擊 self.result_label.setText(推理中...) # 啟動(dòng)線程 self.thread InferenceThread(self.detector, self.current_image_path, self.conf_thres) self.thread.finished_signal.connect(self.on_detection_finished) self.thread.finished.connect(self.thread.deleteLater) # 防止內(nèi)存泄漏 self.thread.start() def on_detection_finished(self, img, det_text): # 回到主線程安全更新界面 h, w, ch img.shape bytes_per_line ch * w from PyQt5.QtGui import QImage qimg QImage(img.data, w, h, bytes_per_line, QImage.Format_RGB888).rgbSwapped() self.image_label.setPixmap(QPixmap.fromImage(qimg)) self.result_label.setText(det_text) self.btn_select_image.setEnabled(True)QThread 的關(guān)鍵紀(jì)律所有對(duì)界面控件的操作都必須回到主線程完成工作線程只做計(jì)算。這里finished_signal.emit(img, det_text)把 numpy 數(shù)組和文字結(jié)果傳回on_detection_finished是主線程上下文中的槽函數(shù)在里面安全地更新 QLabel。deleteLater防止線程對(duì)象銷毀不徹底我踩過(guò)這個(gè)坑不加的話連續(xù)檢測(cè)幾十次后程序內(nèi)存暴漲。圖像轉(zhuǎn) QImage 時(shí)的格式轉(zhuǎn)換要特別注意OpenCV 讀出來(lái)的是 BGR 順序QImage 默認(rèn)是 RGB直接用會(huì)看到顏色整體偏藍(lán)。解決辦法是Format_RGB888配合.rgbSwapped()把 BGR 轉(zhuǎn)成 RGB 再交給 QPixmap。還有img.data必須是連續(xù)的如果 numpy 數(shù)組經(jīng)過(guò)了裁剪或其他操作導(dǎo)致內(nèi)存不連續(xù)要先np.ascontiguousarray()再做 QImage否則顯示出來(lái)是花的。5. 項(xiàng)目落地的六個(gè)高頻問(wèn)題排查從環(huán)境到推理翻車5.1 訓(xùn)練時(shí) loss 變成 NaN所有指標(biāo)瞬間歸零現(xiàn)象訓(xùn)練到第 5 到 15 輪之間控制臺(tái)輸出里 train/box_loss 突然變成nan隨后往后的所有指標(biāo)全部為nantensorboard 和 results.csv 里的曲線直接斷掉。原因最常見(jiàn)的是學(xué)習(xí)率設(shè)置過(guò)大導(dǎo)致梯度爆炸其次是輸入數(shù)據(jù)里混入了損壞的圖片文件比如標(biāo)稱 jpg 實(shí)際是 txt 改后綴、圖片文件不完整只有半個(gè)文件頭模型在反向傳播時(shí)讀到了異常梯度。還有一個(gè)隱蔽原因是 batch 太大在 CPU 或小顯存機(jī)器上觸發(fā)內(nèi)存溢出后的數(shù)值異常。解決把lr0從默認(rèn)的 0.01 降到 0.005 甚至 0.003 再試。同時(shí)跑一個(gè)腳本遍歷所有訓(xùn)練圖片用cv2.imread逐個(gè)檢查返回值是否為 None把所有讀不出來(lái)的圖挑出來(lái)刪掉或者重新導(dǎo)出。這兩個(gè)動(dòng)作做掉 80% 的 NaN 問(wèn)題。如果還在 NaN把batch減半再訓(xùn)一輪。5.2 PyQt 界面推理報(bào)錯(cuò)CUDA out of memory現(xiàn)象檢測(cè)程序在終端運(yùn)行沒(méi)問(wèn)題在 PyQt 界面里點(diǎn)幾次“檢測(cè)”后就報(bào)RuntimeError: CUDA out of memory程序沒(méi)有崩潰但檢測(cè)結(jié)果不再顯示。原因界面程序不像終端腳本那樣退出即釋放顯存。PyTorch 的 GPU 顯存分配器和圖緩存會(huì)在進(jìn)程內(nèi)持續(xù)累積每次推理生成的中間張量如果沒(méi)有被正確釋放多次檢測(cè)后顯存就被占滿了。另一個(gè)原因是推理時(shí)imgsz設(shè)得太大比如用了 1280單次推理的顯存占用直接翻倍。解決每次推理前調(diào)用torch.cuda.empty_cache()清理未使用的緩存塊然后在detect_and_draw函數(shù)結(jié)束后把result對(duì)象置空。如果還是不夠改成devicecpu推理雖然慢但穩(wěn)定。界面場(chǎng)景下檢測(cè)單張圖對(duì)速度不敏感CPU 推理反而是更省心的選擇。5.3 檢測(cè)框畫的位置和病害實(shí)際位置對(duì)不上整體偏移現(xiàn)象模型在訓(xùn)練集和驗(yàn)證集上都表現(xiàn)良好mAP50 在 0.85 以上但放到 PyQt 界面里對(duì)實(shí)拍圖檢測(cè)時(shí)畫出來(lái)的框整體偏上或偏下置信度還很高。原因訓(xùn)練時(shí)輸入圖像是原圖直接縮放到 640推理時(shí)如果用了不同的縮放方式比如先按短邊縮放再 padding或者沒(méi)有保持等比例圖像的空間對(duì)應(yīng)關(guān)系就變了。還有一個(gè)原因是訓(xùn)練和推理的imgsz不一致。YOLOv8 內(nèi)部對(duì)輸入做了 letterbox 處理如果外面再疊加一層自己的縮放就會(huì)雙重扭曲導(dǎo)致坐標(biāo)錯(cuò)位。解決推理路徑上堅(jiān)決不要自己手動(dòng)cv2.resize直接把原始圖像路徑傳給model.predict(sourceimage_path)讓 ultralytics 內(nèi)部按標(biāo)準(zhǔn) letterbox 流程處理。如果非要自己加載圖像做預(yù)處理必須用ultralytics提供的letterbox工具函數(shù)而不是 OpenCV 的 naive resize。5.4 驗(yàn)證集指標(biāo)高但換成手機(jī)拍的照片檢出率驟降現(xiàn)象訓(xùn)練時(shí) val mAP50 到了 0.92感覺(jué)模型很完美結(jié)果拿手機(jī)在田間拍了幾張一個(gè)病斑都檢不出來(lái)檢出來(lái)的也是錯(cuò)框。原因數(shù)據(jù)集“同源”問(wèn)題。1500 張圖如果全部來(lái)自同一個(gè)采集設(shè)備、同一個(gè)時(shí)間、同一個(gè)光照環(huán)境模型實(shí)際上學(xué)的是那一種光線條件下的葉片紋理而不是通用的病害特征。這是小數(shù)據(jù)集最典型的翻車屬于泛化能力不足不是模型結(jié)構(gòu)問(wèn)題。解決往數(shù)據(jù)集里混入不同背景的圖。手機(jī)拍的和專業(yè)相機(jī)拍的混在一起、晴天和陰天各拍一部分、葉片背面也拍一部分。實(shí)在加不了新數(shù)據(jù)就在訓(xùn)練時(shí)把hsv_h從 0.015 提高到 0.03hsv_s提高到 0.7用顏色擾動(dòng)硬生生逼模型學(xué)到病害本身的紋理特征而不是光照特征。5.5 界面能打開(kāi)但加載權(quán)重時(shí)報(bào)RuntimeError: Unable to load model現(xiàn)象點(diǎn)擊“加載權(quán)重”選擇.pt文件后程序直接報(bào)錯(cuò)退出報(bào)錯(cuò)信息是RuntimeError: Unable to load model加一串不可讀的 pickle 報(bào)錯(cuò)。原因版本不匹配是主因。權(quán)重文件是用 YOLOv8 某個(gè)版本訓(xùn)練的但當(dāng)前環(huán)境里裝的 ultralytics 版本太舊或太新模型結(jié)構(gòu)定義和序列化內(nèi)容對(duì)不上。另一個(gè)常見(jiàn)原因是把普通 PyTorch.pth文件當(dāng)成了.pt權(quán)重YOLOv8 加載的必須是 ultralytics 訓(xùn)練的完整 checkpoint。解決檢查環(huán)境里的 ultralytics 版本pip show ultralytics | grep Version然后確認(rèn)訓(xùn)練時(shí)的版本。盡量固定采用pip install ultralytics8.x.x的某個(gè)具體版本不要用最新版跑舊權(quán)重。如果是自己訓(xùn)練的權(quán)重上傳和下載之間別用網(wǎng)盤在線解壓功能傳輸過(guò)程很容易把文件搞損壞重新下載原文件即可。5.6 檢測(cè)結(jié)果里 rust 類全部顯示成了 healthy現(xiàn)象模型的框位置準(zhǔn)確但類別標(biāo)簽錯(cuò)亂銹病全部標(biāo)成了健康灰斑病標(biāo)成了銹病整體錯(cuò)位一個(gè)索引。原因data.yaml的names順序和訓(xùn)練時(shí)用的類別字典不一致。訓(xùn)練時(shí)class_dict是{rust: 0, gray_leaf_spot: 1}但界面推理代碼里的self.class_names按字母序排成了[gray_leaf_spot, healthy, rust]索引對(duì)不上。解決在項(xiàng)目根目錄建一個(gè)classes.json統(tǒng)一維護(hù)類別順序訓(xùn)練腳本讀它生成 data.yaml界面代碼讀它生成 class_names兩端永遠(yuǎn)使用同一份配置。不要在兩份代碼里分別硬編碼類別列表這是團(tuán)隊(duì)協(xié)作里最容易出現(xiàn)的隱蔽 bug。6. 進(jìn)階驗(yàn)證與部署從檢測(cè)框到可量化的病害報(bào)告這套方案的最后一公里是把“能檢測(cè)”變成“能交付”。我最常用的技巧是給 PyQt 界面加一個(gè)“導(dǎo)出報(bào)告”按鈕檢測(cè)完成后把每張圖片的檢測(cè)結(jié)果匯總成 CSV——包含文件名、病害類別、置信度、框坐標(biāo)、框面積占葉片面積比例。單張圖看起來(lái)只是畫了幾個(gè)框但一整個(gè)批次的檢測(cè)結(jié)果匯總后病害分布、嚴(yán)重程度、不同類別的置信度分布都變得可量化了。這個(gè)功能對(duì)農(nóng)業(yè)信息化項(xiàng)目來(lái)說(shuō)價(jià)值很大因?yàn)檗r(nóng)戶真正想要的是“這塊地病害多嚴(yán)重”而不是一張畫了紅框的圖。另一個(gè)值得做的拓展是把推理邏輯從界面里抽出來(lái)做成獨(dú)立服務(wù)用 FastAPI 封裝成一個(gè) HTTP 接口。這樣 PyQt 界面不再直接依賴本地權(quán)重文件而是通過(guò) HTTP 請(qǐng)求訪問(wèn)推理服務(wù)界面換機(jī)器部署時(shí)只需要裝 PyQt 不需要再裝 PyTorch 和 CUDA。目錄結(jié)構(gòu)做成分離之后權(quán)和界面各自可以獨(dú)立演進(jìn)。模型本身的進(jìn)一步提升方向我會(huì)優(yōu)先試這兩個(gè)一是給 rust 類專門的病斑檢測(cè)分支因?yàn)殇P病病斑密集且小標(biāo)準(zhǔn) YOLOv8 的檢測(cè)頭對(duì)小目標(biāo)不敏感可以考慮添加一個(gè)小目標(biāo)檢測(cè)層二是用測(cè)試集做置信度閾值分析畫出每個(gè)類別的 precision-recall 隨閾值變化的曲線挑出每個(gè)類別的最佳閾值——綠色健康葉片和銹病的置信度分布幾乎不重疊閾值調(diào)到 0.4 以上能顯著壓低誤檢。做這個(gè)項(xiàng)目時(shí)我踩過(guò)最深的坑是數(shù)據(jù)集的一次錯(cuò)誤轉(zhuǎn)換導(dǎo)致全部重新標(biāo)注后來(lái)養(yǎng)成了一個(gè)習(xí)慣每次新接檢測(cè)任務(wù)先花十分鐘檢查數(shù)據(jù)集的質(zhì)量和格式再花十分鐘定類別索引表之后才開(kāi)始訓(xùn)練。權(quán)重文件的命名也養(yǎng)成帶數(shù)據(jù)集版本的習(xí)慣比如corn_leaf_v3_rust_ap087.pt三個(gè)月后回來(lái)找模型時(shí)你不會(huì)記得final_final_2.pt是哪次實(shí)驗(yàn)的產(chǎn)物。希望這些細(xì)節(jié)能幫你少走幾天彎路。本文還有配套的精品資源點(diǎn)擊獲取