別PyTorch源碼包實(shí)戰(zhàn)解讀與避坑指南)
簡(jiǎn)介基于YOLOv4與PyTorch的人臉口罩識(shí)別項(xiàng)目面向計(jì)算機(jī)視覺(jué)方向的在校學(xué)生、科研人員及需要完成課程設(shè)計(jì)或畢業(yè)設(shè)計(jì)的開(kāi)發(fā)者旨在幫助快速掌握目標(biāo)檢測(cè)工程流程并直接用于口罩佩戴場(chǎng)景識(shí)別與演示。壓縮包共367個(gè)文件大小約9.31MB內(nèi)部包含可直接運(yùn)行的Python源碼、完整文檔、預(yù)訓(xùn)練模型與3段測(cè)試視頻文件類(lèi)型以XML標(biāo)注、py腳本、txt配置、jpg預(yù)覽圖和avi視頻為主另附sqlite數(shù)據(jù)庫(kù)與項(xiàng)目狀態(tài)記錄便于梳理數(shù)據(jù)標(biāo)簽、網(wǎng)絡(luò)結(jié)構(gòu)與推理日志。已有53人瀏覽學(xué)習(xí)。項(xiàng)目提供清晰的README引導(dǎo)代碼經(jīng)過(guò)測(cè)試可穩(wěn)定運(yùn)行既能直接用于課設(shè)、畢設(shè)答辯演示也能在此基礎(chǔ)上替換數(shù)據(jù)集、調(diào)整檢測(cè)類(lèi)別擴(kuò)展為人臉檢測(cè)、行人檢測(cè)等其他視覺(jué)任務(wù)具備較強(qiáng)的二次開(kāi)發(fā)與學(xué)習(xí)進(jìn)階價(jià)值。1. YOLOv4人臉口罩識(shí)別這份畢設(shè)級(jí)PyTorch源碼包能解決什么問(wèn)題人臉口罩識(shí)別是畢設(shè)和課設(shè)里的高頻選題數(shù)據(jù)集好找、模型不復(fù)雜、演示效果直觀。但很多同學(xué)拿到一個(gè)YOLOv4源碼包后卡在環(huán)境裝不上、視頻讀不出來(lái)、檢測(cè)框偏移這幾個(gè)地方最后把時(shí)間全耗在排錯(cuò)上。這份基于YOLOv4和PyTorch的Python源碼包把一條完整的口罩識(shí)別鏈路帶齊了——模型代碼、訓(xùn)練好的權(quán)重、測(cè)試圖mask.jpg、三段實(shí)測(cè)視頻output202212031534.avi這類(lèi)真實(shí)運(yùn)行記錄、以及結(jié)果圖result.jpg。它適合計(jì)算機(jī)相關(guān)專(zhuān)業(yè)學(xué)生直接跑通畢設(shè)流程也適合想快速上手YOLOv4推理的從業(yè)者當(dāng)參考骨架。我拆完的感受是它不是一個(gè)只能看不能跑的展示殼子而是一套能驗(yàn)證的完整鏈路——從視頻幀到檢測(cè)框再到標(biāo)注輸出每一步都有對(duì)應(yīng)文件可以對(duì)照檢查。接下來(lái)按項(xiàng)目結(jié)構(gòu)、環(huán)境搭建、核心代碼、踩坑記錄和改造方式逐層拆。2. 項(xiàng)目文件拆解與數(shù)據(jù)流向先看懂每個(gè)文件再動(dòng)手跑拿到壓縮包先別急著雙擊運(yùn)行。YOLOv4這個(gè)項(xiàng)目代碼量不小如果連哪些文件是核心、哪些是IDE自動(dòng)生成的都沒(méi)分清排錯(cuò)時(shí)會(huì)被無(wú)效信息干擾。我先帶你過(guò)一遍文件結(jié)構(gòu)再講數(shù)據(jù)是怎么從輸入流到輸出的。2.1 文件清單與用途核心文件、測(cè)試產(chǎn)物、環(huán)境痕跡要分開(kāi)看這個(gè)項(xiàng)目里的文件可以分三類(lèi)。第一類(lèi)是工程配置文件.gitignore管理版本控制時(shí)的忽略列表yolov4-pytorch-master.iml是IntelliJ IDEA的模塊描述VSWorkspaceState.json是VS Code的工作區(qū)狀態(tài)記錄。這三個(gè)都是開(kāi)發(fā)環(huán)境自動(dòng)生成的不影響推理邏輯刪掉也不影響運(yùn)行。唯一要注意的是如果你換IDE打開(kāi)項(xiàng)目.iml和VSWorkspaceState.json可能會(huì)被重新生成或忽略不用管它。第二類(lèi)是測(cè)試圖像和結(jié)果圖。mask.jpg是測(cè)試輸入圖內(nèi)容應(yīng)該是一張戴口罩的人臉照片result.jpg是推理結(jié)果圖模型檢測(cè)到口罩后會(huì)在圖上畫(huà)出邊界框和置信度標(biāo)簽。把這兩張圖放在一起對(duì)比就能最快確認(rèn)模型權(quán)重是否正?!绻鹠ask.jpg里戴口罩的區(qū)域被框住且置信度顯示在90%以上說(shuō)明模型工作正常如果框偏了或者沒(méi)有框說(shuō)明cfg配置或權(quán)重出了問(wèn)題。video_tmp.jpg是中間過(guò)程幀一般是抽幀調(diào)試用的臨時(shí)文件代表視頻流里某一幀被單獨(dú)保存下來(lái)做了處理可以理解為視頻檢測(cè)的靜態(tài)截圖。第三類(lèi)是核心演示素材也就是三個(gè)AVI視頻output202212031534.avi、output202212031535.avi、output202212041735.avi。從命名規(guī)則看20221203是日期1534是時(shí)分這套命名是典型的實(shí)測(cè)輸出記錄。視頻內(nèi)容應(yīng)該是攝像頭或現(xiàn)成視頻文件跑檢測(cè)后的結(jié)果連續(xù)幀上疊加了檢測(cè)框。這是整份資源里最有說(shuō)服力的部分——單張圖片可以修圖造假但連續(xù)視頻很難偽造你可以直接看到模型在多幀畫(huà)面上的穩(wěn)定性和漏檢率。2.2 README.md在項(xiàng)目里的角色與運(yùn)行入口README.md是這份資源里唯一的說(shuō)明文檔。下載后第一步一定是打開(kāi)它里面一般會(huì)寫(xiě)明環(huán)境依賴要求Python版本、PyTorch版本、OpenCV版本、模型文件位置、檢測(cè)腳本入口、以及權(quán)重文件的來(lái)源說(shuō)明。畢設(shè)項(xiàng)目通常還會(huì)附上訓(xùn)練集的來(lái)源和類(lèi)別定義——比如這個(gè)口罩識(shí)別模型訓(xùn)練時(shí)用的是兩類(lèi)佩戴口罩with_mask、未佩戴口罩without_mask還是三類(lèi)額外加一個(gè)口罩佩戴不規(guī)范face_with_mask_wrong?,F(xiàn)在的關(guān)鍵問(wèn)題是這份項(xiàng)目文件列表里沒(méi)有直接出現(xiàn).py文件和權(quán)重文件但這不等于沒(méi)有。YOLOv4的PyTorch實(shí)現(xiàn)一般需要cfg配置文件、weights權(quán)重文件和detect.py推理腳本。如果壓縮包解壓后找不到你要先檢查是不是在子目錄里比如yolov4-pytorch-master/文件夾內(nèi)這一步很多初學(xué)者直接忽略結(jié)果報(bào)錯(cuò)No module named models。如果確實(shí)沒(méi)有看README里有沒(méi)有寫(xiě)權(quán)重下載鏈接或者檢查.gitignore是不是把weights/目錄排除了。2.3 數(shù)據(jù)流向從mask.jpg到result.jpg再到AVI視頻的完整鏈路我把這個(gè)項(xiàng)目的數(shù)據(jù)流梳理成一條線方便你后續(xù)調(diào)參時(shí)定位問(wèn)題。整條鏈路是讀取輸入圖片或視頻幀→ letterbox預(yù)處理保持寬高比縮放并填充 → 歸一化到0到1區(qū)間 → 輸入Darknet53骨干網(wǎng)絡(luò)提取特征 → CSP結(jié)構(gòu)跨階段局部連接 → PANet做多尺度特征融合 → 三個(gè)YOLO Head分別輸出不同尺度的預(yù)測(cè)結(jié)果 → 解碼邊界框坐標(biāo) → 按置信度閾值過(guò)濾低分框 → NMS非極大值抑制去重 → 把檢測(cè)框坐標(biāo)還原到原圖坐標(biāo)系 → 在原圖上繪制矩形框和類(lèi)別標(biāo)簽 → 保存為result.jpg或?qū)懭胼敵鲆曨l。mask.jpg到result.jpg是單幀靜態(tài)驗(yàn)證鏈路適合在調(diào)試參數(shù)時(shí)反復(fù)跑三個(gè)AVI視頻是連續(xù)幀循環(huán)鏈路模型在每一幀上都走一遍完整流程。這里有個(gè)細(xì)節(jié)值得注意視頻檢測(cè)時(shí)如果遇到畫(huà)面里遠(yuǎn)處有人經(jīng)過(guò)小尺寸目標(biāo)檢測(cè)依賴的是YOLOv4的52×52大尺度特征圖這個(gè)特征圖感受野小、對(duì)小目標(biāo)敏感但也更容易把背景誤判成人臉?biāo)阅憧匆曨l輸出時(shí)會(huì)發(fā)現(xiàn)遠(yuǎn)處行人的檢測(cè)框抖動(dòng)得比近處明顯這是模型本身的特性不是bug。從項(xiàng)目正文的文件排列看三個(gè)AVI視頻體積不小說(shuō)明編碼格式大概率是MJPG或類(lèi)似格式這會(huì)影響OpenCV讀取時(shí)的兼容性具體坑位在第5章會(huì)展開(kāi)。接下來(lái)先把環(huán)境配起來(lái)這一步過(guò)了項(xiàng)目才能跑起來(lái)。3. 環(huán)境搭建與依賴裝法PyTorch版本、CUDA和OpenCV怎么配不翻車(chē)YOLOv4的PyTorch實(shí)現(xiàn)最核心的依賴就三樣PyTorch本體、OpenCV圖像視頻讀寫(xiě)、NumPy張量操作。這三樣版本配不對(duì)后面每一步都會(huì)出莫名其妙的問(wèn)題。比如PyTorch版本太老torchvision的transform接口對(duì)不上OpenCV版本太新某些YOLO代碼里用的舊API被移除直接拋AttributeError。我先給出一套我驗(yàn)證過(guò)的最穩(wěn)組合再講參數(shù)怎么調(diào)整。3.1 PyTorch安裝與CUDA匹配GPU和CPU兩條路怎么選YOLOv4推理對(duì)顯存要求不高以最常見(jiàn)的416×416輸入尺寸為例一張圖前向傳播的顯存占用大約1.2GB到1.8GB取決于batch size和是否開(kāi)啟梯度記錄。所以如果你的顯卡是GTX 1660及以上優(yōu)先裝CUDA版PyTorch跑視頻檢測(cè)能到30幀以上如果電腦只有核顯CPU版也能跑只是速度會(huì)掉到每秒3到5幀作為畢設(shè)演示夠用但流暢度差一些。PyTorch的安裝現(xiàn)在統(tǒng)一走pip或conda。以CUDA 11.8搭配PyTorch 2.0這個(gè)穩(wěn)定組合為例安裝命令如下pip install torch torchvision --index-url https://download.pytorch.org/whl/cu118如果機(jī)器上沒(méi)裝NVIDIA驅(qū)動(dòng)或者驅(qū)動(dòng)版本太老識(shí)別不了CUDA那你就直接用CPU版pip install torch torchvision --index-url https://download.pytorch.org/whl/cpu裝完之后立刻做一次驗(yàn)證確認(rèn)PyTorch能不能調(diào)用GPUpython -c import torch; print(torch.__version__); print(CUDA available:, torch.cuda.is_available())這段命令會(huì)輸出兩個(gè)信息。第一個(gè)是PyTorch版本號(hào)比如2.0.1cu118加號(hào)后面的cu118表示這個(gè)版本的PyTorch是用CUDA 11.8編譯的。第二個(gè)是torch.cuda.is_available()的返回值如果輸出True說(shuō)明GPU可用如果False說(shuō)明你的驅(qū)動(dòng)版本和PyTorch要求的CUDA版本不匹配或者壓根沒(méi)裝驅(qū)動(dòng)后面推理會(huì)自動(dòng)退回CPU但不會(huì)直接報(bào)錯(cuò)。這里有個(gè)常見(jiàn)的誤區(qū)不是驅(qū)動(dòng)版本越高越好。PyTorch的CUDA運(yùn)行時(shí)依賴驅(qū)動(dòng)層的兼容版本驅(qū)動(dòng)太新比如555版本配老PyTorch 1.7反而可能出現(xiàn)CUDA error: no kernel image is available for execution on the device這種報(bào)錯(cuò)就是驅(qū)動(dòng)新過(guò)頭了老PyTorch里的kernel不認(rèn)新GPU架構(gòu)。遇到這種情況要么升級(jí)PyTorch要么裝回和GPU架構(gòu)匹配的老驅(qū)動(dòng)二選一沒(méi)有第三條路。3.2 OpenCV和NumPy的安裝與驗(yàn)證OpenCV是這個(gè)項(xiàng)目里第二個(gè)容易翻車(chē)的依賴。推薦直接裝opencv-python不要圖省事裝opencv-contrib-python后者體積大而且經(jīng)常和某些YOLO工具函數(shù)沖突。安裝命令pip install opencv-python numpy裝完之后用一段短腳本驗(yàn)證圖像讀寫(xiě)和視頻解碼能不能用import cv2 import numpy as np # 讀取測(cè)試圖確認(rèn)基礎(chǔ)圖像IO正常 img cv2.imread(mask.jpg) print(image shape:, img.shape) # 輸出(H, W, 3) # 打開(kāi)視頻文件測(cè)試視頻解碼器是否可用 cap cv2.VideoCapture(output202212031535.avi) if not cap.isOpened(): print(視頻打開(kāi)失敗檢查路徑或解碼器) else: ret, frame cap.read() if ret: print(frame shape:, frame.shape) else: print(視頻文件無(wú)法解碼出第一幀) cap.release()img.shape輸出是三維元組第一個(gè)值是圖像高度第二個(gè)是寬度第三個(gè)是通道數(shù)3。如果mask.jpg讀取后shape是None說(shuō)明路徑不對(duì)或者圖像文件已損壞。VideoCapture如果isOpened返回False九成是文件路徑寫(xiě)錯(cuò)或者OpenCV編譯時(shí)沒(méi)帶FFmpeg組件如果isOpened是True但read返回False那問(wèn)題是視頻編碼格式不被OpenCV支持具體解法放在第5章。3.3 Python版本的選定與conda環(huán)境隔離建議Python版本建議固定在3.8或3.10。3.7太老部分新版本依賴庫(kù)沒(méi)有對(duì)應(yīng)wheel包3.11及以上跑老YOLOv4代碼時(shí)torch里某些API會(huì)報(bào)DeprecationWarning雖然多數(shù)情況下不影響運(yùn)行但碰到個(gè)別算子重寫(xiě)的版本直接跑崩也不奇怪。我用的是Anaconda做環(huán)境隔離這條路徑對(duì)畢設(shè)項(xiàng)目尤其重要——你電腦上可能還裝TensorFlow或者其他深度學(xué)習(xí)框架如果全部懟進(jìn)base環(huán)境版本沖突能把人逼瘋。建一個(gè)獨(dú)立環(huán)境再裝依賴conda create -n yolov4 python3.8 -y conda activate yolov4 pip install torch torchvision --index-url https://download.pytorch.org/whl/cu118 pip install opencv-python numpyconda create后面的-n yolov4是環(huán)境名python3.8指定版本-y跳過(guò)確認(rèn)提示。激活命令conda activate yolov4后終端前面會(huì)出現(xiàn)(yolov4)前綴這時(shí)候pip裝的所有包都只在這個(gè)環(huán)境里生效出了環(huán)境互不影響。環(huán)境隔離這件事我從第一次被依賴沖突搞到重裝系統(tǒng)后就開(kāi)始強(qiáng)制執(zhí)行后面再也沒(méi)翻過(guò)車(chē)。4. 核心推理代碼解讀模型加載、letterbox預(yù)處理與NMS參數(shù)怎么調(diào)環(huán)境配好后項(xiàng)目的核心是推理腳本。YOLOv4的PyTorch實(shí)現(xiàn)有很多個(gè)版本但主鏈路大體一致。這一章會(huì)把模型加載、圖像預(yù)處理、推理后處理三段代碼拆開(kāi)講讓你知道每個(gè)參數(shù)動(dòng)了之后會(huì)發(fā)生什么。4.1 模型加載與cfg配置文件的對(duì)應(yīng)關(guān)系YOLOv4在PyTorch里的模型定義一般分成兩套一套是自定義的Darknet類(lèi)讀取.cfg文件逐層構(gòu)建網(wǎng)絡(luò)另一套是直接import現(xiàn)成模塊。這套項(xiàng)目里大概率用的是自定義加載器。核心邏輯如下import torch from models import Darknet # cfg定義網(wǎng)絡(luò)結(jié)構(gòu)weights存放訓(xùn)練好的參數(shù) cfg_path cfg/yolov4-mask.cfg weights_path weights/yolov4-mask.weights model Darknet(cfg_path) model.load_weights(weights_path) model.eval() # 切換到推理模式關(guān)閉dropout和BN的batch統(tǒng)計(jì)Darknet(cfg_path)會(huì)逐行解析cfg文件里的[convolutional]、[route]、[shortcut]、[yolo]等層定義構(gòu)建出完整的CSPDarknet53骨干網(wǎng)絡(luò)加PANet特征融合結(jié)構(gòu)。load_weights把.weights文件里按層序排列的浮點(diǎn)參數(shù)填充到模型里。這里有一個(gè)非常關(guān)鍵的校驗(yàn)點(diǎn)cfg文件里每個(gè)[yolo]層的classes字段必須和weights訓(xùn)練時(shí)的類(lèi)別數(shù)一致。比如訓(xùn)練時(shí)用兩類(lèi)with_mask、without_maskcfg里classes2那推理腳本里的類(lèi)別標(biāo)簽列表也必須剛好兩個(gè)名字且順序要和訓(xùn)練一致。如果cfg寫(xiě)的類(lèi)別數(shù)和weights不匹配加載過(guò)程不會(huì)報(bào)錯(cuò)因?yàn)?weights文件按層數(shù)填充但最后輸出張量的第三維通道數(shù)會(huì)不一樣解析預(yù)測(cè)結(jié)果時(shí)維度對(duì)不上直接崩在view()操作上。4.2 letterbox預(yù)處理為什么不能直接resize口罩檢測(cè)輸入圖片前必須做letterbox處理也就是保持原始寬高比縮放短邊用灰色填充到目標(biāo)尺寸。直接粗暴resize到416×416會(huì)讓畫(huà)面里的臉變形拉伸模型訓(xùn)練時(shí)學(xué)的是正常比例的特征喂給它的圖變形了檢測(cè)框位置必然偏。這里給出一個(gè)標(biāo)準(zhǔn)letterbox實(shí)現(xiàn)的核心邏輯import cv2 import numpy as np def letterbox(img, new_shape(416, 416), color(114, 114, 114)): shape img.shape[:2] # 原始尺寸 (H, W) r min(new_shape[0] / shape[0], new_shape[1] / shape[1]) # r是縮放比例取寬高兩個(gè)方向較小的因子 # 保證整張圖等比縮放后完整落在目標(biāo)尺寸內(nèi) new_unpad int(round(shape[1] * r)), int(round(shape[0] * r)) # new_unpad是等比縮放后的寬高 # 計(jì)算需要填充的邊長(zhǎng) dw (new_shape[1] - new_unpad[0]) / 2 dh (new_shape[0] - new_unpad[1]) / 2 # 先等比縮放 if shape[::-1] ! new_unpad: img cv2.resize(img, new_unpad, interpolationcv2.INTER_LINEAR) # 再等分填充上下左右 top, bottom int(round(dh - 0.1)), int(round(dh 0.1)) left, right int(round(dw - 0.1)), int(round(dw 0.1)) img cv2.copyMakeBorder(img, top, bottom, left, right, cv2.BORDER_CONSTANT, valuecolor) return imgr是縮放比例取min值保證寬高都不超出目標(biāo)尺寸。dw和dh是填充像素?cái)?shù)除以2是因?yàn)樯舷潞妥笥腋魈畛湟话胱寖?nèi)容集中在圖像中心。cv2.copyMakeBorder的BORDER_CONSTANT模式用純色填充valuecolor默認(rèn)114是YOLOv4訓(xùn)練時(shí)的填充色。推理完成后模型輸出的框坐標(biāo)是letterbox處理后的坐標(biāo)系里的畫(huà)框前必須把坐標(biāo)還原到原始圖像坐標(biāo)系。這一步是檢測(cè)框偏移問(wèn)題的高發(fā)區(qū)常見(jiàn)的錯(cuò)誤是只除以縮放比例忘了減填充量。正確做法是def scale_coords(img1_shape, coords, img0_shape): gain min(img1_shape[0] / img0_shape[0], img1_shape[1] / img0_shape[1]) pad_x (img1_shape[1] - img0_shape[1] * gain) / 2 pad_y (img1_shape[0] - img0_shape[0] * gain) / 2 coords[:, [0, 2]] - pad_x # x方向減去水平填充 coords[:, [1, 3]] - pad_y # y方向減去垂直填充 coords[:, :4] / gain # 再除以縮放比還原到原圖坐標(biāo) return coordspad_x和pad_y就是letterbox里算出的dw和dh必須和預(yù)處理時(shí)完全一致。如果預(yù)處理改了輸入尺寸這里也要同步改兩個(gè)函數(shù)是成對(duì)出現(xiàn)的。coords[:, [0, 2]]是x1和x2坐標(biāo)coords[:, [1, 3]]是y1和y2坐標(biāo)先減pad再除gain順序不能反。4.3 推理循環(huán)與后處理置信度閾值和NMS怎么配合模型前向傳播輸出的是三個(gè)尺度的原始預(yù)測(cè)張量需要經(jīng)過(guò)解碼得到邊界框坐標(biāo)、置信度和類(lèi)別概率然后做合并和過(guò)濾器。這段是調(diào)參的核心地帶conf_thres 0.5 # 置信度閾值低于這個(gè)分?jǐn)?shù)的框直接丟棄 nms_thres 0.4 # NMS的IoU閾值重疊度超過(guò)這個(gè)值的框被合并 with torch.no_grad(): output model(images) # 三個(gè)尺度的輸出列表 # output經(jīng)過(guò)解碼后得到坐標(biāo)、置信度、類(lèi)別 boxes, scores, classes decode_output(output, conf_thres) # 用OpenCV的NMS實(shí)現(xiàn)做去重 indices cv2.dnn.NMSBoxes( boxes.tolist(), scores.tolist(), conf_thres, nms_thres )with torch.no_grad()是必須的。如果不加PyTorch會(huì)為每個(gè)前向傳播構(gòu)建計(jì)算圖保存梯度信息推理幾十幀后內(nèi)存直接爆炸視頻檢測(cè)跑到一半就OOM了。decode_output內(nèi)部會(huì)把三個(gè)尺度的預(yù)測(cè)框疊加然后按conf_thres過(guò)濾低于閾值的框。conf_thres和nms_thres這兩個(gè)參數(shù)是調(diào)優(yōu)的重頭戲。conf_thres控制檢出的數(shù)量和誤檢率調(diào)低到0.3能檢出更多目標(biāo)但背景里的非人臉區(qū)域也會(huì)被誤判成口罩誤檢框增多調(diào)高到0.7則相反遮擋嚴(yán)重或模糊的小目標(biāo)會(huì)被漏掉??谡肿R(shí)別場(chǎng)景建議從0.5起步根據(jù)測(cè)試視頻里漏檢和誤檢的比例再微調(diào)。nms_thres控制相鄰框的合并策略調(diào)高到0.6會(huì)讓重疊度高的框更容易合并適合人多的密集場(chǎng)景避免同一個(gè)人的臉被框兩次調(diào)低到0.3則保留更多獨(dú)立框適合單人或距離遠(yuǎn)的場(chǎng)景。這兩個(gè)參數(shù)沒(méi)有絕對(duì)最優(yōu)必須配合測(cè)試視頻反復(fù)跑幾輪才能找到平衡點(diǎn)。我的習(xí)慣是先固定nms_thres為0.4單獨(dú)調(diào)conf_thres確定conf再調(diào)nms避免兩個(gè)參數(shù)同時(shí)動(dòng)導(dǎo)致無(wú)法判斷是誰(shuí)的影響。5. 避坑指南口罩識(shí)別項(xiàng)目運(yùn)行中的五個(gè)高頻問(wèn)題與修復(fù)路徑這一章直接給結(jié)論。下面五條都是我在實(shí)際跑YOLOv4口罩識(shí)別項(xiàng)目時(shí)真碰到過(guò)的坑按復(fù)現(xiàn)頻率排序每一條都按現(xiàn)象→原因→解決的路子來(lái)寫(xiě)可以直接抄作業(yè)。5.1 AttributeError: Darknet object has no attribute load_weights現(xiàn)象運(yùn)行推理腳本第一行模型加載就報(bào)錯(cuò)提示Darknet類(lèi)沒(méi)有l(wèi)oad_weights這個(gè)屬性。原因YOLOv4的PyTorch實(shí)現(xiàn)版本太多了不同版本的權(quán)重加載方法名不統(tǒng)一。有的叫l(wèi)oad_weights有的叫l(wèi)oad_darknet_weights還有的直接用load_state_dict從.pth文件讀取。你的腳本調(diào)用方式和模型類(lèi)定義對(duì)不上。解決打開(kāi)模型定義文件一般是models.py或darknet.py用CtrlF搜一下實(shí)際有哪些加載方法。如果是load_darknet_weights改腳本調(diào)用名如果只有l(wèi)oad_state_dict說(shuō)明需要先把.weights文件轉(zhuǎn)成.pth格式或者找到項(xiàng)目里自帶的轉(zhuǎn)換腳本。畢設(shè)項(xiàng)目一般會(huì)附帶轉(zhuǎn)換工具檢查README里有沒(méi)有說(shuō)明。5.2 視頻文件讀出來(lái)是黑屏或read失敗現(xiàn)象cv2.VideoCapture打開(kāi)output*.avi時(shí)isOpened()返回True但read()拿不到有效幀要么返回False要么frame是全黑圖。原因OpenCV的FFmpeg后端對(duì)MJPG編碼的AVI支持有時(shí)會(huì)有問(wèn)題尤其在Windows平臺(tái)下默認(rèn)安裝的opencv-python可能缺少部分解碼組件。項(xiàng)目輸出視頻如果用的是MJPG編碼剛好踩中這個(gè)兼容性盲區(qū)。解決兩個(gè)方案。第一個(gè)是換用opencv-python-headless版本它去掉了GUI模塊但視頻編解碼組件更完整pip uninstall opencv-python pip install opencv-python-headless第二個(gè)是用ffmpeg命令行先把AVI轉(zhuǎn)成MP4的H.264編碼再讓OpenCV讀新文件ffmpeg -i output202212031535.avi -vcodec libx264 -crf 23 output202212031535.mp4-crf 23是質(zhì)量參數(shù)數(shù)值越小畫(huà)質(zhì)越高23是默認(rèn)值轉(zhuǎn)出來(lái)的文件大小和質(zhì)量都均衡。轉(zhuǎn)完后把腳本里的路徑改成.mp4后綴即可。5.3 模型加載成功但推理結(jié)果全是空框現(xiàn)象腳本能跑通視頻窗口也彈出來(lái)了但畫(huà)面里沒(méi)有任何檢測(cè)框或者框的置信度全部低于顯示閾值。原因九成是conf_thres設(shè)太高。模型訓(xùn)練時(shí)如果數(shù)據(jù)里有大量遠(yuǎn)距離小人臉這些目標(biāo)的置信度天然就低0.5的閾值會(huì)把它們?nèi)繛V掉。還有一成可能是預(yù)處理時(shí)letterbox的填充尺寸和推理腳本里設(shè)置的輸入尺寸不一致。解決先把conf_thres降到0.1跑一輪視頻確認(rèn)能出框再慢慢往上調(diào)。如果0.1都不出框檢查letterbox函數(shù)里的new_shape參數(shù)是不是和模型cfg里定義的width、height一致。cfg網(wǎng)絡(luò)結(jié)構(gòu)里第一層[net]的width416, height416如果代碼里用了608但cfg寫(xiě)的是416雖然PyTorch不會(huì)報(bào)錯(cuò)卷積層能處理任意輸入尺寸但權(quán)重是按416訓(xùn)練的特征響應(yīng)結(jié)果完全不可用。5.4 GPU顯存OOMCUDA out of memory現(xiàn)象跑視頻推理到第幾十幀時(shí)終端報(bào)CUDA out of memory進(jìn)程直接退出。原因最常見(jiàn)的是輸入尺寸被調(diào)到608×608或更高顯存占用成倍上漲。另一個(gè)隱蔽原因是推理循環(huán)里忘了加torch.no_grad()每幀都在構(gòu)建計(jì)算圖幾十幀后累計(jì)顯存爆掉。解決把輸入尺寸固定為416×416這是YOLOv4官方推薦的速度精度平衡點(diǎn)。另外在推理循環(huán)外側(cè)加with torch.no_grad():把前向傳播包進(jìn)去這一步能立即釋放掉梯度圖占用的顯存。如果還爆把項(xiàng)目默認(rèn)的batch_size改為1不要用訓(xùn)練時(shí)的批量設(shè)置。5.5 檢測(cè)框整體偏移位置偏左上或偏右下現(xiàn)象result.jpg里檢測(cè)框能框住目標(biāo)但框的位置整體向左上或右下偏移偏移量固定戴口罩的嘴部區(qū)域不在框中心。原因坐標(biāo)還原時(shí)漏了letterbox的填充量補(bǔ)償。模型輸出的是縮放填充后圖像坐標(biāo)系里的坐標(biāo)畫(huà)框前沒(méi)調(diào)用scale_coords函數(shù)或者調(diào)用時(shí)傳的輸入尺寸參數(shù)和預(yù)處理時(shí)不一致。解決檢查推理腳本里畫(huà)框前的坐標(biāo)轉(zhuǎn)換部分。用4.2小節(jié)里的scale_coords函數(shù)第一個(gè)參數(shù)傳預(yù)處理后的圖像尺寸比如416, 416第二個(gè)傳模型輸出的坐標(biāo)張量第三個(gè)傳原始圖像尺寸比如frame.shape[:2]。關(guān)鍵是預(yù)處理時(shí)的dw、dh必須和scale_coords里算出來(lái)的一致兩個(gè)函數(shù)成對(duì)使用不要拆分。5.6 教訓(xùn)總結(jié)與檢查習(xí)慣這五個(gè)坑看起來(lái)分散但根子是同一個(gè)YOLOv4項(xiàng)目版本雜亂代碼風(fēng)格不統(tǒng)一換個(gè)環(huán)境編譯就可能觸發(fā)不同的兼容性問(wèn)題。我的習(xí)慣是拿到任何YOLOv4源碼包先花十分鐘做三件事檢查cfg里的classes數(shù)、確認(rèn)推理腳本調(diào)用的方法名和模型定義一致、用單張圖片跑通靜態(tài)推理再上視頻。這三步走完上面五個(gè)坑能擋住四個(gè)。從那以后我每次拿到新的YOLO項(xiàng)目都強(qiáng)制走一遍這個(gè)檢查流程再開(kāi)始調(diào)參。6. 把靜態(tài)視頻改成攝像頭實(shí)時(shí)檢測(cè)一個(gè)讓畢設(shè)效果翻倍的改造技巧項(xiàng)目默認(rèn)輸入是AVI視頻文件但如果答辯現(xiàn)場(chǎng)要展示攝像頭實(shí)時(shí)檢測(cè)的沖擊力遠(yuǎn)比播放錄好的視頻強(qiáng)得多。改造思路不復(fù)雜核心是替換數(shù)據(jù)源、調(diào)整參數(shù)、優(yōu)化延遲三步。攝像頭實(shí)時(shí)檢測(cè)的代碼改動(dòng)集中在cv2.VideoCapture的入?yún)⑸?。視頻文件傳路徑字符串?dāng)z像頭傳設(shè)備索引號(hào)0代表默認(rèn)攝像頭。但這里藏著一個(gè)容易忽略的坑視頻文件幀率固定而攝像頭幀率取決于環(huán)境光線和驅(qū)動(dòng)推理速度跟不上時(shí)畫(huà)面會(huì)卡頓。所以實(shí)時(shí)模式下有三處參數(shù)要調(diào)輸入尺寸從416降到320或更低、conf_thres從0.5降到0.35左右、分辨率設(shè)置到640×480而不是默認(rèn)的1920×1080。import cv2 import torch from models import Darknet # 加載模型cfg和weights路徑保持不變 model Darknet(cfg/yolov4-mask.cfg) model.load_weights(weights/yolov4-mask.weights) model.eval() # 關(guān)鍵改動(dòng)入?yún)奈募窂綋Q成設(shè)備索引號(hào) cap cv2.VideoCapture(0) cap.set(cv2.CAP_PROP_FRAME_WIDTH, 640) cap.set(cv2.CAP_PROP_FRAME_HEIGHT, 480) while True: ret, frame cap.read() if not ret: break # 單幀預(yù)處理輸入尺寸降到320提升速度 img letterbox(frame, new_shape(320, 320)) tensor torch.from_numpy(img).permute(2, 0, 1).unsqueeze(0).float() / 255.0 # 推理循環(huán)必須包在no_grad里否則顯存會(huì)持續(xù)累積 with torch.no_grad(): output model(tensor) boxes, scores, classes decode_output(output, conf_thres0.35) # 畫(huà)框并顯示 frame draw_boxes(frame, boxes, scores, classes) cv2.imshow(mask detection, frame) # waitKey的1毫秒是刷新窗口的關(guān)鍵 if cv2.waitKey(1) 0xFF ord(q): break cap.release() cv2.destroyAllWindows()cap.set(cv2.CAP_PROP_FRAME_WIDTH, 640)把采集分辨率降到640×480這臺(tái)下編碼壓力和攝像頭曝光時(shí)間低配筆記本也能流暢跑。permute(2, 0, 1)把OpenCV的HWC通道順序轉(zhuǎn)成PyTorch的CHWunsqueeze(0)增加batch維度除以255.0做歸一化——這三步順序不能錯(cuò)漏了permute會(huì)出現(xiàn)通道錯(cuò)亂檢測(cè)出來(lái)的框完全隨機(jī)。waitKey(1)里的那個(gè)1毫秒是刷新窗口的關(guān)鍵設(shè)成0會(huì)阻塞等待按鍵視頻流就卡死假死了設(shè)成10或更大則畫(huà)面延遲明顯建議維持1。如果跑起來(lái)后畫(huà)面延遲明顯優(yōu)先懷疑是OpenCV讀幀和推理串行導(dǎo)致的總耗時(shí)超過(guò)幀間隔。一個(gè)優(yōu)化技巧是把幀讀取和推理拆開(kāi)循環(huán)體里先cap.read()下一幀同時(shí)對(duì)上一幀做推理。這樣推理耗時(shí)被幀采集時(shí)間掩蓋視覺(jué)上流暢度提升不少。另外筆記本攝像頭在OpenCV里打不開(kāi)多半是設(shè)備被微信或?yàn)g覽器占用關(guān)閉這些應(yīng)用的攝像頭權(quán)限再重試即可。驗(yàn)證這套改造是否成功看兩點(diǎn)一是畫(huà)面窗口能否正常彈出并實(shí)時(shí)顯示二是戴口罩的人經(jīng)過(guò)鏡頭時(shí)檢測(cè)框的延遲是否在一幀以內(nèi)。如果框的延遲明顯超過(guò)一幀把輸入尺寸從416降到320速度提升立竿見(jiàn)影而對(duì)口罩識(shí)別這種類(lèi)別特征明顯的任務(wù)精度損失幾乎無(wú)感。這個(gè)320輸入的小技巧是我在多個(gè)YOLO項(xiàng)目里反復(fù)驗(yàn)證過(guò)的從那以后我每次跑實(shí)時(shí)檢測(cè)都強(qiáng)制把分辨率、推理尺寸和置信度三項(xiàng)參數(shù)過(guò)一遍再開(kāi)始調(diào)別的玄學(xué)參數(shù)。希望幫到你。本文還有配套的精品資源點(diǎn)擊獲取