
簡介面向Python與OpenCV開發(fā)者的手勢識別實戰(zhàn)資料基于GitHub開源項目改進(jìn)后支持手指指尖檢測并能在Windows平臺通過手指數(shù)目模擬鍵盤按鍵實現(xiàn)簡單的免觸控交互。整個資源為1個PDF文件僅233KB內(nèi)容以完整源碼為主干配有逐段中文注釋并給出環(huán)境說明Python3.6OpenCV3.4.0與核心參數(shù)的含義及可調(diào)范圍代碼覆蓋背景減除、高斯模糊、二值化、輪廓提取、凸包繪制、指尖定位與計數(shù)、模擬按鍵等關(guān)鍵環(huán)節(jié)從攝像頭讀取到輸出控制一應(yīng)俱全很適合初次接觸手勢識別或希望快速跑通Demo的學(xué)習(xí)者。已有1992人學(xué)習(xí)閱讀時既可以按代碼順序跟蹤處理流程也可以把指尖檢測部分移植到自己的項目中二次開發(fā)或在此基礎(chǔ)上調(diào)整閾值、修改按鍵映射以適配不同場景。1. 手勢識別這可能是你最快跑通的指尖檢測方案用 Python 做手勢識別很多人第一反應(yīng)是上 MediaPipe 或深度學(xué)習(xí)模型但如果你只需要在 Windows 下通過手指數(shù)目觸發(fā)鍵盤操作OpenCV 的經(jīng)典方案反而更直接不需要訓(xùn)練、不需要 GPU、單個 Python 文件就能跑。本文要拆的這個項目來自 GitHub 上的 Fingers-Detection-using-OpenCV-and-Python原作者實現(xiàn)了基于背景減除的指尖檢測我在此基礎(chǔ)上補充了指尖坐標(biāo)過濾邏輯和 win32api 鍵盤模擬讓整個程序可以在 Windows 下用 2 根手指、3 根手指去觸發(fā)按鍵。這個方案的核心思路不是靠膚色檢測而是靠背景減除先讓攝像頭記住一幀沒有手的背景然后把每一幀畫面和背景做差分前景就是你的手。整個過程只依賴 OpenCV 的圖像處理函數(shù)和 numpy 運算原理透明、參數(shù)可調(diào)非常適合作為手勢識別入門項目來復(fù)現(xiàn)。適合的人群很明確想理解 OpenCV 輪廓分析和凸包原理的人、需要在本地用攝像頭做交互控制的人、以及不想引入大模型依賴的嵌入式或桌面端開發(fā)者。2. 從背景建模到二值化先把「手」從畫面里摳出來2.1 為什么選 MOG2 而不是膚色檢測這個項目最關(guān)鍵的一步是cv2.createBackgroundSubtractorMOG2。我去查了原項目的設(shè)計意圖作者選它而不是膚色檢測是因為膚色模型對光線和白平衡極其敏感同一個人的手在暖光燈和 LED 燈下 YCrCb 范圍的分布完全不同膚色閾值調(diào)一次換一個環(huán)境就失效。而背景減除不關(guān)心你手是什么顏色只關(guān)心畫面里什么東西動了、什么東西沒動。MOG2 的全稱是 Mixture of Gaussians v2OpenCV 內(nèi)置的自適應(yīng)混合高斯背景建模。它的工作方式是對每個像素建立多個高斯分布一個像素如果長期保持相近的灰度值就被歸入背景模型一旦某個像素的灰度值和背景模型差異超過閾值就被判定為前景。createBackgroundSubtractorMOG2(history, varThreshold, detectShadows)的三個參數(shù)中history 決定用多少幀來訓(xùn)練背景模型varThreshold 決定判定前景的方差閾值detectShadows 用于是否檢測陰影。bgModel cv2.createBackgroundSubtractorMOG2(0, bgSubThreshold)這段代碼里 history 傳了 0表示使用默認(rèn)的 200 幀bgSubThreshold的值是 50表示像素值和背景模型的馬氏距離超過 50 就認(rèn)為是前景。注意 MOG2 的默認(rèn)參數(shù)對陰影檢測是開啟的原項目沒有單獨處理陰影這在實際運行中會導(dǎo)致手部邊緣出現(xiàn)灰黑色的噪點塊。我一般會把 detectShadows 顯式設(shè)為 False減少后續(xù)輪廓提取的干擾bgModel cv2.createBackgroundSubtractorMOG2(history500, varThresholdbgSubThreshold, detectShadowsFalse)history 從 0 改成 500目的是讓背景模型在窗口移動、窗簾飄動時更穩(wěn)定。如果你的攝像頭固定不動這個值可以更大如果攝像頭是手持的建議降到 100 以下否則背景模型更新太慢手的殘影會殘留在前景里。2.2 removeBG 里的腐蝕操作到底在干什么removeBG函數(shù)是整條處理鏈的入口它做的事情不止是前景提取還加了一次腐蝕def removeBG(frame): fgmask bgModel.apply(frame, learningRatelearningRate) kernel np.ones((3, 3), np.uint8) fgmask cv2.erode(fgmask, kernel, iterations1) res cv2.bitwise_and(frame, frame, maskfgmask) return resbgModel.apply返回的是一張單通道掩膜白色區(qū)域代表前景黑色代表背景。直接用這張掩膜去截原圖你會看到手的邊緣有一圈毛刺——這是攝像頭噪聲和背景模型邊緣像素誤判造成的。腐蝕的作用就是把這些毛刺削掉kernel 是 3×3 的全 1 矩陣iterations1 表示執(zhí)行一次腐蝕效果是讓白色區(qū)域的邊界向內(nèi)收縮 1 個像素。代價是手指尖也會變細(xì)一圈對于指尖檢測來說這反而有利于減少后續(xù)輪廓的鋸齒。learningRate傳的是 0這個參數(shù)另有含義。MOG2 的 apply 方法里learningRate 為負(fù)數(shù)默認(rèn) -1表示自動更新背景模型傳 0 表示這一幀完全不更新背景。原項目里學(xué)習(xí)率恒為 0意味著背景模型只在按 b 鍵那一刻被初始化之后永遠(yuǎn)不會學(xué)習(xí)新的背景變化。這在固定場景下是優(yōu)點——手不會慢慢被融入背景但你如果中途移開攝像頭或者背景里多了個物體前景就會一直存在直到按 r 重置。2.3 雙邊濾波和高斯模糊的分工一個保邊一個降噪預(yù)處理階段有兩個容易搞混的濾波開頭對原始幀做的是cv2.bilateralFilter對前景掩膜做的是cv2.GaussianBlur。前者是雙邊濾波它的特點是同時考慮像素的空間距離和灰度差異所以在平滑噪聲的同時能保留邊緣。用在原始幀上是為了讓背景建模時像素的灰度分布更穩(wěn)定避免傳感器噪點導(dǎo)致背景模型誤判。frame cv2.bilateralFilter(frame, 5, 50, 100)參數(shù)依次是 d5、sigmaColor50、sigmaSpace100。d 是濾波窗口直徑5 意味著考慮每個像素周圍 5×5 的鄰域sigmaColor 越大灰度差異大的像素越容易被一起平滑邊緣保留能力越弱sigmaSpace 越大遠(yuǎn)處像素對當(dāng)前像素的影響越大。我實測下來這三個參數(shù)在 640×480 的攝像頭畫面上表現(xiàn)不錯但如果你用的是 1080p 畫面d 要適當(dāng)加大到 7否則平滑效果不足。高斯模糊則用在灰度圖上目的是消除二值化時產(chǎn)生的椒鹽噪聲blur cv2.GaussianBlur(gray, (blurValue, blurValue), 0)blurValue設(shè)為 41這是一個偏大的核。41×41 的高斯核意味著每個輸出像素是周圍 41×41 范圍內(nèi)像素的加權(quán)平均對輪廓的平滑作用很明顯代價是丟失細(xì)小的凸起。如果手指很細(xì)或者攝像頭距離手較遠(yuǎn)可以考慮把 blurValue 降到 21否則指尖可能被高斯模糊抹平導(dǎo)致后面距離法找不準(zhǔn)最遠(yuǎn)點。2.4 閾值滑塊的正確姿勢先調(diào)亮度再調(diào)閾值程序啟動時會創(chuàng)建一個名為 trackbar 的窗口里面放了一個 threshold 滑條范圍 0 到 100。這里的閾值是二值化的分界線灰度圖上像素值大于 threshold 的變成 255白小于的變成 0黑。cv2.createTrackbar(threshold, trackbar, threshold, 100, printThreshold)中初始值 threshold 是全局變量 60回調(diào)函數(shù) printThreshold 只是把當(dāng)前閾值打印出來。實際操作時我建議按這個順序校準(zhǔn)先按 b 捕獲背景然后對手放在攝像頭前觀察 binary 窗口如果手是黑色、背景是白色說明閾值反了需要把閾值調(diào)低如果手上有大片空洞說明閾值太高背景的灰度值也被算進(jìn)了前景。有個細(xì)節(jié)值得注意cap_region_x_begin 0.5和cap_region_y_end 0.8限定了感興趣區(qū)域。程序只在畫面右半部分、從上往下 80% 高度的區(qū)域內(nèi)做手勢檢測畫面上用紅色矩形標(biāo)出了這個區(qū)域。這個設(shè)計是有意的——大多數(shù)人的操作習(xí)慣是右手放在攝像頭右側(cè)左手操作鍵盤所以只檢測右側(cè)區(qū)域能減少誤判。如果你習(xí)慣左手手勢把cap_region_x_begin改成 0.0 并調(diào)整矩形框繪制邏輯就行。3. 指尖檢測輪廓、凸包和距離法的三角關(guān)系3.1 從二值圖到輪廓findContours 的坑從版本開始二值化之后thresh是一張黑白圖白色區(qū)域就是手。接下來要找到手的輪廓OpenCV 提供了findContours。這里有一個版本差異的坑在文末的補充里明確寫了OpenCV 3.x 時代返回三個值OpenCV 4.0 之后返回兩個值。thresh1 copy.deepcopy(thresh) _, contours, hierarchy cv2.findContours(thresh1, cv2.RETR_TREE, cv2.CHAIN_APPROX_SIMPLE)第一版代碼針對的是 OpenCV 3.4.0所以用了三個返回值。copy.deepcopy(thresh)很關(guān)鍵——findContours會直接修改輸入圖像如果不拷貝后續(xù)想再顯示二值化結(jié)果就會拿到一張被破壞的圖。cv2.RETR_TREE表示建立輪廓的層級樹cv2.CHAIN_APPROX_SIMPLE則用最少的點來編碼輪廓只保留端點。如果你裝的是 OpenCV 4.x直接跑這段會報錯說解包的值太多解決方式很簡單contours, hierarchy cv2.findContours(thresh1, cv2.RETR_TREE, cv2.CHAIN_APPROX_SIMPLE)我自己的經(jīng)驗是與其改代碼不如在同一條處理鏈里做版本兼容cnt_info cv2.findContours(thresh1, cv2.RETR_TREE, cv2.CHAIN_APPROX_SIMPLE) if len(cnt_info) 3: _, contours, hierarchy cnt_info else: contours, hierarchy cnt_info這樣無論隊友用的是 3.4 還是 4.5代碼都不會炸。3.2 為什么只取最大輪廓凸包檢測的數(shù)學(xué)基礎(chǔ)輪廓可能有多個比如手旁邊放了杯水、或者背景減除沒做干凈留下了一塊噪點。項目里用面積法篩掉小輪廓length len(contours) maxArea -1 if length 0: for i in range(length): temp contours[i] area cv2.contourArea(temp) if area maxArea: maxArea area ci i res contours[ci]cv2.contourArea計算的是輪廓包圍的面積不是像素點數(shù)因為輪廓是折線直接數(shù)點數(shù)會低估面積。取最大輪廓后下一步是計算凸包hull cv2.convexHull(res)凸包是包含輪廓所有點的最小凸多邊形。指尖檢測依賴凸包的原因是手指伸出來時指尖是輪廓上離手心最遠(yuǎn)的點同時也是凸包的頂點。非凸的凹點比如指縫不可能是凸包頂點所以凸包可以直接過濾掉指縫形成的干擾點。cv2.drawContours(drawing, [hull], 0, (0, 0, 255), 3)用紅色畫凸包綠色畫原始輪廓調(diào)試時一眼就能看出凸包是否貼合手指外形。3.3 重心距離法找指尖為什么不用凸包缺陷算出凸包之后主流的指尖檢測思路有兩種一種是基于凸包缺陷convexity defects通過尋找輪廓上凹陷最深處的點來推斷指縫位置再反推指尖另一種是本文采用的距離法直接找輪廓上離重心最遠(yuǎn)的點。原作者選擇了后者代碼里先算輪廓的矩moments cv2.moments(res) center (int(moments[m10] / moments[m00]), int(moments[m01] / moments[m00]))這里用零階矩 m00 歸一化一階矩 m10 和 m01得到的是輪廓質(zhì)心。在手勢識別中質(zhì)心和重心的差異可以忽略用矩計算是最穩(wěn)的因為它對輪廓形狀不敏感。指尖檢測的核心邏輯是遍歷輪廓上的每個點計算它到重心的距離平方fingerRes [] max 0; count 0; notice 0; cnt 0 for i in range(len(res)): temp res[i] dist (temp[0][0] - center[0])**2 (temp[0][1] - center[1])**2 if dist max: max dist notice i if dist ! max: count count 1 if count 40: count 0 max 0這段代碼初看有點繞。它不是在找全局最遠(yuǎn)點而是在找「局部最遠(yuǎn)點」每當(dāng) dist 超過當(dāng)前最大值就更新 notice當(dāng) dist 不再是最大值且持續(xù)了 40 個點以上說明當(dāng)前這個最遠(yuǎn)點是一個獨立的凸起把它記下來然后重置 max繼續(xù)找下一個凸起。count 40 是防止噪聲造成的假峰值被當(dāng)作指尖——如果只是少數(shù)幾個點突然變遠(yuǎn)count 還沒到 40 就被重置了。為什么用距離平方而不是實際距離因為math.sqrt是浮點運算在 Python 的循環(huán)里對每個輪廓點都開根號一幀幾十毫秒的延遲就是從這里來的。距離平方的單調(diào)性和距離一致不影響最值比較但省掉了大量開方運算。這是原項目里很實惠的優(yōu)化。3.4 指尖過濾的兩道閘門低于手心不算、靠太近不算找到局部最遠(yuǎn)點之后還有兩道過濾這是原項目里容易被人忽略但實戰(zhàn)價值最高的部分。第一道是高度過濾if center[1] res[notice][0][1]: continuecenter[1]是重心的 y 坐標(biāo)res[notice][0][1]是候選點的 y 坐標(biāo)。圖像坐標(biāo)系里 y 向下增大所以center[1] 候選點 y意味著候選點比重心更低。如果它比手心還低那大概率是小臂或者手腕的邊緣凸起不是手指。這個假設(shè)在手掌朝下、手指向前伸的手勢下成立但如果你做的是手掌朝上的手勢指尖會比重心低這一條會把所有指尖都過濾掉。用這個項目時手勢固定成掌心朝下會更穩(wěn)。第二道是距離過濾for j in range(len(fingerRes)): if abs(res[notice][0][0] - fingerRes[j][0]) 20: flag True break這是檢查候選點和已確認(rèn)的指尖在 x 坐標(biāo)上是否太近。x 坐標(biāo)差小于 20 像素視為同一個手指的重復(fù)檢測。注意這里只比了 x 坐標(biāo)沒比 y 坐標(biāo)——因為手指豎直伸出時同一個手指的輪廓點分布在同一 x 區(qū)間內(nèi)的不同高度x 是最有區(qū)分度的維度。如果攝像頭是橫著放的這個判斷會失效你需要改成同時比較 x 和 y或者干脆算兩點歐氏距離。20 這個閾值對應(yīng)的是 640×480 畫面下正常手指寬度的像素量。攝像頭分辨率更高時這個值要等比放大比如 1280×720 畫面下建議調(diào)到 40。4. 從指尖到手指數(shù)鍵盤模擬與控制邏輯4.1 win32api 模擬按鍵空格鍵的按下與釋放指尖檢測完成后cnt 就是當(dāng)前幀識別到的手指數(shù)。原項目把它用來控制空格鍵win32api.keybd_event(32, 0, 0, 0) win32api.keybd_event(32, 0, win32con.KEYEVENTF_KEYUP, 0)keybd_event的第一個參數(shù)是虛擬鍵碼32 對應(yīng)空格第二個參數(shù)是掃描碼0 表示不指定第三個參數(shù)是標(biāo)志位0 表示按下win32con.KEYEVENTF_KEYUP表示釋放。這里有個容易踩的坑按下和釋放之間沒有延時很多程序檢測不到這么快的擊鍵。我一般會在兩次調(diào)用之間加一個time.sleep(0.05)模擬真實按鍵的持續(xù)時間import time win32api.keybd_event(32, 0, 0, 0) time.sleep(0.05) win32api.keybd_event(32, 0, win32con.KEYEVENTF_KEYUP, 0)還有一個問題是連續(xù)觸發(fā)。只要手勢保持 3 根手指每幀都會觸發(fā)一次按鍵一秒鐘 30 幀就是 30 次空格。原項目沒有做防抖。實際使用時我會引入一個冷卻時間last_trigger_time 0 if triggerSwitch is True and cnt 3: current_time time.time() if current_time - last_trigger_time 0.5: win32api.keybd_event(32, 0, 0, 0) time.sleep(0.05) win32api.keybd_event(32, 0, win32con.KEYEVENTF_KEYUP, 0) last_trigger_time current_time這樣做的好處是想觸發(fā)翻頁就快速比個 3然后放下不用一直舉著手。0.5 秒的冷卻時間不會讓操作變得遲鈍但能擋住 90% 的誤觸。4.2 三種模式的狀態(tài)機(jī)b 捕獲、r 重置、n 開啟程序的交互邏輯通過鍵盤事件切換狀態(tài)核心是一個布爾變量isBgCaptured和triggerSwitch。初始狀態(tài)下isBgCaptured為 0程序只做畫面顯示不做任何手勢檢測按下 b 鍵背景模型建立isBgCaptured變?yōu)?1開始檢測指尖按下 r 鍵背景模型置空回到初始狀態(tài)按下 n 鍵triggerSwitch變?yōu)?True此時檢測到的手指數(shù)目才會觸發(fā)鍵盤事件。k cv2.waitKey(10) if k 27: break elif k ord(b): bgModel cv2.createBackgroundSubtractorMOG2(0, bgSubThreshold) isBgCaptured 1 elif k ord(r): bgModel None triggerSwitch False isBgCaptured 0 elif k ord(n): triggerSwitch True注意cv2.waitKey(10)的返回值。它每 10 毫秒讀取一次鍵盤輸入返回的是按鍵的 ASCII 碼。ord(b)取 b 的 ASCII 碼這樣比較的是數(shù)字而非字符避免編碼問題。還有一個隱藏細(xì)節(jié)cv2.waitKey只有在當(dāng)前窗口獲得焦點時才能收到按鍵所以你必須先點擊 OpenCV 彈出的任一窗口再按這些快捷鍵。這套狀態(tài)機(jī)的設(shè)計思路值得借鑒把「建?!购汀赣|發(fā)」分成兩個開關(guān)避免攝像頭剛啟動背景還沒建模就誤觸發(fā)鍵盤。如果你想加一個暫停功能可以在 n 與 r 之間加一個 p 鍵把triggerSwitch設(shè)回 False這樣就不用重置背景了。4.3 打印的真實作用它是指尖檢測的調(diào)試工具代碼里在每幀檢測完指尖后有一行print(cnt)很多人以為只是單純的手指數(shù)輸出。在實際調(diào)試中這行打印的意義遠(yuǎn)不止于此當(dāng)你把程序連接到其他軟件比如游戲、PPT之前先通過終端觀察 cnt 是否穩(wěn)定可以快速判斷是檢測算法的問題還是鍵盤模擬的問題。我會把它擴(kuò)展成更完整的調(diào)試輸出print(fframe: {frame_id}, fingers: {cnt}, centers: {center})幀號和重心坐標(biāo)一起輸出能幫你判斷指尖檢測是不是發(fā)生了跳變。跳變的特征是相鄰兩幀手指數(shù)從 2 變成 4 又變成 2而你的手根本沒動——這種情況八成是距離法的 count 40 閾值太小或者高斯模糊核不夠大。不要開著攝像頭去猜終端輸出的數(shù)字是最誠實的反饋。5. 避坑指南OpenCV 版本、光照和誤觸這三座大山5.1 坑一OpenCV 4.0 后 findContours 返回值變化現(xiàn)象運行程序直接報錯提示not enough values to unpack (expected 3, got 2)。原因OpenCV 4.0 調(diào)整了findContours的接口舊版本返回(image, contours, hierarchy)三個值新版本只返回(contours, hierarchy)兩個值。項目源代碼按 OpenCV 3.4.0 寫的三個返回值在 4.x 下必然崩。解決兩個方案任選。方案一是降級 OpenCVpip install opencv-python3.4.0.14但要注意 3.4.0 與 Python 3.9 以上版本不兼容如果你是 Python 3.10 以上的環(huán)境這條路走不通。方案二更推薦把解包改成自動適配。cnt_result cv2.findContours(thresh1, cv2.RETR_TREE, cv2.CHAIN_APPROX_SIMPLE) contours cnt_result[0] if len(cnt_result) 2 else cnt_result[1] hierarchy cnt_result[1] if len(cnt_result) 2 else cnt_result[2]這段邏輯的含義是返回值長度是 2直接取第 0 個作為輪廓長度是 3說明是老版本輪廓在第 1 個位置。這樣寫的好處是你的代碼在 3.4 到 4.8 的所有版本都能跑。5.2 坑二光照一換手直接融進(jìn)背景現(xiàn)象白天在窗邊跑得好好的晚上把燈一關(guān)手在 binary 窗口里大面積變黑或者背景里出現(xiàn)大片白色噪點指尖數(shù)量亂跳。原因這個項目的背景模型是在按下 b 鍵那一刻固定的后續(xù)完全不更新。白天和晚上的光線色溫不同MOG2 建的模型是基于白天的灰度分布晚上燈光一變所有像素的灰度值整體偏移背景就和手一起變成了前景。光照突變時整個畫面的灰度分布都變了背景模型必然失配。解決三條路。第一固定你的環(huán)境拉窗簾、固定燈光讓背景灰度在運行期間盡量不變。第二把學(xué)習(xí)率從 0 改成-1讓 MOG2 自動更新背景模型——但這樣手靜止不動幾秒手也被融入背景指尖會消失需要你用動手機(jī)制來避免。第三啟動后重新按一下 r 再按 b重新建模。這個方法最直接但治標(biāo)不治本。我實際項目里是加了一個簡單的光照補償取畫面左上角固定區(qū)域的灰度均值如果與初始背景的灰度均值偏差超過閾值自動觸發(fā)一次重新建模。roi frame[0:50, 0:50] current_brightness np.mean(cv2.cvtColor(roi, cv2.COLOR_BGR2GRAY)) if abs(current_brightness - initial_brightness) 15: bgModel cv2.createBackgroundSubtractorMOG2(0, bgSubThreshold) isBgCaptured 1這里 initial_brightness 是按下 b 鍵時從同一個位置采的灰度均值15 的閾值能容忍正常的緩慢光線漂移又能及時響應(yīng)燈光切換。5.3 坑三靜止手勢觸發(fā)鍵盤連發(fā)現(xiàn)象只比了 3 根手指沒有動空格鍵被不停觸發(fā)翻頁根本停不下來。原因代碼沒有防抖。triggerSwitch為 True 后只要 cnt 3每幀約 33 毫秒都執(zhí)行一次keybd_event每秒觸發(fā) 30 次按鍵。這在操作系統(tǒng)層面是合法的但目標(biāo)程序會認(rèn)為你按住空格沒松手。解決加入冷卻時間我自己用的是 0.5 秒閾值在前文有過代碼。這里再補充一點如果你希望手勢保持時只觸發(fā)一次還可以加狀態(tài)鎖prev_cnt 0 if cnt ! prev_cnt and cnt 3: # 觸發(fā)按鍵 prev_cnt cnt邏輯是只有手指數(shù)發(fā)生變化時才觸發(fā)手勢保持不動則不產(chǎn)生新事件。這個方案適合「比 3 翻頁、比 2 返回」的場景因為每次換手勢才需要一次按鍵。如果同一個手勢要連續(xù)觸發(fā)多次比如比 3 連續(xù)翻多頁冷卻時間方案更合適。5.4 坑四mask 窗口全是黑的現(xiàn)象按 b 鍵之后mask 窗口沒有任何白色區(qū)域binary 窗口里也看不到手。原因多半是背景建模時手已經(jīng)在畫面里。MOG2 建模時如果手是靜止的它會被當(dāng)成背景的一部分你把手拿走再比手勢背景模型里那個位置是手的灰度值而新進(jìn)來的手也是那個灰度值差分結(jié)果為零。另一個常見原因是cap_region_x_begin0.5你的手在畫面左側(cè)壓根不在檢測區(qū)域內(nèi)。解決第一步按 b 之前把手從攝像頭畫面里移開等 1 秒再按第二步確認(rèn)手在畫面右側(cè)的紅色矩形框內(nèi)第三步如果還是黑的按 r 重置再重新按 b多試兩次。還不行就把 threshold 滑條往左拖降低到 30 左右讓更多的灰度差異被識別為前景。5.5 坑五同事的電腦上跑不起來現(xiàn)象代碼在自己的機(jī)器上一切正常換一臺電腦報錯ModuleNotFoundError: No module named win32api或者攝像頭一直黑屏。原因win32api 是 pywin32 庫提供的不是 Python 標(biāo)準(zhǔn)庫也不是 OpenCV 自帶的。pip install pywin32不裝這個程序在 Windows 上就跑不了。攝像頭黑屏則可能是電腦自帶攝像頭被占用比如 Zoom、微信等軟件正在使用攝像頭VideoCapture(0)搶不到資源。解決在項目文件頭部加一個依賴檢查try: import win32api import win32con except ImportError: raise SystemExit(Missing pywin32, run: pip install pywin32)攝像頭被占用的問題關(guān)掉所有可能占用攝像頭的軟件然后重啟 Python 進(jìn)程。如果你用的是外接攝像頭把VideoCapture(0)改成VideoCapture(1)設(shè)備索引從 0 開始0 通常是內(nèi)置攝像頭1 是第一個外接攝像頭。設(shè)備忙時 OpenCV 不會報錯只是ret為 False可以在camera.read()后面加個判斷ret, frame camera.read() if not ret: print(Failed to read from camera, check if it is occupied) continue6. 讓指尖檢測更準(zhǔn)的驗證方法單步回放與邊界數(shù)據(jù)整個程序最讓我頭疼的不是算法本身而是「感覺不對但說不清哪里不對」。后來我養(yǎng)成一個習(xí)慣不管項目多小都要給自己留一條單步驗證的路。具體做法是把攝像頭輸入換成本地視頻或圖片序列這樣才能復(fù)現(xiàn)同一組手勢。做法很簡單把camera cv2.VideoCapture(0)換成camera cv2.VideoCapture(test.avi)代碼其他部分不用改。本地視頻不受光線、手的位置影響同一幀跑到那里檢測結(jié)果應(yīng)該完全相同。如果兩次跑同一幀結(jié)果不一樣那一定是程序里有隱式狀態(tài)泄漏。驗證手指數(shù)目有個更系統(tǒng)的辦法錄制 5 段短視頻每段固定比 1 到 5 根手指每段 10 秒。跑完程序后統(tǒng)計每幀輸出的 cnt 分布看這 10 秒內(nèi) dominant出現(xiàn)最多的手指數(shù)是不是和手勢一致。比如比 3 的手指理想輸出是大部分幀 cnt 等于 3偶爾跳到 4 或 2 屬于正常如果超過一半的幀都不在 3 上就要回頭調(diào) threshold 或者 blurValue。我一般會用一個小腳本統(tǒng)計from collections import Counter counts Counter(all_cnts) total_frames len(all_cnts) accuracy counts[expected_fingers] / total_frames print(faccuracy: {accuracy:.2%})把準(zhǔn)確率跟 80% 這個基準(zhǔn)比高于 80%這個手勢可以實際使用低于 80%先別急著上鍵盤模擬回去調(diào)參。影響準(zhǔn)確率的因素按權(quán)重排序第一是光照環(huán)境一致的條件下能顯著提精度第二是 blurValue核太大會把相鄰手指的邊緣糊在一起第三是 threshold它決定手指邊緣的完整度第四才是距離法的 count 參數(shù)。另一個簡潔有效的驗證法是畫輪廓點軌跡。把每一幀的指尖坐標(biāo)存進(jìn)列表跑完一組手勢后一次性畫出來你會直觀地看到指尖檢測的穩(wěn)定性。指尖應(yīng)該是幾個清晰的簇而不是一大片散點import matplotlib.pyplot as plt xs [p[0] for p in tip_history] ys [p[1] for p in tip_history] plt.scatter(xs, ys, s1) plt.show()指尖坐標(biāo)如果散得像噪點說明輪廓不穩(wěn)定優(yōu)先檢查高斯模糊核和 MOG2 的前景閾值而不是去調(diào)指尖檢測邏輯。如果簇很清晰但位置漂移那多半是攝像頭自動白平衡在起作用可以考慮用camera.set(cv2.CAP_PROP_WHITE_BALANCE_BLUE_U, 0)禁用自動白平衡。從那以后我每次拿到這類視覺檢測項目都會強(qiáng)制自己先錄一段固定視頻再跑不把時間浪費在「這次手放的位置跟上次不一樣」這種不可控變量上。這個方法幫我在這個項目里至少省出了半天調(diào)試時間希望你也能用它少走彎路。希望幫到你。本文還有配套的精品資源點擊獲取