數(shù)字識(shí)別實(shí)戰(zhàn):關(guān)鍵點(diǎn)特征與分類器構(gòu)建)
簡介基于Python與Mediapipe的手勢(shì)數(shù)字識(shí)別項(xiàng)目源碼是面向計(jì)算機(jī)視覺及機(jī)器學(xué)習(xí)初學(xué)者的完整實(shí)現(xiàn)涵蓋手部追蹤、關(guān)鍵點(diǎn)提取、模型推理與實(shí)時(shí)顯示等環(huán)節(jié)。資源包共3個(gè)文件含兩個(gè)py腳本和一個(gè)md說明文檔一個(gè)腳本將Mediapipe手部關(guān)鍵點(diǎn)檢測(cè)邏輯封裝為可復(fù)用模塊另一個(gè)主程序負(fù)責(zé)啟動(dòng)攝像頭、調(diào)用模型并輸出數(shù)字結(jié)果說明文檔則提供項(xiàng)目介紹、安裝步驟和運(yùn)行指南整體壓縮包僅3KB結(jié)構(gòu)簡潔清晰。已有416人學(xué)習(xí)下載。該項(xiàng)目的學(xué)習(xí)價(jià)值不止于代碼本身還體現(xiàn)在對(duì)Mediapipe框架原理、手部關(guān)鍵點(diǎn)特征工程如關(guān)節(jié)間距、幾何角度以及支持向量機(jī)、隨機(jī)森林或CNN等機(jī)器學(xué)習(xí)模型訓(xùn)練與調(diào)優(yōu)思路的完整梳理。適合用于課程設(shè)計(jì)、畢業(yè)設(shè)計(jì)或快速搭建實(shí)時(shí)手勢(shì)交互演示是一份輕量且可直接運(yùn)行的入門參考。1. 手勢(shì)數(shù)字識(shí)別為什么用 mediapipe 而不是自己訓(xùn)一個(gè)模型很多拿到“python 基于 mediapipe 實(shí)現(xiàn)手勢(shì)數(shù)字識(shí)別機(jī)器學(xué)習(xí)項(xiàng)目源碼.zip”這類壓縮包的同學(xué)第一反應(yīng)是打開里面的模型文件想看看網(wǎng)絡(luò)結(jié)構(gòu)。我的建議正好相反先別碰模型把手部關(guān)鍵點(diǎn)hand landmark這一步吃透。mediapipe 已經(jīng)把“手在哪、關(guān)節(jié)怎么排”這個(gè)最臟最累的活做完了你要解決的其實(shí)是剩下的特征工程和分類決策。這個(gè)標(biāo)題對(duì)應(yīng)的方案核心價(jià)值不在訓(xùn)練一個(gè)多深的神經(jīng)網(wǎng)絡(luò)而是用 python 把開源檢測(cè)模型、數(shù)據(jù)預(yù)處理和輕量分類器串成一個(gè)實(shí)時(shí)可跑的手勢(shì)數(shù)字識(shí)別 demo。它能解決的是攝像頭前伸出一只手實(shí)時(shí)告訴你這是 0 到 9 中的哪個(gè)數(shù)字。適合課程設(shè)計(jì)、自動(dòng)化答辯演示、以及掏出來就能用的個(gè)人小工具。接下來我按拿到源碼后真正要走的流程講先看 mediapipe 到底給了你什么怎么把環(huán)境跑通特征怎么做數(shù)據(jù)怎么采以及最容易被忽略的五個(gè)坑。2. 看源碼前先立住模型認(rèn)知mediapipe 手勢(shì)方案不是黑匣子它有邊界2.1 從 palm detection 到 hand landmark一個(gè)模型解決兩個(gè)問題MediaPipe Hands 不是一個(gè)端到端的“手勢(shì)分類器”它內(nèi)部是一條兩段式管線第一段用 palm detection 在整張圖上找手掌區(qū)域第二段把找到的區(qū)域送進(jìn) hand landmark 模型回歸出 21 個(gè)手部關(guān)鍵點(diǎn)。為什么要拆成兩段因?yàn)槿耸质且粋€(gè)可以在畫面里平移、旋轉(zhuǎn)、遠(yuǎn)近變化的剛性目標(biāo)。直接在全圖上回歸 21 個(gè)點(diǎn)模型要同時(shí)應(yīng)付“找手”和“找關(guān)節(jié)”兩個(gè)任務(wù)精度和速度都吃虧。先定位手掌相當(dāng)于給第二階段一個(gè)準(zhǔn)確的 region proposal后面只需要在裁剪區(qū)域里做回歸難度大幅下降速度也更快。另一個(gè)值得注意的點(diǎn)在視頻流里palm detection 并不是每幀都跑。mediapipe 會(huì)先做一次檢測(cè)之后每幀用 hand landmark 模型跟蹤關(guān)鍵點(diǎn)只有跟蹤丟了才重新檢測(cè)。這個(gè)機(jī)制直接決定了源碼里static_image_mode參數(shù)怎么設(shè)置也決定了為什么手短暫出畫再回來畫面還能接得上。所以拿到源碼先別急著跑找到Hands(...)的初始化位置看看傳入的是static_image_modeTrue還是False。前者適合單張圖片后者適合視頻流選錯(cuò)模式會(huì)帶來兩種完全不同的體驗(yàn)圖片模式每幀都做全圖檢測(cè)視頻里就會(huì)明顯變卡視頻模式拿靜態(tài)圖一張張喂反而會(huì)因?yàn)槿鄙龠B續(xù)幀信息而丟手。2.2 為什么只回傳 21 個(gè)關(guān)鍵點(diǎn)數(shù)據(jù)簡化才是它適合輕量落地的本質(zhì)21 個(gè)關(guān)鍵點(diǎn)意味著什么一只手從自由度極高的連續(xù)曲面被壓成了 21 個(gè)離散錨點(diǎn)。每個(gè)點(diǎn)帶 x、y、z 三個(gè)值x 和 y 是相對(duì)圖像寬高的歸一化坐標(biāo)范圍在 0 到 1 之間z 是相對(duì)腕關(guān)節(jié)的深度不是真實(shí)相機(jī)距離而且不同手型下量級(jí)差異很大。這里建議先熟悉一張索引表后面做特征工程全靠它手指指尖點(diǎn)索引根部參考點(diǎn)拇指42 / 1食指85中指129無名指1613小指2017寫一段最基礎(chǔ)的代碼把當(dāng)前幀的 21 個(gè)點(diǎn)打印出來確認(rèn)拿到的數(shù)據(jù)長什么樣import mediapipe as mp hands mp.solutions.hands.Hands( static_image_modeFalse, # 視頻流場(chǎng)景必須用 False會(huì)復(fù)用上一幀跟蹤結(jié)果加速 max_num_hands1, # 先只識(shí)別一只手減少耗時(shí) min_detection_confidence0.5, min_tracking_confidence0.5, ) def print_landmarks(image_rgb): results hands.process(image_rgb) if not results.multi_hand_landmarks: print(no hand) return for lm in results.multi_hand_landmarks[0].landmark: print(round(lm.x, 4), round(lm.y, 4), round(lm.z, 4))這段代碼的邏輯很簡單傳入一幀 RGB 圖像mediapipe 返回手部關(guān)鍵點(diǎn)列表每個(gè)點(diǎn)分別是 x、y、z。注意lm.x和lm.y不是像素坐標(biāo)而是歸一化坐標(biāo)后續(xù)要轉(zhuǎn)回像素必須乘當(dāng)前幀的寬和高很多新手就是栽在這里畫出來的點(diǎn)全擠在畫面左上角。數(shù)據(jù)簡化到這種程度最大的收益是后續(xù)機(jī)器學(xué)習(xí)建模變得非常輕。你不用處理紋理、光照、背景這些對(duì) CNN 影響巨大的因素只需要在 63 維坐標(biāo)上做文章。這也是為什么這類源碼里幾乎不會(huì)真的訓(xùn)練一個(gè)深度網(wǎng)絡(luò)邏輯回歸、隨機(jī)森林甚至簡單規(guī)則就夠了。2.3 數(shù)字識(shí)別不靠端到端規(guī)則、經(jīng)典分類器與特征表達(dá)的取舍明確了輸入是 21 個(gè)關(guān)鍵點(diǎn)之后下一個(gè)問題是怎么從關(guān)鍵點(diǎn)得到“這是數(shù)字幾”。常見做法有三類源碼包里大概率是其中一種方案代碼量新動(dòng)作擴(kuò)展性適用場(chǎng)景純規(guī)則閾值少幾十行差每個(gè)數(shù)字要單獨(dú)定規(guī)則只識(shí)別 0 到 5實(shí)時(shí)性要求極高邏輯回歸 / 隨機(jī)森林中特征提取加訓(xùn)練中換數(shù)字需重新采數(shù)據(jù)固定數(shù)字集合本標(biāo)題場(chǎng)景端到端 CNN大需要大量標(biāo)注數(shù)據(jù)好但成本太高關(guān)鍵點(diǎn)檢測(cè)不可靠的復(fù)雜場(chǎng)景我自己的選擇是第二種。純規(guī)則看起來簡單但真實(shí)攝像頭下手指彎曲程度千奇百怪一個(gè)閾值很難覆蓋不同手型和遠(yuǎn)近端到端 CNN 在這個(gè)任務(wù)里屬于殺雞用牛刀而且數(shù)據(jù)量根本喂不飽。邏輯回歸配合好的特征在這個(gè)任務(wù)上精度已經(jīng)完全夠用。真正拉開效果差距的是特征工程怎么做。原始坐標(biāo)直接丟給分類器也能跑但手在畫面里的位置一動(dòng)、離攝像頭遠(yuǎn)近一變坐標(biāo)整體就變了分類器就會(huì)犯迷糊。所以下一步必須做歸一化和角度特征這也是整個(gè)源碼里最值得細(xì)讀的部分。3. 把源碼跑起來環(huán)境搭建、推理腳本與數(shù)據(jù)流這四件事先做對(duì)3.1 先從 zip 里的源碼倒推 dependencies用 uv 還是 pip 安裝解壓源碼包之后第一步是看目錄結(jié)構(gòu)。通常能看到main.py、train.py、data/、models/這類常見布局。如果壓縮包里帶了requirements.txt直接用 pip 安裝如果沒帶pip 安裝這四件套基本能覆蓋絕大多數(shù)情況unzip 一個(gè)python基于mediapipe實(shí)現(xiàn)手勢(shì)數(shù)字識(shí)別機(jī)器學(xué)習(xí)項(xiàng)目源碼.zip -d hand_digits cd hand_digits # 創(chuàng)建虛擬環(huán)境避免污染系統(tǒng) Python python -m venv .venv source .venv/bin/activate # Windows 用 .venv\Scripts\activate pip install --upgrade pip pip install mediapipe opencv-python numpy scikit-learn為什么專門用虛擬環(huán)境因?yàn)?mediapipe 對(duì) numpy、opencv 的版本比較挑系統(tǒng)里如果已經(jīng)裝了別的版本很可能出現(xiàn)module has no attribute這類讓人摸不著頭腦的錯(cuò)誤。虛擬環(huán)境相當(dāng)于給這個(gè)項(xiàng)目一個(gè)后悔藥裝壞了直接刪掉重建不影響其他工作。如果你用的 Python 版本很新比如 3.12 以上安裝 mediapipe 時(shí)可能會(huì)找不到對(duì)應(yīng) wheel。這是常見的翻車點(diǎn)我一般會(huì)先降到 3.9 或 3.10等所有依賴裝好了再考慮升級(jí)。這一步不做后面每跑一步都要和依賴搏斗非常影響心情。3.2 最小推理腳本讀攝像頭、取手部關(guān)鍵點(diǎn)、打印坐標(biāo)裝好依賴后先不要碰源碼里的業(yè)務(wù)邏輯自己寫一個(gè)最小腳本驗(yàn)證 whole pipeline 是通的。下面這段代碼能打開攝像頭、檢測(cè)手、畫關(guān)鍵點(diǎn)是整個(gè)項(xiàng)目能跑起來的最小閉環(huán)import cv2 import mediapipe as mp mp_hands mp.solutions.hands mp_draw mp.solutions.drawing_utils hands mp_hands.Hands( static_image_modeFalse, max_num_hands1, min_detection_confidence0.5, min_tracking_confidence0.5, ) cap cv2.VideoCapture(0) while cap.isOpened(): ok, frame cap.read() if not ok: break # 鏡面翻轉(zhuǎn)讓畫面方向和屏幕一致 frame cv2.flip(frame, 1) rgb cv2.cvtColor(frame, cv2.COLOR_BGR2RGB) results hands.process(rgb) if results.multi_hand_landmarks: for hand in results.multi_hand_landmarks: # 歸一化坐標(biāo)轉(zhuǎn)回像素坐標(biāo)用于繪圖 h, w, _ frame.shape for idx, lm in enumerate(hand.landmark): cx, cy int(lm.x * w), int(lm.y * h) cv2.circle(frame, (cx, cy), 3, (0, 255, 0), -1) mp_draw.draw_landmarks(frame, hand, mp_hands.HAND_CONNECTIONS) cv2.imshow(hand tracking, frame) if cv2.waitKey(1) 0xFF ord(q): break cap.release() cv2.destroyAllWindows()這段代碼里有兩個(gè)參數(shù)值得專研。第一個(gè)是min_detection_confidence當(dāng)手部檢測(cè)置信度低于 0.5 時(shí)就認(rèn)為沒有手調(diào)大能減少誤檢但會(huì)丟手第二個(gè)是min_tracking_confidence控制跟蹤階段的閾值調(diào)得太高手離開畫面后很難快速找回。后續(xù)做數(shù)字識(shí)別時(shí)這兩個(gè)參數(shù)幾乎是必調(diào)的但它們之間沒有絕對(duì)最優(yōu)解得配合你的攝像頭環(huán)境。另一個(gè)關(guān)鍵是cv2.flip(frame, 1)。攝像頭出來的畫面默認(rèn)是鏡像的如果不翻轉(zhuǎn)你伸出左手屏幕里看到的卻是右手后面做左右手判定或者畫坐標(biāo)系時(shí)很容易被繞進(jìn)去。3.3 特征工程一靜態(tài)數(shù)字用歸一化坐標(biāo)別用原始像素跑通了攝像頭下一步就是把 landmark 變成能喂給分類器的特征。你可能會(huì)問機(jī)器學(xué)習(xí)中的數(shù)據(jù)處理是什么這段就是答案不是洗數(shù)據(jù)而是把坐標(biāo)換到不隨手的位置、大小變化的參考系。手在畫面里忽左忽右、忽遠(yuǎn)忽近原始像素坐標(biāo)的絕對(duì)數(shù)值變化巨大分類器會(huì)把這些變化當(dāng)作有效信息去學(xué)習(xí)結(jié)果就是同一只手換個(gè)位置就識(shí)別錯(cuò)。標(biāo)準(zhǔn)做法是以腕關(guān)節(jié)作為原點(diǎn)做相對(duì)歸一化import numpy as np def normalize_by_wrist(landmarks): # landmarks: 21 個(gè)關(guān)鍵點(diǎn)每個(gè)點(diǎn)帶 x, y, z pts np.array([[lm.x, lm.y, lm.z] for lm in landmarks]) wrist pts[0] # 0 號(hào)點(diǎn)是腕關(guān)節(jié) pts pts - wrist # 以腕關(guān)節(jié)為原點(diǎn) scale np.max(np.linalg.norm(pts, axis1)) 1e-6 pts pts / scale # 尺度歸一化抵消手離攝像頭遠(yuǎn)近的影響 return pts.flatten() # 轉(zhuǎn)成 63 維向量這里用np.linalg.norm算每個(gè)點(diǎn)到腕關(guān)節(jié)的距離取最大值作為尺度因子。這樣做的好處是手靠近攝像頭時(shí)整體坐標(biāo)變大除以這個(gè)尺度后又被拉回來分類器看到的特征相對(duì)穩(wěn)定。1e-6是防分母為零的保險(xiǎn)鏡頭前沒手時(shí)不會(huì)調(diào)用這個(gè)函數(shù)但萬一某幀坐標(biāo)全為 0不至于直接除零崩潰。注意一個(gè)邊界這個(gè)歸一化假設(shè)手腕是整只手的固定點(diǎn)。實(shí)際做數(shù)字手勢(shì)時(shí)手腕確實(shí)不怎么動(dòng)但如果你想識(shí)別包含手腕大幅度旋轉(zhuǎn)的動(dòng)作這個(gè)方案就不夠用了得換更復(fù)雜的對(duì)齊方式。3.4 特征工程二指尖夾角與幾何特征解決“比個(gè)耶”被誤判只做坐標(biāo)歸一化還不夠。數(shù)字 1 和 2 的手型非常接近一個(gè)只伸食指一個(gè)伸出食指和中指兩者原始坐標(biāo)的歐氏距離很小分類器很容易混淆。真正有區(qū)分度的特征是指尖夾角——用“指尖、中間關(guān)節(jié)、指根”三個(gè)點(diǎn)算出一個(gè)角度判斷手指伸得直不直。import math def angle_between(a, b, c): 計(jì)算以 b 為頂點(diǎn)向量 ba 和 bc 的夾角單位度 v1 (a[0] - b[0], a[1] - b[1]) v2 (c[0] - b[0], c[1] - b[1]) dot v1[0] * v2[0] v1[1] * v2[1] norm1 math.hypot(v1[0], v1[1]) norm2 math.hypot(v2[0], v2[1]) if norm1 0 or norm2 0: return 0.0 cos_theta max(-1.0, min(1.0, dot / (norm1 * norm2))) return math.degrees(math.acos(cos_theta))邏輯就是向量點(diǎn)積求余弦再轉(zhuǎn)角度。用中指舉例點(diǎn) 12 是指尖點(diǎn) 10 是中間關(guān)節(jié)點(diǎn) 9 是指根三點(diǎn)夾角越接近 180 度說明這根手指伸得越直越接近 90 度甚至更小說明手指是彎的。在實(shí)際特征拼接時(shí)我會(huì)對(duì)五根手指各取一組角度拇指用 4-2-1食指用 8-6-5中指用 12-10-9無名指用 16-14-13小指用 20-18-17得到 5 個(gè)角度值直接追加到歸一化坐標(biāo)后面。這樣特征從 63 維變成 68 維分類器區(qū)分 1 和 2、2 和 3 這類相近數(shù)字的能力會(huì)明顯提升。4. 讓數(shù)字識(shí)別從“能動(dòng)”到“可用”訓(xùn)練數(shù)據(jù)、后處理與實(shí)時(shí)性調(diào)優(yōu)4.1 自己錄一遍數(shù)據(jù)為什么通用手勢(shì)數(shù)據(jù)救不了你的攝像頭先回到機(jī)器學(xué)習(xí)應(yīng)用流程的第一環(huán)數(shù)據(jù)。有人會(huì)想既然 mediapipe 輸出的是抽象關(guān)鍵點(diǎn)那用公開手勢(shì)數(shù)據(jù)集訓(xùn)練不就行了理論上可以但實(shí)際效果往往很差。公開數(shù)據(jù)集里的攝像頭角度、手大小比例、光照和你本機(jī)完全不一致關(guān)鍵點(diǎn)坐標(biāo)分布也差很遠(yuǎn)。我見過太多人拿開源數(shù)據(jù)集訓(xùn)練指標(biāo)很漂亮一接自己攝像頭就翻車的情況。通用做法是自己花十分鐘錄一份數(shù)據(jù)。腳本不需要多復(fù)雜核心是讓每個(gè)數(shù)字都有足夠的樣本并且手部有輕微移動(dòng)、旋轉(zhuǎn)import cv2 import numpy as np label int(input(輸入當(dāng)前手勢(shì)數(shù)字0-9按回車開始采集)) features [] while len(features) 120: ok, frame cap.read() if not ok: continue frame cv2.flip(frame, 1) rgb cv2.cvtColor(frame, cv2.COLOR_BGR2RGB) results hands.process(rgb) if results.multi_hand_landmarks: lm results.multi_hand_landmarks[0].landmark feat normalize_by_wrist(lm) # 3.3 節(jié)的坐標(biāo)歸一化 angle_feat extract_angles(lm) # 3.4 節(jié)的角度特征 features.append(np.hstack([feat, angle_feat])) print(f已采集 {len(features)} / 120) cv2.imshow(collect, frame) if cv2.waitKey(1) 0xFF ord(q): break np.save(fdata/{label}.npy, np.array(features))采集時(shí)注意控制數(shù)據(jù)質(zhì)量不要對(duì)著攝像頭一動(dòng)不動(dòng)那樣錄進(jìn)去的 120 幀幾乎是一模一樣的重復(fù)樣本模型學(xué)不到任何變化。正確做法是讓手輕微左右翻轉(zhuǎn)、前后移動(dòng)一點(diǎn)模擬真實(shí)使用時(shí)的狀態(tài)。每個(gè)數(shù)字 120 幀是我個(gè)人比較推薦的起點(diǎn)太少容易過擬合太多采集過程會(huì)讓人失去耐心。4.2 數(shù)據(jù)增強(qiáng)與類別均衡輕微旋轉(zhuǎn)、平移和縮放就夠了如果你的某個(gè)數(shù)字只采了五六十幀或者發(fā)現(xiàn)不同類別的樣本量差距很大可以在坐標(biāo)層面做增強(qiáng)。坐標(biāo)增強(qiáng)比圖像增強(qiáng)便宜得多不需要過 GPU直接在 numpy 數(shù)組上做變換就行def augment(points, rot0.1, shift0.02, scale_range(0.9, 1.1)): # points: (63,) 或 (68,) 的向量先還原成 (21, 3) 再做幾何變換 p points.reshape(21, 3).copy() # 繞 z 軸小角度旋轉(zhuǎn)模擬手腕轉(zhuǎn)動(dòng) theta np.random.uniform(-rot, rot) R np.array([[np.cos(theta), -np.sin(theta)], [np.sin(theta), np.cos(theta)]]) p[:, :2] p[:, :2] R.T # 輕微平移模擬手在畫面中位置變化 p[:, :2] np.random.uniform(-shift, shift, size2) # 隨機(jī)縮放模擬手離攝像頭遠(yuǎn)近變化 scale np.random.uniform(*scale_range) p * scale return p.flatten()參數(shù)選擇上旋轉(zhuǎn)幅度不要超過 0.1 弧度大概 6 度左右因?yàn)檎H俗鰯?shù)字手勢(shì)時(shí)手腕不會(huì)扭得特別夸張平移 0.02 對(duì)應(yīng)畫面寬度的 2%已經(jīng)能覆蓋日常位置抖動(dòng)縮放范圍 0.9 到 1.1相當(dāng)于手在攝像頭前不超過 10% 的距離變化。必須提醒一句坐標(biāo)增強(qiáng)做的是小擾動(dòng)不是把樣本變魔術(shù)。旋轉(zhuǎn) 30 度、平移半個(gè)畫面出來的樣本根本不符合真實(shí)手勢(shì)分布反而會(huì)把模型訓(xùn)壞。這步調(diào)參多少有點(diǎn)玄學(xué)但核心原則是“增強(qiáng)后的樣本仍然像一個(gè)真人在攝像頭前做手勢(shì)”。4.3 推理延遲的三個(gè)瓶頸模型載入、圖像縮放、每幀處理實(shí)時(shí)數(shù)字識(shí)別最怕的就是畫面卡頓。很多源碼 demo 跑起來只有十幾幀問題往往不在 mediapipe 模型本身而在數(shù)據(jù)流鏈路。第一個(gè)瓶頸是圖像分辨率。如果你的攝像頭默認(rèn)輸出 1080p每一幀要處理約 200 萬像素即使 mediapipe 內(nèi)部會(huì)縮放前處理開銷依然很大。常規(guī)做法是先resize到 640x480 再送入模型。第二個(gè)瓶頸是逐幀推理其實(shí)手勢(shì)在連續(xù)兩幀之間變化極小完全可以通過跳幀把推理頻率降下來。第三個(gè)瓶頸是顯示鏈路cv2.imshow本身在高分辨率下也會(huì)拖慢主循環(huán)。frame cv2.resize(frame, (640, 480)) frame_count 1 if frame_count % 2 0: # 偶數(shù)幀不做推理直接沿用上一幀的關(guān)鍵點(diǎn)結(jié)果 results last_results else: results hands.process(cv2.cvtColor(frame, cv2.COLOR_BGR2RGB)) last_results results跳幀相當(dāng)于在延遲和平滑度之間做權(quán)衡。30fps 的視頻流下跳一幀引入的延遲大約 33 毫秒體感上基本無感但推理負(fù)載直接減半。如果跳幀后跟蹤容易丟可以把min_tracking_confidence適當(dāng)調(diào)高讓模型更依賴上一幀的幾何信息去接續(xù)。4.4 訓(xùn)練腳本與混淆矩陣認(rèn)真看哪些數(shù)字在互相打架數(shù)據(jù)采集和增強(qiáng)做完就可以訓(xùn)練分類器了。我用 Logistic Regression 而不是隨機(jī)森林因?yàn)檫壿嫽貧w的決策邊界更平滑在特征維度不高時(shí)不容易過擬合而且訓(xùn)練和推理都快。核心代碼from sklearn.linear_model import LogisticRegression from sklearn.model_selection import train_test_split from sklearn.preprocessing import StandardScaler from sklearn.metrics import confusion_matrix # load_all_data 負(fù)責(zé)讀取 data/ 下所有 npy 文件返回特征矩陣和標(biāo)簽 X, y load_all_data(data) X_train, X_val, y_train, y_val train_test_split( X, y, test_size0.2, random_state42, stratifyy ) scaler StandardScaler().fit(X_train) X_train_scaled scaler.transform(X_train) X_val_scaled scaler.transform(X_val) clf LogisticRegression(max_iter500, C1.0) clf.fit(X_train_scaled, y_train) print(confusion_matrix(y_val, clf.predict(X_val_scaled)))邏輯說明StandardScaler把特征縮放到零均值單位方差邏輯回歸對(duì)特征尺度敏感這步不能省。stratifyy保證訓(xùn)練集和驗(yàn)證集的類別比例一致避免某個(gè)數(shù)字在驗(yàn)證集里恰好沒有樣本。C1.0是正則化強(qiáng)度的默認(rèn)值過擬合時(shí)調(diào)小欠擬合時(shí)調(diào)大?;煜仃嚨膬r(jià)值在于告訴你哪些數(shù)字在互打架。如果 3 和 8 頻繁互判說明這兩個(gè)手型的角度特征太接近這時(shí)候該做的不是盲目堆數(shù)據(jù)而是回去檢查特征設(shè)計(jì)如果 1 和 2 互判先確認(rèn)是否加了指尖角度特征只靠坐標(biāo)歸一化很難分開它們。5. 避坑與常見問題排查mediapipe 手勢(shì)識(shí)別最容易翻車的五個(gè)地方5.1 現(xiàn)象攝像頭能開但沒畫上手部連線攝像頭畫面正常但 imgshow 里始終沒有手部關(guān)鍵點(diǎn)連線或者畫出來的點(diǎn)全堆在畫面邊緣。原因最常見的是沒有做 BGR 到 RGB 的轉(zhuǎn)換。mediapipe 的Hands.process()要求輸入 RGB 圖像而 OpenCV 讀取視頻幀得到的是 BGR直接把 BGR 矩陣送進(jìn)去模型看到的顏色通道是反的關(guān)鍵點(diǎn)定位自然失敗。另一個(gè)原因是顯示用錯(cuò)了圖像你把轉(zhuǎn)換后的 RGB 圖像直接imshow顏色會(huì)整體偏藍(lán)。解決先打印results.multi_hand_landmarks如果一直是 None檢查cv2.cvtColor(frame, cv2.COLOR_BGR2RGB)是否執(zhí)行然后確認(rèn)展示時(shí)用的是原始frameBGR而不是轉(zhuǎn)換后的rgb。mediapipe 只管推理不管顯示很多源碼在這兩行之間切換時(shí)搞混了。5.2 現(xiàn)象數(shù)字 1 和 2 頻繁互判怎么調(diào)都?jí)翰幌氯プR(shí)別結(jié)果在 1 和 2 之間來回跳尤其是手指微微彎曲時(shí)模型一會(huì)兒判成 1一會(huì)兒判成 2。原因手型太接近了。只伸食指和同時(shí)伸出食指、中指兩者在歸一化坐標(biāo)上的差異很小。如果只用了 63 維坐標(biāo)特征分類器很難找到一個(gè)穩(wěn)定的決策邊界。解決把指尖夾角特征加上用食指和中指的伸直程度作為區(qū)分依據(jù)。還可以在訓(xùn)練數(shù)據(jù)里專門加入一些“手指半彎”的樣本讓模型知道 1 和 2 的邊界在哪里。這里不建議直接調(diào)邏輯回歸的C值問題出在特征空間不是分類器復(fù)雜度。5.3 現(xiàn)象手一靠近攝像頭就亂跳手離攝像頭越近關(guān)鍵點(diǎn)位置就越不穩(wěn)定識(shí)別結(jié)果在幾個(gè)數(shù)字之間跳來跳去根本沒法用。原因手靠近時(shí)手掌在畫面里占的面積過大部分手指可能超出畫面邊緣landmark 模型只能靠猜測(cè)補(bǔ)全缺失關(guān)鍵點(diǎn)。同時(shí)近景下同一個(gè)關(guān)鍵點(diǎn)在相鄰幀之間的像素位移被放大任何微小抖動(dòng)都會(huì)被模型放大。解決把min_detection_confidence和min_tracking_confidence同時(shí)提到 0.6 到 0.7讓模型在置信度不夠時(shí)直接不輸出結(jié)果而不是硬給一個(gè)錯(cuò)誤預(yù)測(cè)。再加一層指數(shù)平滑讓關(guān)鍵點(diǎn)坐標(biāo)不會(huì)因?yàn)閱螏`差劇烈跳變smoothed smoothed * 0.7 current_point * 0.3平滑系數(shù) 0.7 表示更信任歷史值0.3 表示接受當(dāng)前值。系數(shù)越大越平滑但延遲越高實(shí)時(shí)場(chǎng)景里 0.7/0.3 是一個(gè)比較平衡的起點(diǎn)。這本質(zhì)上是拿延遲換平滑不可能完全消除代價(jià)。5.4 現(xiàn)象CPU 占用拉滿風(fēng)扇狂轉(zhuǎn)攝像頭一開CPU 占用率直接到 100%畫面幀率卻只有十幾幀。原因攝像頭默認(rèn)輸出 1080p每一幀都在全分辨率上跑推理。很多人忽略了resize覺得反正 mediapipe 內(nèi)部會(huì)處理但前處理的開銷是實(shí)打?qū)嵉?。再加上顯示窗口和主循環(huán)在同一線程加載一旦跟不上就開始掉幀。解決先resize到 640x480 再送process()這一步能省掉一大半計(jì)算量然后按 4.3 節(jié)的思路做跳幀如果還是不夠把推理單獨(dú)丟到一個(gè)線程里跑主線程只負(fù)責(zé)顯示結(jié)果。線程方案寫起來麻煩一點(diǎn)但這是樹莓派這類低功耗設(shè)備上能不能跑起來的決定性因素。5.5 現(xiàn)象模型自己玩得轉(zhuǎn)一換電腦就出錯(cuò)同一個(gè)項(xiàng)目在自己電腦上跑得好好的換一臺(tái)電腦裝完依賴就報(bào)錯(cuò)比如 numpy 版本沖突、cv2 屬性找不到。原因依賴沒有被鎖定。源碼包里只寫了pip install mediapipe沒鎖版本換電腦時(shí)裝到的是最新版而最新版往往和舊代碼不兼容。mediapipe 版本一升API 參數(shù)名變了opencv 版本一升某些圖像處理函數(shù)的返回值類型變了。解決把requirements.txt中每個(gè)包的版本寫死比如mediapipe0.10.x、numpy1.24.x。這個(gè)操作看起來不起眼但能避免你花半天時(shí)間排查一個(gè)根本不是自己代碼的問題。我一般還會(huì)在項(xiàng)目根目錄放一個(gè)setup_env.sh把建環(huán)境、裝依賴、驗(yàn)證攝像頭三步都寫進(jìn)去換機(jī)器后一鍵執(zhí)行。6. 最后一層包裝把單幀識(shí)別結(jié)果變成時(shí)間序列輸出單幀分類的結(jié)果出現(xiàn)偶發(fā)抖動(dòng)是靠調(diào)參消不掉的因?yàn)閿z像頭輸入本身有噪聲手再穩(wěn)也會(huì)有微米級(jí)的位移。與其和每一幀死磕不如換一個(gè)思路把“當(dāng)前顯示什么數(shù)字”當(dāng)成一個(gè)時(shí)間序列問題用滑動(dòng)窗口做多數(shù)表決。from collections import deque class VoteFilter: def __init__(self, window_size5): self.window deque(maxlenwindow_size) def push(self, pred): self.window.append(pred) # 返回窗口內(nèi)出現(xiàn)次數(shù)最多的類別 return max(set(self.window), keyself.window.count)用法很直接每一幀模型輸出一個(gè)預(yù)測(cè)結(jié)果不是立刻顯示而是先塞進(jìn)這個(gè)隊(duì)列然后取隊(duì)列里出現(xiàn)次數(shù)最多的數(shù)字當(dāng)作最終輸出。窗口大小 5 時(shí)大約引入 5 幀的延遲按 30fps 算不到 200 毫秒體感上可以接受如果你發(fā)現(xiàn)抖動(dòng)還是很明顯就把窗口加到 9代價(jià)是延遲接近 300 毫秒按下和出結(jié)果之間有明顯的遲鈍感。我還習(xí)慣讓這個(gè)過濾器額外承擔(dān)一個(gè)任務(wù)把手離開畫面時(shí)輸出一個(gè)特殊值而不是沿用上一個(gè)數(shù)字。否則手剛離開攝像頭分類器可能還會(huì)給出一個(gè)置信度很低的隨機(jī)預(yù)測(cè)再加上投票窗口的滯后作用屏幕上會(huì)停留一個(gè)明顯錯(cuò)誤的結(jié)果。我最早做手勢(shì)識(shí)別時(shí)被單幀忽大忽小的分類結(jié)果坑了很多次后來養(yǎng)成一個(gè)習(xí)慣先把單幀識(shí)別當(dāng)成一個(gè)信號(hào)再交給時(shí)間維度去糾偏。這個(gè)習(xí)慣改變的不只是識(shí)別率更是排查問題的思路——當(dāng)你不再糾結(jié)每一幀的對(duì)錯(cuò)而是看一段時(shí)間的輸出是否一致很多問題會(huì)自己浮出來。希望幫到你。本文還有配套的精品資源點(diǎn)擊獲取