:灰度化與二值化原理、Pillow與OpenCV對比及優(yōu)化技巧)
1. 項目緣起為什么圖片處理是Python的“必修課”最近在整理一個老項目的圖片素材庫里面混雜著各種格式、各種尺寸的圖片有產(chǎn)品圖、用戶頭像還有一堆歷史遺留的截圖。老板突然提了個需求說要把其中一部分宣傳物料統(tǒng)一成“復(fù)古黑白風(fēng)格”。如果手動用PS一張張?zhí)幚韼装購垐D的工作量簡直讓人頭皮發(fā)麻。這時候我第一個想到的就是Python。這幾乎是每個搞數(shù)據(jù)處理、自動化腳本甚至前端開發(fā)的程序員都會遇到的一個經(jīng)典場景批量處理圖片。無論是為了節(jié)省設(shè)計資源還是為了適配不同顯示設(shè)備比如電子墨水屏或者僅僅是進行一些簡單的圖像預(yù)處理為后續(xù)的機器學(xué)習(xí)任務(wù)做準備將彩色圖片轉(zhuǎn)換為灰度圖或黑白二值圖都是一項基礎(chǔ)且高頻的操作。你可能覺得這很簡單網(wǎng)上搜一下“Python 圖片轉(zhuǎn)灰度”就能找到一堆代碼。但實際操作起來你會發(fā)現(xiàn)這里面門道不少。比如用PIL庫的convert(‘L’)和用OpenCV的cvtColor轉(zhuǎn)出來的灰度圖在數(shù)值上可能就有細微差別所謂的“黑白圖”二值圖也不是簡單地把灰度圖里大于某個值的像素變白、小于的變黑那么簡單這里涉及到閾值選取的大學(xué)問直接決定了最終效果是清晰還是糊成一團。更別提處理不同格式圖片JPG, PNG, WebP時可能遇到的坑比如PNG的透明通道怎么處理JPG壓縮導(dǎo)致的噪點會不會影響二值化效果所以今天我不只是給你一段能跑的代碼而是想結(jié)合我這些年踩過的坑把用Python處理圖片灰度化和二值化的完整流程、核心原理、不同庫的優(yōu)劣對比以及那些教科書里不會寫的實操細節(jié)一次性給你講透。無論你是想寫個腳本解放雙手還是為更復(fù)雜的圖像分析任務(wù)打基礎(chǔ)這篇內(nèi)容都能讓你少走彎路。2. 環(huán)境搭建與工具選型PIL、OpenCV還是其他工欲善其事必先利其器。Python處理圖片的庫有很多我們主要對比兩個最主流的選擇PillowPIL的友好分支和OpenCV。選擇哪個取決于你的具體需求和項目背景。2.1 Pillow輕量易用快速上手Pillow是Python圖像處理庫PILPython Imaging Library的一個活躍分支它安裝簡單API對新手非常友好對于基礎(chǔ)的圖片讀寫、格式轉(zhuǎn)換、縮放、裁剪和簡單的色彩空間轉(zhuǎn)換來說它是首選。安裝與驗證打開你的終端或命令行直接使用pip安裝pip install Pillow安裝完成后可以在Python交互環(huán)境里快速驗證from PIL import Image print(Image.__version__) # 查看版本確認安裝成功Pillow的核心優(yōu)勢純Python實現(xiàn)部分核心用C加速在大多數(shù)常見操作上速度足夠快且跨平臺兼容性極佳。接口直觀比如打開圖片就是Image.open(‘path’)轉(zhuǎn)換灰度就是.convert(‘L’)非常符合直覺。格式支持廣泛幾乎支持所有常見的圖片格式如JPEG、PNG、BMP、GIF、TIFF等。內(nèi)存友好對于大圖片可以使用Image.open后配合Image.Image.load()方法分塊處理避免一次性載入內(nèi)存導(dǎo)致溢出。注意在導(dǎo)入時我們寫的是from PIL import Image而不是import Pillow。這是因為Pillow庫為了保持對老PIL項目的兼容性依然使用PIL作為頂級包名。這是一個非常常見的迷惑點新手務(wù)必記住。2.2 OpenCV功能強大計算機視覺的“瑞士軍刀”O(jiān)penCVOpen Source Computer Vision Library是一個基于C編寫但提供了完整Python接口的計算機視覺庫。它的功能遠超簡單的圖片格式轉(zhuǎn)換包含了大量的圖像處理、視頻分析、物體檢測和機器學(xué)習(xí)算法。如果你的項目后續(xù)涉及到人臉識別、特征提取、實時視頻處理等那么從一開始就使用OpenCV會是更連貫的選擇。安裝與驗證對于大多數(shù)用戶推薦安裝OpenCV的“主模塊”包它包含了最常用的功能pip install opencv-python如果你還需要一些額外的、非免費的算法模塊比如SIFT、SURF等專利算法可以安裝pip install opencv-contrib-python驗證安裝import cv2 print(cv2.__version__)OpenCV的核心優(yōu)勢性能強悍底層由C/C和匯編優(yōu)化處理速度尤其是視頻流和復(fù)雜算法上遠超純Python庫。色彩空間轉(zhuǎn)換專業(yè)提供了cv2.cvtColor()函數(shù)支持超過150種色彩空間轉(zhuǎn)換如BGR?Gray, BGR?HSV等非常規(guī)范。豐富的圖像處理算法內(nèi)置了各種濾波、形態(tài)學(xué)操作、輪廓查找、二值化方法不止一種可以直接調(diào)用。與Numpy無縫集成OpenCV的圖片對象本質(zhì)上就是一個Numpy數(shù)組ndarray這意味著你可以直接使用Numpy強大的數(shù)組操作功能來處理圖片數(shù)據(jù)靈活性極高。我該怎么選如果你只是偶爾需要批量轉(zhuǎn)換一下圖片格式、調(diào)整尺寸或做簡單的灰度化并且希望代碼簡單、依賴少Pillow是你的不二之選。如果你的項目明確屬于“計算機視覺”范疇或者后續(xù)肯定要進行更復(fù)雜的圖像分析那么直接上OpenCV避免后期切換庫帶來的成本。一個常見的混合策略是用Pillow來讀取和保存各種稀奇古怪格式的圖片因為它解碼器更全然后用np.array(pil_image)轉(zhuǎn)換成Numpy數(shù)組交給OpenCV處理處理完再用Pillow保存。這樣可以兼顧格式兼容性和處理能力。為了覆蓋更廣的場景本文后續(xù)的示例將同時展示Pillow和OpenCV兩種實現(xiàn)方式你可以根據(jù)自己的情況選擇。3. 核心原理從彩色到灰度再到黑白在動手寫代碼之前我們有必要花幾分鐘搞清楚背后的原理。這能幫你理解為什么不同的方法會產(chǎn)生不同的結(jié)果以及在出問題時如何調(diào)試。3.1 彩色圖片的構(gòu)成RGB與像素一張數(shù)字彩色圖片可以看作一個三維矩陣Height × Width × Channels。對于最常見的RGB色彩模式Height高圖片的垂直像素數(shù)。Width寬圖片的水平像素數(shù)。Channels通道通常為3分別代表紅Red、綠Green、藍Blue三個顏色通道。 每個通道在每個像素位置都有一個強度值通常是0到255之間的整數(shù)8位深度。例如一個像素點的值為(255, 0, 0)代表純紅色(255, 255, 255)代表白色(0, 0, 0)代表黑色。3.2 灰度化如何將三維信息壓縮成一維灰度圖也叫灰階圖它只有一個通道。這個通道的數(shù)值代表了該像素點的“亮度”或“明暗程度”。將RGB三個通道的信息融合成一個灰度值有幾種不同的算法核心思想是加權(quán)平均因為人眼對不同顏色的敏感度不同。平均值法最簡單Gray (R G B) / 3這種方法計算簡單但不符合人眼的生理特性因為人眼對綠色最敏感對藍色最不敏感。心理學(xué)公式最常用Pillow和OpenCV默認 這是ITU-R BT.601標準用于標清電視和BT.709標準用于高清電視推薦的亮度公式兩者略有不同但原理相似。BT.601常用于Pillow:Gray 0.299 * R 0.587 * G 0.114 * BBT.709OpenCV的COLOR_BGR2GRAY默認:Gray 0.2126 * R 0.7152 * G 0.0722 * B你可以看到綠色G的權(quán)重最大紅色R次之藍色B最小。這更符合人眼感知到的亮度。我們平時說的“將圖片轉(zhuǎn)為灰度圖”通常就是指采用這種加權(quán)平均法。3.3 二值化黑白圖非黑即白的決策二值圖是灰度圖的進一步極端化。每個像素點只有兩個值0黑和255白或者True/False。關(guān)鍵在于如何確定那個“分水嶺”——閾值Threshold。全局固定閾值法 這是最直觀的方法。你設(shè)定一個固定的閾值T比如127。對于灰度圖中的每個像素值Gray如果Gray T則該像素置為255白。如果Gray T則該像素置為0黑。 這種方法簡單粗暴但效果嚴重依賴于閾值T的選擇和圖片本身的光照均勻性。如果圖片有些地方亮、有些地方暗用一個全局閾值往往會顧此失彼。自適應(yīng)閾值法 這是更高級、更常用的方法。它不采用全局統(tǒng)一的閾值而是根據(jù)像素點周圍小區(qū)域的灰度分布動態(tài)地計算該像素點的閾值。OpenCV中提供了cv2.adaptiveThreshold函數(shù)來實現(xiàn)。原理對于圖片中的每個像素算法會查看它周圍一個blockSize x blockSize大小的鄰域計算這個鄰域內(nèi)像素灰度值的加權(quán)平均或高斯加權(quán)和然后減去一個常數(shù)C得到該像素的局部閾值。優(yōu)點能夠很好地處理光照不均、背景復(fù)雜的圖片例如拍攝的文件、名片等。常見方法cv2.ADAPTIVE_THRESH_MEAN_C鄰域均值。cv2.ADAPTIVE_THRESH_GAUSSIAN_C鄰域高斯加權(quán)和效果通常更好。大津二值化法Otsu‘s Method 這是一種自動確定最佳全局閾值的方法。它基于統(tǒng)計學(xué)尋找一個閾值使得根據(jù)該閾值分割出的前景目標和背景的類內(nèi)方差最小或者說類間方差最大。在OpenCV中可以在cv2.threshold函數(shù)中傳遞cv2.THRESH_OTSU標志來使用。這種方法對于前景和背景灰度對比明顯的雙峰直方圖圖片效果非常好。理解了這些原理我們就能明白生成一張“好看”的黑白圖關(guān)鍵往往不在于灰度化而在于如何選擇或計算二值化的閾值。4. 實戰(zhàn)演練使用Pillow進行圖片轉(zhuǎn)換現(xiàn)在讓我們用Pillow庫一步步實現(xiàn)圖片的灰度化和二值化。我會假設(shè)你有一個名為input.jpg的彩色圖片放在代碼同級目錄下。4.1 基礎(chǔ)操作讀取、顯示與保存首先我們完成最基本的IO操作。from PIL import Image # 1. 打開圖片 img_path “input.jpg” try: img Image.open(img_path) print(f“圖片打開成功格式{img.format} 尺寸{img.size} 模式{img.mode}”) except FileNotFoundError: print(f“錯誤找不到文件 {img_path}”) exit() except Exception as e: print(f“打開圖片時發(fā)生未知錯誤{e}”) exit() # 2. 顯示圖片如果環(huán)境支持如Jupyter Notebook或某些IDE # img.show() # 3. 轉(zhuǎn)換色彩模式并保存 # 轉(zhuǎn)換為灰度圖‘L’模式8位像素黑白 gray_img img.convert(‘L’) gray_img.save(“output_gray_pillow.jpg”) print(“灰度圖已保存為 output_gray_pillow.jpg”) # 注意直接convert(‘1’)是二值化但方法固定通常效果不佳 # binary_img img.convert(‘1’) # 不推薦直接使用img.mode會告訴你圖片當前的色彩模式常見的有‘RGB’,‘RGBA’帶透明度,‘L’灰度,‘1’二值黑白等。convert(‘L’)就是調(diào)用我們前面提到的心理學(xué)公式進行灰度轉(zhuǎn)換。4.2 實現(xiàn)高質(zhì)量的二值化Pillow的.convert(‘1’)方法使用一個固定的閾值通常是128進行二值化效果不可控。我們需要自己實現(xiàn)閾值處理。方法一使用point()方法和Lambda函數(shù)point()方法可以對圖像每個像素應(yīng)用一個查找表LUT或函數(shù)。我們可以利用它來實現(xiàn)閾值分割。from PIL import Image def binary_threshold_pillow(input_path, output_path, threshold128): “”” 使用Pillow進行固定閾值二值化 Args: input_path: 輸入圖片路徑 output_path: 輸出圖片路徑 threshold: 閾值 (0-255) “”” # 打開并轉(zhuǎn)為灰度圖 img Image.open(input_path).convert(‘L’) # 定義二值化函數(shù)大于等于閾值 - 255白 否則 - 0黑 # 注意Pillow的point函數(shù)要求函數(shù)接收一個參數(shù)像素值返回一個新值 binary_func lambda x: 255 if x threshold else 0 # 應(yīng)用函數(shù)?!?’模式表示1位像素黑白但這里我們用‘L’模式保存0和255更直觀 binary_img img.point(binary_func, mode‘L’) # mode‘L’ 表示輸出仍是8位灰度但值只有0和255 binary_img.save(output_path) print(f“二值化圖片已保存至 {output_path} 使用的閾值為 {threshold}”) # 調(diào)用函數(shù) binary_threshold_pillow(“input.jpg”, “output_binary_pillow_fixed.jpg”, threshold150)方法二使用Numpy數(shù)組進行更靈活的操作雖然Pillow本身沒有自適應(yīng)閾值函數(shù)但我們可以結(jié)合Numpy來實現(xiàn)更復(fù)雜的邏輯。這展示了Python生態(tài)的靈活性用Pillow讀圖用Numpy計算再用Pillow存圖。from PIL import Image import numpy as np def adaptive_threshold_pillow_numpy(input_path, output_path, block_size11, c2): “”” 模擬自適應(yīng)閾值均值法使用PillowNumpy 注意這是一個簡化的、基于滑動窗口的均值法實現(xiàn)效率不如OpenCV的優(yōu)化算法。 適用于學(xué)習(xí)和理解原理處理大圖可能較慢。 Args: block_size: 鄰域大小必須為奇數(shù) c: 從平均值中減去的常數(shù) “”” # 1. 用Pillow打開并轉(zhuǎn)灰度 pil_img Image.open(input_path).convert(‘L’) img_array np.array(pil_img) # 將PIL Image轉(zhuǎn)換為Numpy數(shù)組 height, width img_array.shape binary_array np.zeros((height, width), dtypenp.uint8) # 2. 計算積分圖可選用于加速這里為了清晰展示原理使用簡單循環(huán) # 簡單實現(xiàn)對每個像素計算其鄰域均值 offset block_size // 2 for y in range(offset, height - offset): for x in range(offset, width - offset): # 獲取鄰域 neighborhood img_array[y-offset:yoffset1, x-offset:xoffset1] # 計算局部均值 local_mean np.mean(neighborhood) # 二值化決策 binary_array[y, x] 255 if img_array[y, x] (local_mean - c) else 0 # 邊界區(qū)域處理簡單復(fù)制邊緣值或置0 binary_array[:offset, :] 0 binary_array[-offset:, :] 0 binary_array[:, :offset] 0 binary_array[:, -offset:] 0 # 3. 將Numpy數(shù)組轉(zhuǎn)回PIL Image并保存 binary_img Image.fromarray(binary_array, mode‘L’) binary_img.save(output_path) print(f“自適應(yīng)二值化圖片已保存至 {output_path}”) # 調(diào)用函數(shù)處理小圖演示大圖慢 adaptive_threshold_pillow_numpy(“input.jpg”, “output_binary_pillow_adaptive.jpg”, block_size11, c2)實操心得在真實項目中如果確實需要在Pillow為主的項目中做自適應(yīng)二值化更推薦使用scikit-image庫的skimage.filters.threshold_local函數(shù)它經(jīng)過優(yōu)化速度更快?;蛘吒纱嘤肙penCV來處理這個步驟。上面的Numpy循環(huán)實現(xiàn)主要是為了揭示算法原理讓你明白“自適應(yīng)”是怎么算出來的。5. 實戰(zhàn)演練使用OpenCV進行圖片轉(zhuǎn)換OpenCV的處理流程和Pillow有顯著不同它完全基于Numpy數(shù)組并且顏色通道順序默認是BGR藍綠紅而不是RGB這是新手最容易踩的坑。5.1 基礎(chǔ)操作讀取、顯示與保存import cv2 # 1. 讀取圖片 # cv2.imread() 的第二個參數(shù)是標志位 # cv2.IMREAD_COLOR: 加載彩色圖默認忽略透明度。 # cv2.IMREAD_GRAYSCALE: 以灰度模式加載。 # cv2.IMREAD_UNCHANGED: 加載原圖包括Alpha通道。 img_path “input.jpg” img_bgr cv2.imread(img_path) # 默認以BGR格式讀取彩色圖 if img_bgr is None: print(f“錯誤無法讀取圖片 {img_path}請檢查路徑。”) exit() print(f“圖片尺寸高 寬 通道數(shù){img_bgr.shape}”) # 對于彩色圖shape為 (height, width, 3) print(f“數(shù)據(jù)類型{img_bgr.dtype}”) # 通常是 uint8 # 2. 顯示圖片需要GUI后端支持如桌面環(huán)境 # cv2.imshow(‘Original Image (BGR)’, img_bgr) # cv2.waitKey(0) # 等待任意按鍵 # cv2.destroyAllWindows() # 3. 轉(zhuǎn)換為灰度圖 # 使用 cvtColor 進行色彩空間轉(zhuǎn)換 img_gray cv2.cvtColor(img_bgr, cv2.COLOR_BGR2GRAY) print(f“灰度圖尺寸{img_gray.shape}”) # 此時shape為 (height, width) # 4. 保存圖片 cv2.imwrite(“output_gray_opencv.jpg”, img_gray) print(“灰度圖已保存為 output_gray_opencv.jpg”)關(guān)鍵點cv2.imread()讀進來的是BGR數(shù)組如果你用其他庫如Matplotlib顯示或者用Pillow保存可能會發(fā)現(xiàn)顏色不對。如果需要RGB格式記得轉(zhuǎn)換img_rgb cv2.cvtColor(img_bgr, cv2.COLOR_BGR2RGB)。5.2 多種二值化方法實戰(zhàn)OpenCV在cv2.threshold()函數(shù)中集成了多種二值化方法。方法一固定閾值法import cv2 def simple_threshold(input_path, output_path, thresh127, maxval255): “”” 固定閾值二值化 Args: thresh: 閾值 maxval: 當像素值超過閾值時賦予的新值 “”” img_gray cv2.imread(input_path, cv2.IMREAD_GRAYSCALE) if img_gray is None: print(“讀取圖片失敗”) return # cv2.threshold 返回兩個值 # ret: 實際使用的閾值在使用了OTSU等方法時有用 # binary_img: 二值化后的圖像 ret, binary_img cv2.threshold(img_gray, thresh, maxval, cv2.THRESH_BINARY) cv2.imwrite(output_path, binary_img) print(f“固定閾值二值化完成使用的閾值{ret} 圖片已保存至 {output_path}”) simple_threshold(“input.jpg”, “output_binary_opencv_fixed.jpg”, thresh150)方法二大津法OTSU自動閾值import cv2 def otsu_threshold(input_path, output_path): “”” 大津法自動閾值二值化 “”” img_gray cv2.imread(input_path, cv2.IMREAD_GRAYSCALE) if img_gray is None: return # 將閾值參數(shù)設(shè)為0并使用 cv2.THRESH_OTSU 標志 # 函數(shù)會自動計算最佳閾值并通過ret返回 ret, binary_img cv2.threshold(img_gray, 0, 255, cv2.THRESH_BINARY cv2.THRESH_OTSU) cv2.imwrite(output_path, binary_img) print(f“OTSU二值化完成自動計算的最佳閾值為{ret:.2f} 圖片已保存至 {output_path}”) otsu_threshold(“input.jpg”, “output_binary_opencv_otsu.jpg”)方法三自適應(yīng)閾值法推薦用于光照不均圖片import cv2 def adaptive_threshold(input_path, output_path, block_size11, c2): “”” 自適應(yīng)閾值二值化 Args: block_size: 鄰域大小必須為正奇數(shù)。決定了計算閾值的區(qū)域大小。 c: 從平均值或加權(quán)平均值中減去的常數(shù)。用于微調(diào)閾值。 “”” img_gray cv2.imread(input_path, cv2.IMREAD_GRAYSCALE) if img_gray is None: return # 應(yīng)用自適應(yīng)閾值 # cv2.ADAPTIVE_THRESH_MEAN_C: 閾值是鄰域的平均值減去常數(shù)C。 # cv2.ADAPTIVE_THRESH_GAUSSIAN_C: 閾值是鄰域的高斯加權(quán)和減去常數(shù)C。 binary_img cv2.adaptiveThreshold(img_gray, 255, # maxValue 二值化后的最大值 cv2.ADAPTIVE_THRESH_GAUSSIAN_C, # 自適應(yīng)方法 cv2.THRESH_BINARY, # 閾值類型 block_size, # 鄰域大小 c) # 常數(shù) cv2.imwrite(output_path, binary_img) print(f“自適應(yīng)二值化完成鄰域大小 {block_size} 常數(shù)C{c} 圖片已保存至 {output_path}”) adaptive_threshold(“input.jpg”, “output_binary_opencv_adaptive.jpg”, block_size11, c2)參數(shù)選擇經(jīng)驗block_size通常取奇數(shù)如3, 5, 7, 11, 25等。值越大考慮的鄰域范圍越廣對整體光照變化的適應(yīng)性越強但可能會模糊細節(jié)。對于文本圖片11或15是個不錯的起點。c一個微調(diào)參數(shù)。如果處理后圖片背景你希望是白色的部分仍有黑色噪點可以嘗試減小c值例如從2減到0或-2使得閾值降低更多像素被判定為白色。反之如果前景黑色文字變細或斷裂可以增大c值。6. 進階技巧與性能優(yōu)化掌握了基本操作后我們來看看如何讓代碼更健壯、更高效并處理一些復(fù)雜情況。6.1 批量處理與異常處理實際工作中我們很少只處理一張圖。下面是一個健壯的批量處理腳本框架。import os import cv2 from pathlib import Path from PIL import Image, ImageFile # 防止處理損壞圖片時出錯 ImageFile.LOAD_TRUNCATED_IMAGES True def batch_convert_to_binary(input_dir, output_dir, library‘opencv’, method‘a(chǎn)daptive’, **kwargs): “”” 批量將目錄下的圖片轉(zhuǎn)為二值圖 Args: input_dir: 輸入圖片目錄 output_dir: 輸出目錄 library: ‘opencv’ 或 ‘pillow’ method: ‘fixed’, ‘otsu’, ‘a(chǎn)daptive’ **kwargs: 傳遞給具體方法的參數(shù)如 threshold, block_size, c 等 “”” input_path Path(input_dir) output_path Path(output_dir) output_path.mkdir(parentsTrue, exist_okTrue) # 創(chuàng)建輸出目錄 supported_extensions (’.jpg’, ‘.jpeg’, ‘.png’, ‘.bmp’, ‘.tiff’, ‘.webp’) for img_file in input_path.iterdir(): if img_file.suffix.lower() not in supported_extensions: print(f“跳過非圖片文件{img_file.name}”) continue output_file output_path / f“{img_file.stem}_binary{img_file.suffix}” try: if library.lower() ‘opencv’: img_gray cv2.imread(str(img_file), cv2.IMREAD_GRAYSCALE) if img_gray is None: raise IOError(f“OpenCV無法讀取 {img_file.name}”) if method ‘fixed’: thresh kwargs.get(‘threshold’, 127) _, binary_img cv2.threshold(img_gray, thresh, 255, cv2.THRESH_BINARY) elif method ‘otsu’: _, binary_img cv2.threshold(img_gray, 0, 255, cv2.THRESH_BINARY cv2.THRESH_OTSU) elif method ‘a(chǎn)daptive’: block_size kwargs.get(‘block_size’, 11) c kwargs.get(‘c’, 2) binary_img cv2.adaptiveThreshold(img_gray, 255, cv2.ADAPTIVE_THRESH_GAUSSIAN_C, cv2.THRESH_BINARY, block_size, c) else: raise ValueError(f“不支持的OpenCV方法{method}”) cv2.imwrite(str(output_file), binary_img) elif library.lower() ‘pillow’: img Image.open(img_file).convert(‘L’) thresh kwargs.get(‘threshold’, 128) binary_func lambda x: 255 if x thresh else 0 binary_img img.point(binary_func, mode‘L’) binary_img.save(output_file) else: raise ValueError(f“不支持的庫{library}”) print(f“處理成功{img_file.name} - {output_file.name}”) except Exception as e: print(f“處理失敗{img_file.name} 錯誤{e}”) # 可以選擇記錄日志或者將失敗的文件移動到另一個文件夾 print(f“批量處理完成輸出目錄{output_path}”) # 使用示例 batch_convert_to_binary(‘./source_images’, ‘./binary_results’, library‘opencv’, method‘a(chǎn)daptive’, block_size15, c3)6.2 處理帶透明通道的圖片PNGPNG圖片可能帶有Alpha通道透明度。直接轉(zhuǎn)換為灰度或二值圖時需要決定如何處理透明區(qū)域。from PIL import Image def convert_png_with_alpha(input_path, output_gray_path, output_binary_path, background_color(255, 255, 255)): “”” 處理帶透明通道的PNG圖片。 先將透明背景合成到指定顏色默認白色上再進行轉(zhuǎn)換。 Args: background_color: 用于替換透明背景的RGB顏色。 “”” img Image.open(input_path) # 檢查是否有Alpha通道 if img.mode in (‘RGBA’, ‘LA’) or (img.mode ‘P’ and ‘transparency’ in img.info): # 創(chuàng)建一個白色背景的RGB圖像 background Image.new(‘RGB’, img.size, background_color) # 如果原圖是RGBA需要先轉(zhuǎn)換為RGB模式合并Alpha通道 if img.mode ! ‘RGBA’: img img.convert(‘RGBA’) # 將原圖粘貼到背景上使用原圖的Alpha通道作為蒙版 background.paste(img, maskimg.split()[-1]) # split()[-1] 獲取Alpha通道 img background print(“已處理透明背景?!? else: # 如果沒有透明通道直接轉(zhuǎn)換為RGB確保一致性 img img.convert(‘RGB’) # 轉(zhuǎn)換為灰度圖 gray_img img.convert(‘L’) gray_img.save(output_gray_path) # 二值化使用固定閾值示例 threshold 160 # 對于白底背景閾值可以設(shè)高一點 binary_img gray_img.point(lambda x: 255 if x threshold else 0, mode‘L’) binary_img.save(output_binary_path) print(f“處理完成?;叶葓D{output_gray_path} 二值圖{output_binary_path}”) convert_png_with_alpha(“input_with_alpha.png”, “output_gray_no_alpha.jpg”, “output_binary_no_alpha.jpg”)6.3 性能優(yōu)化利用Numpy向量化操作當需要自定義復(fù)雜的像素級操作時直接使用Pillow的像素訪問img.getpixel()/img.putpixel()會非常慢。最佳實踐是先將圖片轉(zhuǎn)換為Numpy數(shù)組利用Numpy的向量化操作避免顯式循環(huán)處理完再轉(zhuǎn)回去。from PIL import Image import numpy as np import time def slow_pixel_loop(img_path): “””不推薦的慢速循環(huán)方法“”” img Image.open(img_path).convert(‘L’) width, height img.size new_img Image.new(‘L’, (width, height)) start time.time() for x in range(width): for y in range(height): pixel img.getpixel((x, y)) # 假設(shè)做一個簡單的反相操作 new_pixel 255 - pixel new_img.putpixel((x, y), new_pixel) print(f“慢速循環(huán)耗時{time.time() - start:.2f}秒”) return new_img def fast_numpy_vectorization(img_path): “””推薦的Numpy向量化方法“”” img Image.open(img_path).convert(‘L’) img_array np.array(img) start time.time() # 一行代碼完成整個數(shù)組的反相操作 inverted_array 255 - img_array print(f“Numpy向量化耗時{time.time() - start:.4f}秒”) return Image.fromarray(inverted_array, mode‘L’) # 測試 img_path “input.jpg” # slow_img slow_pixel_loop(img_path) # 對于大圖這會非常慢 fast_img fast_numpy_vectorization(img_path) fast_img.save(“output_inverted_fast.jpg”)對于二值化Numpy向量化同樣高效import numpy as np from PIL import Image def binary_threshold_numpy_fast(input_path, output_path, threshold128): img Image.open(input_path).convert(‘L’) arr np.array(img) # 使用布爾索引進行向量化閾值判斷 binary_arr np.where(arr threshold, 255, 0).astype(np.uint8) binary_img Image.fromarray(binary_arr, mode‘L’) binary_img.save(output_path)7. 常見問題排查與效果調(diào)優(yōu)即使代碼正確處理效果也可能不盡如人意。這里匯總幾個典型問題及解決方案。7.1 問題二值化后文字斷裂或背景有噪點原因分析文字斷裂閾值設(shè)得過高導(dǎo)致本屬于文字的淺灰色部分被誤判為白色背景。背景噪點閾值設(shè)得過低或者圖片本身背景不均勻、有陰影、有水印、有掃描噪點。解決方案嘗試自適應(yīng)閾值這是解決光照不均問題的首選。調(diào)整block_size和c參數(shù)。背景有噪點嘗試增大block_size如從11調(diào)到25或減小c值如從2調(diào)到0或-2。文字斷裂嘗試減小block_size如從25調(diào)到11或增大c值如從2調(diào)到5。預(yù)處理——濾波在二值化前先對灰度圖進行濾波平滑噪點。import cv2 img_gray cv2.imread(‘noisy_doc.jpg’, cv2.IMREAD_GRAYSCALE) # 使用高斯模糊平滑噪點 img_blurred cv2.GaussianBlur(img_gray, (5, 5), 0) # (5,5)是核大小必須是正奇數(shù)0是標準差由內(nèi)核大小自動計算 # 然后再對 img_blurred 進行二值化預(yù)處理——形態(tài)學(xué)操作二值化后可以使用形態(tài)學(xué)操作來修復(fù)斷裂或去除小噪點。import cv2 import numpy as np # 假設(shè) binary_img 是二值化后的圖像黑底白字 kernel np.ones((2,2), np.uint8) # 定義一個2x2的小矩形核 # 閉運算先膨脹后腐蝕用于填充細小空洞連接斷裂部分 binary_closed cv2.morphologyEx(binary_img, cv2.MORPH_CLOSE, kernel) # 開運算先腐蝕后膨脹用于消除小白點前景噪聲 binary_opened cv2.morphologyEx(binary_img, cv2.MORPH_OPEN, kernel)7.2 問題處理后的圖片顏色異常發(fā)藍/發(fā)紅原因分析幾乎可以肯定是色彩通道順序混淆。OpenCV使用BGR而Pillow、Matplotlib等大多數(shù)其他庫使用RGB。如果你用OpenCV讀取圖片處理后用Pillow保存或顯示或者反過來就會出問題。解決方案在庫之間傳遞圖片數(shù)據(jù)時統(tǒng)一通道順序。import cv2 from PIL import Image # 場景用OpenCV處理想用Pillow保存或顯示 img_bgr cv2.imread(‘input.jpg’) # ... 進行一些處理假設(shè)仍在BGR空間 ... # 保存前轉(zhuǎn)換為RGB img_rgb cv2.cvtColor(img_bgr, cv2.COLOR_BGR2RGB) # 轉(zhuǎn)換為PIL Image pil_img Image.fromarray(img_rgb) pil_img.save(‘output_with_pillow.jpg’) # 場景用Pillow讀取想用OpenCV處理 pil_img Image.open(‘input.jpg’).convert(‘RGB’) img_array np.array(pil_img) # 此時是RGB img_bgr cv2.cvtColor(img_array, cv2.COLOR_RGB2BGR) # 轉(zhuǎn)為BGR供OpenCV使用 # ... 使用OpenCV處理 img_bgr ...7.3 問題處理大圖片時內(nèi)存不足或速度慢原因分析高分辨率圖片如4000x6000以上的數(shù)組非常龐大一次性加載到內(nèi)存并進行復(fù)雜操作可能導(dǎo)致內(nèi)存溢出MemoryError。解決方案使用Pillow的分塊處理Pillow的Image對象支持load()方法可以分塊訪問像素但編程較復(fù)雜。降低分辨率下采樣如果最終輸出不需要那么高的分辨率可以先縮小圖片。from PIL import Image img Image.open(‘huge_image.jpg’) # 計算新尺寸例如將寬高縮小一半 new_size (img.width // 2, img.height // 2) img_small img.resize(new_size, Image.Resampling.LANCZOS) # 高質(zhì)量重采樣 # 對 img_small 進行處理使用生成器或流式處理對于極端大的圖片可以考慮使用像imageio這樣的庫進行流式讀取和處理。優(yōu)化算法確保使用了向量化操作Numpy避免Python層面的顯式循環(huán)。7.4 效果調(diào)優(yōu)實戰(zhàn)以文檔掃描圖片為例假設(shè)我們有一張用手機拍攝的文檔照片可能存在傾斜、陰影、光照不均。 一個相對魯棒的預(yù)處理二值化流程可能是import cv2 import numpy as np def robust_document_binarization(image_path, output_path): “”” 一個針對文檔圖片的魯棒二值化流程示例 “”” # 1. 讀取為灰度圖 gray cv2.imread(image_path, cv2.IMREAD_GRAYSCALE) if gray is None: return # 2. 可選矯正傾斜這里需要額外的算法如霍夫變換找直線略 # deskewed deskew(gray) # 3. 去除噪點輕度高斯模糊 blurred cv2.GaussianBlur(gray, (3, 3), 0) # 4. 使用自適應(yīng)閾值高斯加權(quán)法通常比均值法對噪點更魯棒 binary cv2.adaptiveThreshold(blurred, 255, cv2.ADAPTIVE_THRESH_GAUSSIAN_C, cv2.THRESH_BINARY, 15, # block_size根據(jù)文檔字體大小調(diào)整 5) # c 根據(jù)背景干凈程度調(diào)整 # 5. 后處理使用形態(tài)學(xué)閉運算連接可能斷裂的筆畫 kernel np.ones((1, 1), np.uint8) # 非常小的核僅做微調(diào) binary cv2.morphologyEx(binary, cv2.MORPH_CLOSE, kernel) # 6. 可選如果背景仍有零星黑點可以用開運算去除但可能侵蝕細小筆畫 # kernel2 np.ones((1,1), np.uint8) # binary cv2.morphologyEx(binary, cv2.MORPH_OPEN, kernel2) cv2.imwrite(output_path, binary) print(“文檔二值化處理完成?!? robust_document_binarization(‘document_photo.jpg’, ‘document_binary_clean.jpg’)這個流程不是萬能的但涵蓋了去噪、自適應(yīng)閾值、形態(tài)學(xué)后處理等關(guān)鍵步驟你可以根據(jù)自己圖片的具體情況調(diào)整參數(shù)。核心思想是預(yù)處理降噪、矯正 魯棒的二值化方法自適應(yīng) 后處理形態(tài)學(xué)。