習(xí)的自然場景中文OCR識(shí)別系統(tǒng)設(shè)計(jì)與實(shí)現(xiàn))
簡介本資源是一套完整的基于Python深度學(xué)習(xí)的自然場景中文OCR識(shí)別系統(tǒng)面向本科畢設(shè)、科研入門及輕量級(jí)項(xiàng)目落地開發(fā)者解決復(fù)雜背景下中文字含豎排、繁體的端到端識(shí)別難題。壓縮包共715個(gè)文件涵蓋23個(gè)核心Python腳本含model.py、utils.py、config.py等模塊化代碼、35張PNG/17張JPG測試圖像、3個(gè)ONNX/MNN模型文件、135個(gè)XML標(biāo)注數(shù)據(jù)及Linux/C推理程序.cpp/.sh/.bat另有Web前端HTML/CSS/JS文件與仿宋_GB2312.ttf字體支持中文渲染整體大小48.08MB。已有64人學(xué)習(xí)下載。用戶可直接運(yùn)行Web界面上傳圖片識(shí)別復(fù)現(xiàn)CRNN模型訓(xùn)練與推理全流程配套詳細(xì)運(yùn)行說明文檔覆蓋環(huán)境配置、模型加載、前后端聯(lián)調(diào)及邊緣設(shè)備移植要點(diǎn)目錄結(jié)構(gòu)分層清晰含data、model、web、cpp、linux等獨(dú)立模塊便于理解系統(tǒng)架構(gòu)與二次開發(fā)。 自然場景下的中文OCR和掃描件識(shí)別完全是兩碼事。我最早拿手機(jī)拍了一塊店鋪招牌丟給傳統(tǒng)OCR引擎結(jié)果識(shí)別出來的內(nèi)容基本沒法看——光照不均勻、透視畸變、藝術(shù)字體、豎排牌匾傳統(tǒng)方案面對(duì)這些情況幾乎毫無招架之力。后來轉(zhuǎn)向深度學(xué)習(xí)方案把檢測和識(shí)別拆成兩個(gè)模型才真正把準(zhǔn)確率拉到了可用水平。這篇文章就從這個(gè)實(shí)際項(xiàng)目展開一個(gè)基于Python深度學(xué)習(xí)實(shí)現(xiàn)的自然場景中文文字OCR識(shí)別系統(tǒng)帶前端Web界面支持橫版和豎版文字。完整源碼、運(yùn)行說明和預(yù)訓(xùn)練模型都在包里拿到就能跑。這套系統(tǒng)解決的是真實(shí)世界的文字識(shí)別需求手機(jī)隨手拍的照片、街邊招牌、路牌、海報(bào)、書籍封面、漫畫對(duì)話框、豎排古建筑牌匾。它能做的事概括起來就一句話——輸入一張圖片輸出圖片里所有文字內(nèi)容以及對(duì)應(yīng)的位置坐標(biāo)。適合正在入門OCR方向的開發(fā)者、需要在自有產(chǎn)品里集成文字識(shí)別能力的工程師以及準(zhǔn)備做圖像處理方向課程設(shè)計(jì)的同學(xué)參考。下面我把整個(gè)系統(tǒng)的設(shè)計(jì)思路、核心實(shí)現(xiàn)、訓(xùn)練過程和踩坑經(jīng)歷完整梳理一遍。1. 系統(tǒng)整體設(shè)計(jì)與技術(shù)選型1.1 為什么用Python加深度學(xué)習(xí)做場景文字識(shí)別先聊聊技術(shù)選型背后的邏輯。傳統(tǒng)OCR方案比如Tesseract處理規(guī)整的印刷體文檔掃描件時(shí)效果確實(shí)還行但放到自然場景里就直接暴露短板。自然場景的文字有幾個(gè)顯著特點(diǎn)背景復(fù)雜文字經(jīng)常跟招牌紋理、墻面圖案混在一起光照條件不可控有陰影、反光、暗部字體千變?nèi)f化楷書、行書、藝術(shù)字、帶描邊的字版面不規(guī)整文字是斜的、彎的甚至一整列豎排下來圖片分辨率也參差不齊手機(jī)拍的、監(jiān)控截圖的都有。傳統(tǒng)方法依賴閾值分割、連通域分析、模板匹配這些手段面對(duì)上述情況很難穩(wěn)定工作。一副邊緣被遮擋的招牌連通域直接斷成好幾塊陰影落在字面上閾值分割出來的文字殘缺不全。這些問題不是調(diào)調(diào)參數(shù)就能解決的是特征表達(dá)能力的上限問題。深度學(xué)習(xí)方案的優(yōu)勢在于整個(gè)流程端到端可訓(xùn)練檢測模塊通過卷積神經(jīng)網(wǎng)絡(luò)直接回歸文本區(qū)域的位置識(shí)別模塊對(duì)裁剪出來的文字圖像做特征提取和序列解碼。網(wǎng)絡(luò)在大量真實(shí)場景數(shù)據(jù)上學(xué)到的特征表達(dá)對(duì)光照變化、字體差異、復(fù)雜背景的魯棒性遠(yuǎn)優(yōu)于人工設(shè)計(jì)的特征。這也是為什么近幾年的OCR技術(shù)基本都被深度學(xué)習(xí)方法統(tǒng)治了。Python在這個(gè)領(lǐng)域的生態(tài)優(yōu)勢無法忽略。PyTorch、TensorFlow、OpenCV、PaddleOCR這些工具鏈都圍繞Python展開實(shí)驗(yàn)迭代、模型調(diào)試、快速部署都很方便。做OCR研究的公開代碼、預(yù)訓(xùn)練模型、數(shù)據(jù)集絕大多數(shù)都是Python生態(tài)的用Python能最快站在前人的肩膀上做工程落地。1.2 整體架構(gòu)檢測加識(shí)別兩階段方案目前自然場景OCR的主流方案是兩階段管線先用文本檢測模型從整圖中定位出文字區(qū)域再把每個(gè)文字區(qū)域裁切出來送入識(shí)別模型得到字符序列。這套系統(tǒng)也沿用了這個(gè)架構(gòu)。為什么不用端到端的單模型方案端到端文本識(shí)別比如把檢測和識(shí)別融合進(jìn)一個(gè)網(wǎng)絡(luò)雖然看起來更簡潔但實(shí)現(xiàn)復(fù)雜度高訓(xùn)練數(shù)據(jù)要求更嚴(yán)格而且解耦性差——檢測模塊想單獨(dú)調(diào)優(yōu)或者替換的時(shí)候會(huì)很被動(dòng)。兩階段方案的好處是每一段都可以獨(dú)立優(yōu)化檢測不準(zhǔn)就換更強(qiáng)的檢測模型識(shí)別不準(zhǔn)就單獨(dú)迭代識(shí)別模型互不干擾。工程上維護(hù)起來也更舒服。檢測階段用的是DBNet全稱Differentiable Binarization。它對(duì)輸入圖像生成一個(gè)文字區(qū)域概率圖再通過可微二值化操作把概率圖轉(zhuǎn)成分割掩碼最后用輪廓提取拿到文本框。DBNet能在復(fù)雜背景下比較準(zhǔn)確地框出文字區(qū)域而且對(duì)有向文本和豎排文本都有不錯(cuò)的支持這正好契合本項(xiàng)目要處理自然場景的需求。識(shí)別階段采用CRNN加CTC的結(jié)構(gòu)。CRNN是經(jīng)典三件套卷積層從輸入圖像中提取特征序列雙向LSTM對(duì)特征序列建模上下文依賴CTC損失函數(shù)解決輸入序列和輸出序列長度不一致的時(shí)序?qū)R問題。CTC最大的優(yōu)勢是不需要逐字符的位置標(biāo)注只要提供最終的文本內(nèi)容就能訓(xùn)練極大降低了數(shù)據(jù)標(biāo)注成本。為什么不選基于Transformer的方案CRNN結(jié)構(gòu)更簡單訓(xùn)練穩(wěn)定性好對(duì)中文場景下數(shù)據(jù)量要求沒那么苛刻。Transformer雖然在大規(guī)模數(shù)據(jù)上表現(xiàn)更強(qiáng)但中文識(shí)別任務(wù)字符集大常用漢字就有三千多個(gè)數(shù)據(jù)量不夠時(shí)Transformer很容易過擬合。CRNN配合CTC在中等規(guī)模數(shù)據(jù)集上就能達(dá)到不錯(cuò)的精度推理速度也快CPU上也能實(shí)時(shí)跑。對(duì)于工程落地來說穩(wěn)定省事比什么都重要。1.3 豎版文字支持的設(shè)計(jì)思路豎版文字是自然場景OCR中特別容易被忽略但實(shí)際又經(jīng)常遇到的需求。古建筑牌匾、店鋪豎招牌、書脊標(biāo)題、海報(bào)裝幀、漫畫對(duì)話氣泡到處都有豎排中文。國內(nèi)外很多OCR系統(tǒng)第一版都沒有考慮豎排場景遇到豎排文字就束手無策。豎版識(shí)別的難點(diǎn)在于檢測模型如果只按水平方向回歸文本區(qū)域豎排文字就會(huì)被壓縮成一條特別窄長的小圖。這種圖正??s放到識(shí)別模型的輸入尺寸后每個(gè)字符都被水平擠壓變形識(shí)別模型基本猜不出是什么字。這個(gè)系統(tǒng)的做法分三步檢測階段輸出帶旋轉(zhuǎn)角度的文本框用四頂點(diǎn)坐標(biāo)表示不做強(qiáng)制水平矯正根據(jù)文本框的寬高比判斷文字方向高度明顯大于寬度時(shí)判定為豎排文本對(duì)豎排文本框做90度旋轉(zhuǎn)后再送入識(shí)別模型把豎排問題轉(zhuǎn)化成橫排問題處理識(shí)別結(jié)果再映射回原圖坐標(biāo)輸出關(guān)鍵收益在于識(shí)別模型不需要單獨(dú)訓(xùn)練一套豎排權(quán)重一套橫排識(shí)別模型就能覆蓋豎排場景工程量節(jié)省一大截。這個(gè)思路本質(zhì)上就是問題轉(zhuǎn)換把不擅長的輸入形態(tài)轉(zhuǎn)成擅長處理的形態(tài)。2. 環(huán)境搭建與運(yùn)行準(zhǔn)備2.1 Python深度學(xué)習(xí)環(huán)境配置項(xiàng)目使用的基礎(chǔ)環(huán)境是Python 3.8加PyTorch 1.10訓(xùn)練用的顯卡是RTX 306012G顯存。說實(shí)話這個(gè)配置在深度學(xué)習(xí)里算入門級(jí)但跑這個(gè)項(xiàng)目的訓(xùn)練和推理完全夠用。如果沒有GPU純CPU也能跑就是單張圖推理時(shí)間會(huì)長一些后面會(huì)具體聊部署優(yōu)化的方式。關(guān)鍵依賴庫清單如下torch、torchvision深度學(xué)習(xí)框架模型訓(xùn)練和推理的核心opencv-python圖像讀取、縮放、輪廓查找、透視變換等圖像處理操作numpy數(shù)組運(yùn)算坐標(biāo)變換和概率圖后處理依賴它Pillow前端上傳圖片的讀取和處理Flask提供Web后端服務(wù)pyclipper、shapelyDBNet后處理中多邊形裁剪和IOU計(jì)算用到的幾何工具庫安裝環(huán)節(jié)有幾個(gè)容易踩的坑先給大家提個(gè)醒。PyTorch的CUDA版本必須和顯卡驅(qū)動(dòng)匹配安裝前先查清楚自己機(jī)器的CUDA版本用nvidia-smi看一眼。opencv-python和shapely在某些Python版本下沒有預(yù)編譯的wheel包直接pip安裝可能報(bào)錯(cuò)建議鎖定版本安裝。國內(nèi)網(wǎng)絡(luò)環(huán)境下pip默認(rèn)源下載速度經(jīng)常讓人崩潰建議一開始就把鏡像源換成清華或阿里云的。另外不要忘記安裝gunicornFlask自帶的開發(fā)服務(wù)器并發(fā)能力太弱后面部署時(shí)會(huì)用到。2.2 源碼結(jié)構(gòu)和模型文件說明項(xiàng)目壓縮包解壓后的目錄結(jié)構(gòu)大致如下ocr_system/ ├── app.py # Flask Web服務(wù)入口 ├── predictor.py # OCR推理封裝類 ├── models/ │ ├── det/ │ │ └── dbnet_resnet50.pth # 文本檢測模型 │ ├── rec/ │ │ ├── crnn_resnet34.pth # 文本識(shí)別模型 │ │ └── charset.txt # 字符集文件 ├── templates/ │ └── index.html # 前端頁面 ├── static/ │ ├── css/ │ └── js/ ├── requirements.txt # 依賴清單 └── README.md # 運(yùn)行說明檢測模型參數(shù)文件大約80MB識(shí)別模型約40MB。這兩個(gè)模型都是在公開數(shù)據(jù)集基礎(chǔ)上額外加了一批自己標(biāo)注的真實(shí)場景數(shù)據(jù)微調(diào)得到的。檢測模型能覆蓋自然場景中的招牌、路牌、海報(bào)、電子屏幕等常見文字區(qū)域識(shí)別模型支持簡體中文字符集約3000個(gè)常用字加上數(shù)字、英文大小寫和常用標(biāo)點(diǎn)。charset.txt這個(gè)文件很容易被忽略但極其重要。識(shí)別模型的輸出維度就是字符集的大小如果實(shí)際使用場景里包含字符集以外的生僻字或特殊符號(hào)識(shí)別結(jié)果會(huì)是空或者錯(cuò)字。遇到這種情況需要把新字符加進(jìn)字符集文件對(duì)應(yīng)調(diào)整模型輸出層維度并重新訓(xùn)練識(shí)別模型的最后一層。3. 核心實(shí)現(xiàn)細(xì)節(jié)與關(guān)鍵代碼解析3.1 文本檢測模塊的推理實(shí)現(xiàn)檢測模塊的核心流程是讀圖、縮放、網(wǎng)絡(luò)前向傳播、后處理、輸出文本框列表。圖像縮放這個(gè)環(huán)節(jié)有個(gè)細(xì)節(jié)必須注意。DBNet訓(xùn)練時(shí)通常把圖像短邊縮放到640像素長邊限制在2560以內(nèi)。推理的時(shí)候縮放的配置要和訓(xùn)練時(shí)保持一致否則檢測尺度不一致會(huì)導(dǎo)致小字漏檢或者大字被切成多塊這個(gè)偏差在自然場景圖片上尤其明顯因?yàn)樵瓐D分辨率往往差異很大。后處理部分包含概率圖二值化、輪廓查找和文本框構(gòu)建。DBNet的可微二值化是訓(xùn)練時(shí)用的技巧推理階段直接用固定閾值對(duì)概率圖做二值化閾值取0.3能獲得比較均衡的檢測效果低于這個(gè)值容易把背景也框進(jìn)來高于這個(gè)值則可能漏掉邊緣比較模糊的文字。輪廓查找使用的是cv2.findContours函數(shù)找到的是多邊形點(diǎn)集還需要用最小外接矩形把它轉(zhuǎn)成帶角度的文本框。這里對(duì)面積過小或者寬高比過于離譜的候選框要過濾掉不然一張照片里會(huì)跑出大量噪聲框。我習(xí)慣把面積閾值設(shè)成50像素同時(shí)加入了一個(gè)限制條件檢測框面積小于圖像面積萬分之三的直接丟棄這樣能有效減少背景痕跡帶來的誤檢。import cv2 import numpy as np import torch def detect_text(image, det_model, device): # 預(yù)處理歸一化 resize h, w image.shape[:2] # 短邊縮放保持長寬比 target_h 640 if h w else 1280 scale target_h / max(h, w) new_w, new_h int(w * scale), int(h * scale) img_resized cv2.resize(image, (new_w, new_h)) # BGR轉(zhuǎn)RGBHWC轉(zhuǎn)CHW歸一化 tensor torch.from_numpy( cv2.cvtColor(img_resized, cv2.COLOR_BGR2RGB).transpose(2, 0, 1) ).float().div(255).unsqueeze(0).to(device) with torch.no_grad(): prob_map det_model(tensor)[0, 0].cpu().numpy() # 二值化 輪廓提取 binary (prob_map 0.3).astype(np.uint8) * 255 contours, _ cv2.findContours(binary, cv2.RETR_EXTERNAL, cv2.CHAIN_APPROX_SIMPLE) boxes [] for cnt in contours: area cv2.contourArea(cnt) if area 50: continue # 最小外接矩形保留旋轉(zhuǎn)信息 rect cv2.minAreaRect(cnt) box cv2.boxPoints(rect) boxes.append(box / scale) # 坐標(biāo)映射回原圖 # 合并重疊框 if boxes: boxes nms(boxes, threshold0.5) return boxes這段代碼有三個(gè)地方值得展開說。第一NMS非極大值抑制不能省一張復(fù)雜場景圖上檢測模型經(jīng)常會(huì)對(duì)同一行文字輸出多個(gè)重疊框不做NMS會(huì)導(dǎo)致同一行文字被識(shí)別好幾次輸出結(jié)果會(huì)有明顯的重復(fù)噪聲。第二檢測框坐標(biāo)一定要除以縮放比映射回原圖坐標(biāo)不然前端在展示檢測框疊加效果時(shí)會(huì)發(fā)現(xiàn)框的位置完全對(duì)不上。第三cv2.findContours在不同版本的OpenCV中返回值形式不一樣新版OpenCV返回兩個(gè)值而舊版返回三個(gè)值寫代碼的時(shí)候要留意自己環(huán)境里裝的OpenCV版本。3.2 豎版文字判斷與旋轉(zhuǎn)處理拿到檢測框之后下一步是判斷每個(gè)框里文字的排列方向。最直接的方法是看最小外接矩形返回的寬和高取其中較大的作為文本方向。自然場景下文本行一般是長條形橫排文本的寬度明顯大于高度豎排文本則反過來。判斷邏輯可以按寬高比來def is_vertical(box): # box: 四頂點(diǎn)坐標(biāo)按順序排列 (x1, y1), (x2, y2), (x3, y3), (x4, y4) box width np.hypot(x2 - x1, y2 - y1) height np.hypot(x4 - x1, y4 - y1) return height width * 1.2閾值系數(shù)1.2是靠實(shí)測調(diào)出來的。設(shè)得太靈敏會(huì)把略微傾斜的橫排文字誤判成豎排導(dǎo)致旋轉(zhuǎn)后反而識(shí)別錯(cuò)亂設(shè)得太遲鈍則真正豎排的窄長框識(shí)別不了。實(shí)際調(diào)節(jié)時(shí)建議在測試集上同時(shí)看誤檢率和漏檢率找到一個(gè)平衡點(diǎn)。判定豎排之后處理流程是先把帶角度的文本框矯正成水平矩形然后再順時(shí)針旋轉(zhuǎn)90度。這里有個(gè)細(xì)節(jié)容易出錯(cuò)旋轉(zhuǎn)方向必須統(tǒng)一。如果橫排識(shí)別模型是基于從左到右的文字順序訓(xùn)練的豎排文字旋轉(zhuǎn)后也必須保持從左到右閱讀的方向否則識(shí)別模型輸出的文字序列會(huì)是反的。為了保證旋轉(zhuǎn)方向正確我寫了一個(gè)輔助函數(shù)先通過透視變換把檢測框內(nèi)的圖像矯正為正矩形再判斷矯正后的高和寬決定旋轉(zhuǎn)方向。矯正時(shí)用cv2.getPerspectiveTransform加cv2.warpPerspective實(shí)現(xiàn)這樣即使檢測框帶角度也能得到相對(duì)工整的文字圖像。def crop_rotate_text(image, box): # 矯正帶角度的文本框 h int(np.hypot(box[3][1] - box[0][1], box[3][0] - box[0][0])) w int(np.hypot(box[1][1] - box[0][1], box[1][0] - box[0][0])) src box.astype(np.float32) dst np.array([[0, 0], [w - 1, 0], [w - 1, h - 1], [0, h - 1]], dtypenp.float32) M cv2.getPerspectiveTransform(src, dst) crop cv2.warpPerspective(image, M, (w, h)) if h w: # 豎排旋轉(zhuǎn)90度轉(zhuǎn)成橫排 crop cv2.rotate(crop, cv2.ROTATE_90_CLOCKWISE) return crop3.3 識(shí)別模型與CTC解碼識(shí)別模型的輸入是一張高度固定為32像素、寬度按原圖比例縮放的灰度圖。之所以固定高度而不是固定寬度是因?yàn)槲谋拘械拈L度差異很大卷積網(wǎng)絡(luò)對(duì)不同寬度輸入有一定容忍度但高度固定可以讓特征圖的高維信息對(duì)齊。識(shí)別模型輸出的是一串按時(shí)間步排列的字符概率分布需要經(jīng)過解碼才能得到最終文本。CTC解碼的核心思路是去除重復(fù)字符和空白分隔符。最常見的解碼方式是貪婪搜索每個(gè)時(shí)間步直接取概率最大的字符然后合并連續(xù)重復(fù)字符、去掉空白字符。這樣做簡單高效大多數(shù)場景下效果已經(jīng)夠用。但中文識(shí)別任務(wù)有個(gè)特殊難點(diǎn)常見字里有很多結(jié)構(gòu)相似的字符比如“未”和“末”、“日”和“曰”、“己”和“已”。這些字在概率分布中得分往往非常接近單靠視覺特征很難區(qū)分貪婪搜索很容易翻車。如果對(duì)準(zhǔn)確率要求更高可以在解碼時(shí)引入語言模型或者常用詞先驗(yàn)。更穩(wěn)妥的做法是用beam search保持多個(gè)候選序列在最后打分時(shí)把相鄰字符的共現(xiàn)概率考慮進(jìn)去。這個(gè)系統(tǒng)默認(rèn)使用貪婪搜索保證速度同時(shí)在接口層預(yù)留了一個(gè)use_beam_search參數(shù)部署時(shí)可以根據(jù)場景開關(guān)。3.4 前端Web界面與接口設(shè)計(jì)模型部分搞定了最后要落到能用的工程層。系統(tǒng)使用Flask提供Web服務(wù)前端頁面支持兩種玩法上傳圖片識(shí)別、粘貼圖片URL識(shí)別。后端接口設(shè)計(jì)得很簡潔就一個(gè)核心接口接口地址POST /api/ocr請求參數(shù)圖片文件字段名是image支持jpg、png、bmp格式返回結(jié)果JSON包一個(gè)items數(shù)組每個(gè)元素包含文本框坐標(biāo)、識(shí)別文字、置信度返回結(jié)果和前端展示是解耦的接口不關(guān)心前端怎么渲染。前端拿到坐標(biāo)數(shù)據(jù)后用Canvas在圖片上畫出檢測框和識(shí)別文字方便你直觀地檢查識(shí)別效果有沒有問題。{ items: [ { bbox: [[120, 80], [320, 80], [320, 120], [120, 120]], text: 人民路, confidence: 0.96 } ] }前端頁面用原生HTML加一點(diǎn)JavaScript實(shí)現(xiàn)沒有引入Vue、React這類大框架好處是零構(gòu)建、打開即用也方便按照自己的需求改界面樣式。這里必須提一個(gè)部署層面的坑Flask自帶的開發(fā)服務(wù)器是單進(jìn)程單線程的多個(gè)用戶同時(shí)上傳圖片時(shí)會(huì)出現(xiàn)排隊(duì)阻塞拖慢整個(gè)系統(tǒng)的響應(yīng)。生產(chǎn)環(huán)境部署時(shí)建議用gunicorn啟動(dòng)服務(wù)或者至少加上線程池。實(shí)測單張圖片在GPU上的推理耗時(shí)約150到300毫秒CPU上約1到2秒如果并發(fā)量上來了Flask自帶服務(wù)器是扛不住的。4. 數(shù)據(jù)準(zhǔn)備與模型訓(xùn)練過程4.1 訓(xùn)練數(shù)據(jù)來源與預(yù)處理策略做自然場景OCR數(shù)據(jù)永遠(yuǎn)是決定效果上限的因素。這個(gè)項(xiàng)目的訓(xùn)練數(shù)據(jù)主要由三部分構(gòu)成公開數(shù)據(jù)集、網(wǎng)絡(luò)圖片爬取、自己拍攝標(biāo)注。公開數(shù)據(jù)集用的是ICDAR系列的場景文字檢測和識(shí)別數(shù)據(jù)還有中文場景文字識(shí)別常用的合成數(shù)據(jù)集。合成數(shù)據(jù)是用文本渲染引擎在真實(shí)背景圖上隨機(jī)生成文字圖片這個(gè)方法特別實(shí)用因?yàn)闃?biāo)注是自動(dòng)生成的大量可控。網(wǎng)絡(luò)圖片抓取部分抓了一些街景圖、商鋪照片、海報(bào)圖片然后人工篩選出包含清晰文字的圖片。文字檢測數(shù)據(jù)用多邊形標(biāo)注工具逐張標(biāo)注位置識(shí)別數(shù)據(jù)則以行為單位標(biāo)注文字內(nèi)容。最終的數(shù)據(jù)規(guī)??刂圃跈z測部分約8萬張圖像識(shí)別部分約30萬張文字行圖像。數(shù)據(jù)規(guī)模不是越大越好關(guān)鍵是覆蓋場景要多樣化——光照條件、拍攝角度、字體類型、文字方向都要有足夠的樣本。豎排文字的樣本量刻意補(bǔ)到了總量的10%左右沒有這部分?jǐn)?shù)據(jù)豎排模塊的效果是出不來的。預(yù)處理階段做了幾件固定的事統(tǒng)一圖像尺寸、歸一化像素值到0到1范圍、隨機(jī)做亮度對(duì)比度擾動(dòng)、隨機(jī)裁剪和旋轉(zhuǎn)。數(shù)據(jù)增強(qiáng)是提升自然場景泛化能力的最佳武器尤其是光照擾動(dòng)和透視變換模擬了手機(jī)拍攝的真實(shí)情況。4.2 模型訓(xùn)練的詳細(xì)配置檢測模型DBNet的訓(xùn)練配置輸入尺寸統(tǒng)一為640乘640批量大小設(shè)成8優(yōu)化器用Adam初始學(xué)習(xí)率0.001訓(xùn)練80個(gè)epoch學(xué)習(xí)率在第40和第60個(gè)epoch分別衰減十倍。損失函數(shù)用的是DBNet原論文的組合損失包含二值化交叉熵?fù)p失、可微二值化損失和文本框形狀損失。識(shí)別模型CRNN的訓(xùn)練配置輸入高度固定32像素寬度按比例調(diào)整但不超過320像素批量大小64優(yōu)化器用Adadelta初始學(xué)習(xí)率1.0訓(xùn)練50個(gè)epoch。CTC loss作為損失函數(shù)這里不需要計(jì)算每個(gè)字符的對(duì)齊位置直接拿模型輸出序列和真實(shí)文本序列做對(duì)比就可以。訓(xùn)練過程中監(jiān)控的指標(biāo)不只是整體準(zhǔn)確率還重點(diǎn)觀察了幾個(gè)子集的準(zhǔn)確率——豎排樣本、低光照樣本、藝術(shù)字體樣本。如果某個(gè)子集的準(zhǔn)確率明顯低于平均水平說明在這一類場景上訓(xùn)練數(shù)據(jù)還不夠需要回去補(bǔ)數(shù)據(jù)或者加強(qiáng)數(shù)據(jù)增強(qiáng)。這種做法比只盯一個(gè)整體指標(biāo)要有效得多。4.3 推理加速與模型輕量化訓(xùn)練完成之后要考慮推理效率。完整的模型在CPU上跑一張圖需要1到2秒對(duì)Web服務(wù)來說有點(diǎn)慢。我先給識(shí)別模型做了輸入尺寸的優(yōu)化原圖高度32固定不變但寬度上限從320降到了240。大部分中文文本行的寬度都在這個(gè)范圍以內(nèi)超過上限的按比例壓縮。這么一改推理速度提升了30%準(zhǔn)確率幾乎沒有損失。另一個(gè)優(yōu)化是把模型導(dǎo)出為TorchScript格式操作方法是det_model.eval() scripted_det torch.jit.trace(det_model, example_input) scripted_det.save(dbnet_resnet50_scripted.pth)TorchScript導(dǎo)出后可以不依賴原始的Python模型類定義部署時(shí)更干凈同時(shí)推理速度也有小幅提升。如果追求極致加速還可以在GPU上用TensorRT做進(jìn)一步的量化。這個(gè)項(xiàng)目沒有上TensorRT但在環(huán)境說明里提到了這個(gè)方向方便有需要的同學(xué)繼續(xù)深挖。測試環(huán)境下CPU推理一張1280像素寬的照片大約需要0.8秒GPU上約150毫秒。這個(gè)速度對(duì)大多數(shù)Web應(yīng)用來說是可以接受的。5. 常見問題與排查技巧實(shí)錄5.1 環(huán)境與啟動(dòng)問題速查項(xiàng)目跑起來之前最容易卡殼的就是環(huán)境問題。這里把我在實(shí)際部署中遇到過的問題整理成了一張表方便大家對(duì)照排查。問題現(xiàn)象根本原因解決辦法torch.cuda.is_available()返回FalseCUDA版本和PyTorch不匹配用pip安裝對(duì)應(yīng)CUDA版本的torch或降級(jí)PyTorch到匹配的版本import cv2報(bào)錯(cuò)提示找不到cv2模塊opencv-python未安裝或版本沖突重新執(zhí)行pip install opencv-python注意清理舊版本啟動(dòng)Flask時(shí)報(bào)Address already in use端口被占用換一個(gè)端口啟動(dòng)或者殺掉占用端口的進(jìn)程上傳圖片后報(bào)錯(cuò)文件無法獲取前端和后端字段名不一致檢查前端FormData的字段名是否為image大小寫要一致檢測框坐標(biāo)顯示錯(cuò)位縮放后的坐標(biāo)沒有映射回原圖在detect_text函數(shù)末尾對(duì)檢測框坐標(biāo)除以縮放比識(shí)別結(jié)果為空白字符集文件與模型不匹配確認(rèn)charset.txt內(nèi)容和識(shí)別模型的輸出層維度一致內(nèi)存占用持續(xù)上漲推理時(shí)沒有及時(shí)釋放GPU顯存設(shè)置torch.cuda.empty_cache()避免保留中間變量引用端口占用這個(gè)問題在服務(wù)器上特別常見。我之前部署到一臺(tái)服務(wù)器時(shí)發(fā)現(xiàn)8000端口被一個(gè)舊服務(wù)占著Flask啟動(dòng)直接報(bào)錯(cuò)。解決辦法很簡單換一個(gè)不常用的端口比如8090。如果不想改代碼也可以在啟動(dòng)命令里指定app.run(port8090)。5.2 識(shí)別效果的調(diào)優(yōu)經(jīng)驗(yàn)?zāi)P团芡诵Ч粷M意怎么辦這是大家問得最多的問題。我按排查優(yōu)先級(jí)整理了思路從硬件資源到算法參數(shù)一層層往下調(diào)。第一排查光照問題。自然場景圖的光照差異極大暗光環(huán)境下的識(shí)別準(zhǔn)確率會(huì)明顯下跌。如果應(yīng)用場景以暗光為主可以在識(shí)別前加一個(gè)圖像增強(qiáng)的預(yù)處理步驟最簡單的做法是用灰度圖的CLAHE自適應(yīng)直方圖均衡化。實(shí)測在暗光測試集上加了這個(gè)預(yù)處理的準(zhǔn)確率能提升3到5個(gè)百分點(diǎn)。第二排查檢測框的完整性。如果檢測出來的文本框把文字截?cái)嗔俗R(shí)別模型看到的就是殘缺的字符必定識(shí)別錯(cuò)誤。這時(shí)需要把概率圖的二值化閾值調(diào)低一點(diǎn)比如從0.3降到0.25讓檢測框更寬松一些寧可稍微包含一點(diǎn)背景也不要截?cái)辔淖?。第三排查字符集覆蓋范圍。這個(gè)項(xiàng)目默認(rèn)字符集是3000個(gè)常用漢字如果圖片里包含生僻字或者特殊符號(hào)識(shí)別結(jié)果基本是錯(cuò)的。解決辦法是把字符加進(jìn)charset.txt重新訓(xùn)練識(shí)別模型。如果不想重新訓(xùn)練至少可以把字符集文件里的字換成本領(lǐng)域常用的高頻字集合犧牲覆蓋面換取更精準(zhǔn)的領(lǐng)域效果。第四排查輸入圖像的清晰度。圖片里的文字如果本身就模糊或者分辨率過低任何模型都救不回來。建議在系統(tǒng)入口處加一個(gè)圖像質(zhì)量檢查檢測到圖片過小時(shí)提示用戶重新上傳更清晰的圖片。5.3 豎版文字識(shí)別的專項(xiàng)調(diào)參記錄豎版文字是這套系統(tǒng)花了不少心思優(yōu)化的一部分單獨(dú)拿出來聊聊調(diào)參心得。豎排判斷的閾值系數(shù)1.2是一個(gè)比較敏感的參數(shù)。如果場景里有一種特殊排版比如古建筑牌匾上從右往左豎排的文字判斷邏輯還要額外考慮閱讀順序。我從實(shí)際測試中發(fā)現(xiàn)豎排文本的檢測框往往比橫排文本更窄長這種情況下檢測模型有時(shí)會(huì)把一個(gè)完整的豎排文本行切成多個(gè)小框每個(gè)小框里只有一個(gè)字符。這種碎片化會(huì)導(dǎo)致識(shí)別結(jié)果完全不連貫。解決的辦法是在檢測后處理里加一個(gè)框合并邏輯如果兩個(gè)文本框的中心點(diǎn)x坐標(biāo)接近、且上下位置有重疊就把它們合并成一個(gè)豎排大框。這個(gè)合并邏輯其實(shí)就是一個(gè)按空間關(guān)系聚類的過程不需要復(fù)雜算法簡單的距離比較就可以實(shí)現(xiàn)。豎排文字旋轉(zhuǎn)之后送入識(shí)別模型時(shí)有個(gè)細(xì)節(jié)也需要注意。旋轉(zhuǎn)后的圖像寬度很多時(shí)候只有20到40像素這個(gè)寬度在識(shí)別模型的感受野里偏小特征提取不夠充分。為了改善這個(gè)問題我把這類窄圖在送入模型前做了水平方向的重復(fù)拼接補(bǔ)充把寬度補(bǔ)到至少64像素效果確實(shí)有提升這個(gè)技巧實(shí)際工程中很有用。6. 系統(tǒng)擴(kuò)展方向與后續(xù)改進(jìn)建議6.1 從單張圖片到視頻流的識(shí)別目前系統(tǒng)接收的是單張圖片但很多實(shí)際場景需要連續(xù)的視頻流識(shí)別比如監(jiān)控畫面里的文字提取、車載攝像頭拍到的路牌識(shí)別、直播畫面里的字幕提取。改造思路是在現(xiàn)有OCR管線前后加上視頻幀處理層。視頻幀處理層做兩件事一是抽幀每隔N幀識(shí)別一次避免逐幀識(shí)別的算力浪費(fèi)二是結(jié)果融合對(duì)同一個(gè)文字目標(biāo)在連續(xù)多幀中的識(shí)別結(jié)果做投票整合能夠有效消除單幀識(shí)別錯(cuò)誤和閃爍。我在實(shí)驗(yàn)中發(fā)現(xiàn)視頻流OCR的關(guān)鍵不在于OCR模型本身而在于節(jié)奏控制。抽幀太頻繁GPU占用高且識(shí)別結(jié)果重復(fù)抽幀太少快速移動(dòng)的文字會(huì)漏檢。針對(duì)常規(guī)監(jiān)控場景每秒3到5幀的抽幀率性價(jià)比最高。6.2 引入注意力機(jī)制進(jìn)一步提高識(shí)別準(zhǔn)確率CRNN加CTC的結(jié)構(gòu)在速度和穩(wěn)定性上很優(yōu)秀但在處理長文本行和形近字時(shí)純CTC解碼缺少全局語義信息的輔助。如果項(xiàng)目對(duì)準(zhǔn)確率的要求極高可以嘗試在識(shí)別模塊引入注意力機(jī)制也就是經(jīng)典的編碼器解碼器架構(gòu)替換為CTC head。注意力方案在訓(xùn)練時(shí)需要一個(gè)額外步驟就是生成每個(gè)字符的輸出位置標(biāo)注成本比CTC方案高不少。但好處也很明顯帶注意力的解碼器能利用全局上下文信息在長文本行上通常比CTC穩(wěn)得多形近字的區(qū)分能力也更強(qiáng)。如果手頭的數(shù)據(jù)標(biāo)注資源充足這值得一試。6.3 壓縮模型體積以便邊緣設(shè)備部署項(xiàng)目打包里的模型總大小約120MB在服務(wù)器上跑沒問題但部署到邊緣設(shè)備比如嵌入式網(wǎng)關(guān)、智能攝像頭、樹莓派這類設(shè)備上就偏大了。模型壓縮的兩個(gè)主要方向量化和蒸餾。量化方面可以使用PyTorch的靜態(tài)量化工具把模型權(quán)重從FP32壓到INT8體積縮小到原來的四分之一推理速度能提升2到3倍代價(jià)是準(zhǔn)確率會(huì)損失1到2個(gè)百分點(diǎn)。蒸餾的思路是讓一個(gè)大模型當(dāng)老師教一個(gè)小模型優(yōu)化自己的權(quán)重在保持較小模型體積的同時(shí)盡量保留大模型的精度。我實(shí)際測過把檢測和識(shí)別模型都量化到INT8在RK3588這類邊緣設(shè)備上單幀圖片的完整OCR推理耗時(shí)可以控制在500毫秒以內(nèi)基本達(dá)到了實(shí)時(shí)可用級(jí)別。系統(tǒng)后續(xù)還可以擴(kuò)展的方向挺多比如多語言混排識(shí)別、表格結(jié)構(gòu)還原、印章文字檢測都是真實(shí)業(yè)務(wù)中高頻出現(xiàn)的需求。有一點(diǎn)我在這套系統(tǒng)的開發(fā)過程中體會(huì)特別深OCR系統(tǒng)的工程落地難點(diǎn)往往不在模型本身而在對(duì)實(shí)際場景的充分理解和對(duì)各種邊界條件的處理。把所有能用規(guī)則解決的細(xì)節(jié)都處理干凈模型的壓力就會(huì)小很多整套系統(tǒng)的上限自然就上來了。如果各位在部署或改造這套系統(tǒng)的過程中有更好的想法歡迎一起交流。本文還有配套的精品資源點(diǎn)擊獲取