OCR工具:為什么多模態(tài)大模型正在顛覆文檔識別)
GLM-OCR vs 傳統(tǒng)OCR工具為什么多模態(tài)大模型正在顛覆文檔識別【免費(fèi)下載鏈接】GLM-OCRGLM-OCR: Accurate × Fast × Comprehensive項(xiàng)目地址: https://gitcode.com/GitHub_Trending/gl/GLM-OCRGLM-OCR 是一款基于多模態(tài)大模型的開源 OCR 工具專為復(fù)雜文檔識別設(shè)計(jì)僅 0.9B 參數(shù)即可同時(shí)處理文字、表格、公式、代碼、印章等混合版面并在 OmniDocBench V1.5 基準(zhǔn)上取得 94.62 分、排名第 1。本文將從新手視角講清楚為什么說多模態(tài) OCR 模型正在顛覆傳統(tǒng) OCR 工具兩者差在哪該選哪個(gè)傳統(tǒng)OCR工具的三大痛點(diǎn)傳統(tǒng)文檔識別工具像一條流水線先用版面模型找標(biāo)題和表格再用文字檢測模型框出每個(gè)字接著識別文字最后用表格結(jié)構(gòu)模型拼回結(jié)構(gòu)。任何一環(huán)出錯(cuò)最終結(jié)果就廢掉。痛點(diǎn)傳統(tǒng) OCR 的做法GLM-OCR 的做法流水線串聯(lián)多個(gè)模型級聯(lián)誤差逐級累積單個(gè)多模態(tài)大模型端到端輸出只認(rèn)文字表格、公式需要額外模型直接輸出帶結(jié)構(gòu)的 Markdown / JSON泛化能力弱換一類文檔就要重新調(diào)參手寫、印章、代碼等開箱即用核心區(qū)別在于傳統(tǒng) OCR 是把圖上的字逐字抄下來而 GLM-OCR 這類多模態(tài) OCR 模型是看懂整頁文檔再直接寫出整理好的結(jié)果。上圖展示了 GLM-OCR 底層 GLM-V 架構(gòu)的思路視覺編碼器ViT Encoder先看懂整張文檔圖語言解碼器Language Decoder再直接輸出識別結(jié)果中間不需要任何規(guī)則拼接。多模態(tài)OCR模型實(shí)戰(zhàn)4類典型文檔雙欄論文、規(guī)范文檔版式不再串行傳統(tǒng) OCR 遇到雙欄版面最容易把閱讀順序搞亂。GLM-OCR 會先把段落、公式、編號分別框出來再統(tǒng)一成文這個(gè)例子里段落標(biāo)題、正文、行間公式都被準(zhǔn)確標(biāo)注最終輸出的是結(jié)構(gòu)完整的 Markdown。更多樣例可參考examples/result/page/目錄下的page.md和page.json。復(fù)雜表格直接產(chǎn)出可用的 HTML 表格表格最怕合并單元格和跨行。下圖中財(cái)務(wù)報(bào)表表格被整體識別為置信度 0.93 的 table 區(qū)域識別結(jié)果見examples/result/table/table.md是一段標(biāo)準(zhǔn) HTML 表格行列結(jié)構(gòu)和金額數(shù)據(jù)完整保留——這一步在傳統(tǒng)工具里通常要單獨(dú)訓(xùn)練一個(gè)表格結(jié)構(gòu)模型才能做到。手寫文檔從勉強(qiáng)識別到穩(wěn)定輸出傳統(tǒng) OCR 對手寫字體的準(zhǔn)確率有限。GLM-OCR 則把手寫當(dāng)成普通文檔處理多個(gè)手寫段落被逐一檢測并輸出公式與化學(xué)結(jié)構(gòu)傳統(tǒng)工具的盲區(qū)對傳統(tǒng) OCR 工具來說化學(xué)結(jié)構(gòu)式、數(shù)學(xué)公式是表外字符基本無法處理而對多模態(tài)大模型來說它們只是一張圖項(xiàng)目還在examples/finetune/下提供了垂直場景的微調(diào)示例基于 LLA MA-Factory 的思路含 LoRA 與全量 SFT 配置如果你有自己領(lǐng)域的文檔可以在此基礎(chǔ)上進(jìn)一步提升效果。GLM-OCR 上手有多簡單3種部署方式方式一云端 API新手首選——無需 GPU兩條命令跑起來pip install glmocr glmocr parse examples/source/code.png方式二本地 vLLM / SGLang 部署——適合數(shù)據(jù)不能出內(nèi)網(wǎng)的場景pip install glmocr[selfhosted]后按官方流程啟動推理服務(wù)即可Apple Silicon 的 Mac 還可以用 MLX 跑參考examples/mlx-deploy/README.md。?方式三克隆源碼體驗(yàn)完整演示——項(xiàng)目自帶一套前后端分離的 Web 演示系統(tǒng)上傳文件、頁面預(yù)覽、Markdown 結(jié)果對比啟動腳本在apps/start-local.sh和apps/start-docker.shgit clone https://gitcode.com/GitHub_Trending/gl/GLM-OCR cd GLM-OCRGLM-OCR 與傳統(tǒng)OCR工具快速對比對比項(xiàng)傳統(tǒng) OCR 工具GLM-OCR多模態(tài)大模型技術(shù)路線檢測→識別→結(jié)構(gòu)拼接的多級流水線單個(gè)多模態(tài)模型端到端輸出輸出格式多為純文本 / 文本框坐標(biāo)Markdown 帶坐標(biāo)的結(jié)構(gòu)化 JSON表格與公式依賴額外專用模型原生支持參數(shù)規(guī)模因工具而異僅 0.9B邊緣設(shè)備也能部署部署方式大多 CPU 可跑vLLM / SGLang / Ollama或云端 API基準(zhǔn)成績因工具而異OmniDocBench V1.5 得分 94.62第 1 名開源協(xié)議因工具而異模型 MIT代碼 Apache 2.0總結(jié)什么時(shí)候該換多模態(tài)OCR模型? 如果你的文檔版式復(fù)雜雙欄、表格、公式、代碼、印章、手寫或者需要直接可用的 Markdown / JSON 輸出GLM-OCR 這類多模態(tài) OCR 模型是更穩(wěn)的選擇。? 如果你只是識別干凈的純文本文檔傳統(tǒng) OCR 工具依舊輕量夠用不必為了換而換。GLM-OCR 的核心代碼在glmocr/目錄流程編排見glmocr/pipeline/pipeline.py版面檢測見glmocr/layout/layout_detector.py結(jié)果后處理Markdown / JSON 生成見glmocr/postprocess/result_formatter.py。完整說明請閱讀項(xiàng)目根目錄的README.md?!久赓M(fèi)下載鏈接】GLM-OCRGLM-OCR: Accurate × Fast × Comprehensive項(xiàng)目地址: https://gitcode.com/GitHub_Trending/gl/GLM-OCR創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考