言 OCR:37 種語(yǔ)言文檔一次搞定(PP-OCRv5 指南))
MinerU 多語(yǔ)言 OCR37 種語(yǔ)言文檔一次搞定PP-OCRv5 指南【免費(fèi)下載鏈接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.項(xiàng)目地址: https://gitcode.com/GitHub_Trending/mi/MinerU中英混排的 PDF 丟進(jìn) OCR中文正常、英文變亂碼換成一份俄語(yǔ)合同識(shí)別結(jié)果干脆沒(méi)法用。這類(lèi)問(wèn)題的根源在于單語(yǔ)模型撐不起多語(yǔ)場(chǎng)景。MinerU 多語(yǔ)言 OCR 從 2.1.0 版本起在 pipeline 后端換用 PP-OCRv5 文本識(shí)別模型一次解析覆蓋 37 種語(yǔ)言官方給出的平均精度漲幅超過(guò) 30%。? MinerU 37 種語(yǔ)言能力速覽這套能力可以概括為三句話(huà)。語(yǔ)言上覆蓋東亞、拉丁、斯拉夫、阿拉伯、印度語(yǔ)系等主要語(yǔ)系共 37 種語(yǔ)言其中中英、日繁混合是精度最高的組合。效果上相比上一代識(shí)別模型平均識(shí)別精度提升超過(guò) 30%。使用上命令行和 Python 接口共用同一個(gè)lang入口不需要額外部署服務(wù)也不改變?cè)械妮敵鼋Y(jié)構(gòu)。 MinerU 多語(yǔ)言 OCR 快速上手安裝完成后一條命令就能看到結(jié)果mineru -p demo/pdfs/demo1.pdf -o output解析完成后output目錄下會(huì)生成 Markdown、圖片和結(jié)構(gòu)化 JSON。想指定文檔語(yǔ)言加一個(gè)--lang參數(shù)即可例如--lang korean完整的參數(shù)說(shuō)明見(jiàn)命令行工具文檔。Python 調(diào)用同樣短from mineru.cli.common import do_parse do_parse( input_pathdemo/pdfs/demo1.pdf, output_diroutput, )需要指定語(yǔ)言時(shí)給do_parse追加lang參數(shù)即可。模型首次運(yùn)行會(huì)自動(dòng)下載之后都是本地推理。下圖是識(shí)別階段框出的文本行每種語(yǔ)言走的都是同一套框選流程 原理白話(huà)版從文本檢測(cè)到分語(yǔ)系識(shí)別整條鏈路分四步。第一步版面模型先框出頁(yè)面上的文本行第二步系統(tǒng)根據(jù)你傳入的lang參數(shù)、或不傳時(shí)的默認(rèn)設(shè)置決定調(diào)用哪套識(shí)別模型第三步對(duì)應(yīng)語(yǔ)系的模型把文本行逐個(gè)轉(zhuǎn)成文字第四步所有語(yǔ)言的結(jié)果走同一套后處理包括斷字合并、標(biāo)點(diǎn)校正再和版面信息一起組裝成 Markdown 或 JSON。下圖展示了文本行框選之前的版面檢測(cè)環(huán)節(jié)文本、公式、圖表區(qū)域被分別框出多語(yǔ)言識(shí)別都建立在這些框之上 MinerU 支持的語(yǔ)言列表下表按語(yǔ)系列出主要語(yǔ)言及對(duì)應(yīng)的語(yǔ)言代碼代碼與--lang/lang參數(shù)一致語(yǔ)系代表語(yǔ)言語(yǔ)言代碼東亞中文、英文、日文、韓文、繁體中文ch、korean拉丁法、西、葡、德等主流拉丁語(yǔ)言及希臘語(yǔ)el希臘語(yǔ)其余走默認(rèn)模型斯拉夫俄語(yǔ)等東斯拉夫語(yǔ)言east_slavic、cyrillic阿拉伯阿拉伯語(yǔ)arabic印度語(yǔ)系泰米爾語(yǔ)、泰盧固語(yǔ)、卡納達(dá)語(yǔ)、天城文ta、te、ka、devanagari東南亞泰語(yǔ)th選型建議文檔語(yǔ)言明確就填對(duì)應(yīng)代碼中英日繁混排用默認(rèn)的ch系列拿不準(zhǔn)語(yǔ)言時(shí)先跑一遍默認(rèn)流程再抽查結(jié)果。場(chǎng)景配置默認(rèn)流程與顯式指定的取舍國(guó)際化商業(yè)報(bào)告多語(yǔ)言混排就保持默認(rèn)流程基座模型本身已覆蓋 37 種語(yǔ)言不要強(qiáng)行指定單一語(yǔ)言若某一語(yǔ)言占絕對(duì)主導(dǎo)再顯式指定該語(yǔ)言。學(xué)術(shù)論文多語(yǔ)言引用公式解析默認(rèn)開(kāi)啟無(wú)需額外配置手寫(xiě)頁(yè)或外文引用較多的論文把lang指向?qū)?yīng)語(yǔ)系代碼更穩(wěn)。純拉丁語(yǔ)系文檔直接跑默認(rèn)流程即可不傳--lang。取舍的標(biāo)準(zhǔn)很簡(jiǎn)單顯式指定的作用是把識(shí)別模型收窄到目標(biāo)語(yǔ)系字典更聚焦、小語(yǔ)種更穩(wěn)代價(jià)是猜錯(cuò)語(yǔ)言反而降精度所以「確定才指定不確定用默認(rèn)」。?? MinerU 語(yǔ)言識(shí)別不準(zhǔn)怎么辦語(yǔ)言誤判如把日文按中文識(shí)別出現(xiàn)同形字錯(cuò)誤原因是混排頁(yè)面按高頻語(yǔ)言?xún)?yōu)先顯式--lang到正確語(yǔ)言即可糾正。個(gè)別語(yǔ)言效果差小語(yǔ)種訓(xùn)練樣本少生僻符號(hào)仍會(huì)出錯(cuò)換用該語(yǔ)系專(zhuān)用代碼或把掃描件提升到 300DPI 左右再跑一次。大文檔內(nèi)存吃緊一次處理的頁(yè)數(shù)越多內(nèi)存峰值越高調(diào)小環(huán)境變量MINERU_PROCESSING_WINDOW_SIZE默認(rèn) 64分批處理。更細(xì)的參數(shù)含義可以對(duì)照快速上手文檔里的環(huán)境變量一節(jié)。MinerU 2.1.0 把多語(yǔ)言識(shí)別從「按語(yǔ)言挑工具」變成了同一條 pipeline 里的常規(guī)操作檢測(cè)、分語(yǔ)系識(shí)別、后處理共用一個(gè)流程37 種語(yǔ)言共享同一套輸出格式中英混合識(shí)別也不再需要前后兩套工具。[!TIP] 本文基于 2.1.0 版本的功能與參數(shù)編寫(xiě)。后續(xù)版本可能調(diào)整語(yǔ)言代碼與默認(rèn)模型使用前請(qǐng)以對(duì)應(yīng)版本的文檔為準(zhǔn)。【免費(fèi)下載鏈接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.項(xiàng)目地址: https://gitcode.com/GitHub_Trending/mi/MinerU創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考