Python圖像處理之圖片文字識別（OCR）

W4n9Hu1 發(fā)布于2019-07-30 16:48 / 3558人閱讀

摘要：與介紹將圖片翻譯成文字一般被稱為光學(xué)文字識別，。是目前公認最優(yōu)秀最精確的開源系統(tǒng)。我們以圖片為例輸入命令識別結(jié)果如下只識別錯了一個字，識別率還是不錯的。最后加一句，對于彩色圖片的識別效果沒有黑白圖片的效果好。

OCR與Tesseract介紹

??將圖片翻譯成文字一般被稱為光學(xué)文字識別（Optical Character Recognition，OCR）。可以實現(xiàn)OCR 的底層庫并不多，目前很多庫都是使用共同的幾個底層OCR 庫，或者是在上面進行定制。
??Tesseract 是一個OCR 庫，目前由Google 贊助（Google 也是一家以O(shè)CR 和機器學(xué)習(xí)技術(shù)聞名于世的公司）。Tesseract 是目前公認最優(yōu)秀、最精確的開源OCR 系統(tǒng)。
??除了極高的精確度，Tesseract 也具有很高的靈活性。它可以通過訓(xùn)練識別出任何字體（只要這些字體的風(fēng)格保持不變就可以），也可以識別出任何Unicode 字符。

Tesseract的安裝與使用

??Tesseract的Windows安裝包下載地址為： http://digi.bib.uni-mannheim.... ，下載后雙擊直接安裝即可。安裝完后，需要將Tesseract添加到系統(tǒng)變量中。在CMD中輸入tesseract -v, 如顯示以下界面，則表示Tesseract安裝完成且添加到系統(tǒng)變量中。

??Linux 用戶可以通過apt-get 安裝：

$sudo apt-get tesseract-ocr

??用Tesseract可以識別格式規(guī)范的文字，主要具有以下特點：

? 使用一個標準字體（不包含手寫體、草書，或者十分“花哨的”字體）
? 雖然被復(fù)印或拍照，字體還是很清晰，沒有多余的痕跡或污點
? 排列整齊，沒有歪歪斜斜的字
? 沒有超出圖片范圍，也沒有殘缺不全，或緊緊貼在圖片的邊緣
??下面將給出幾個tesseract識別圖片中文字的例子。
??首先是E://figures/other/poems.jpg, 輸入命令 tesseract E://figures/other/poems.jpg E://figures/other/poems.txt，則會將poems.jpg中的識別文字寫入到poems.txt中，如下圖：

??接著是稍微有點傾斜的文字圖片th.jpg,識別情況如下：

可以看到識別的情況不如剛才規(guī)范字體的好，但是也能識別圖片中的大部分字母。
??最后是識別簡體中文，需要事先安裝簡體中文語言包，下載地址為：https://github.com/tesseract-... ,再講chi_sim.traineddata放在C:Program Files (x86)Tesseract-OCRtessdata目錄下。我們以圖片timg.jpg為例：

輸入命令：

tesseract E://figures/other/timg.jpg E://figures/other/timg.txt -l chi_sim

識別結(jié)果如下：

只識別錯了一個字，識別率還是不錯的。
??最后加一句，Tesseract對于彩色圖片的識別效果沒有黑白圖片的效果好。

pytesseract

??pytesseract是Tesseract關(guān)于Python的接口，可以使用pip install pytesseract安裝。安裝完后，就可以使用Python調(diào)用Tesseract了，不過，你還需要一個Python的圖片處理模塊，可以安裝pillow.
??輸入以下代碼，可以實現(xiàn)同上述Tesseract命令一樣的效果：

import pytesseract
from PIL import Image

pytesseract.pytesseract.tesseract_cmd = "C://Program Files (x86)/Tesseract-OCR/tesseract.exe"
text = pytesseract.image_to_string(Image.open("E://figures/other/poems.jpg"))

print(text)

運行結(jié)果如下：

參考文獻

Python網(wǎng)絡(luò)數(shù)據(jù)采集【美】 Ryan Mitchell 人民郵電出版社

https://blog.csdn.net/dcrmg/a...

http://www.inimei.cn/archives...

注意：本人現(xiàn)已開通微信公眾號：Python爬蟲與算法（微信號為：easy_web_scrape），歡迎大家關(guān)注哦~~

GPU云服務(wù)器云服務(wù)器 java圖片文字識別ocr python圖像識別文字 python圖像識別文字代碼國內(nèi)ocr文字識別

文章版權(quán)歸作者所有，未經(jīng)允許請勿轉(zhuǎn)載,若此文章存在違規(guī)行為，您可以聯(lián)系管理員刪除。

轉(zhuǎn)載請注明本文地址：http://m.specialneedsforspecialkids.com/yun/41838.html

發(fā)表評論

登陸后可評論

0條評論

W4n9Hu1

男|高級講師

我要關(guān)注我要私信

TA的文章

下載tensorflow

閱讀 2821·2023-04-25 15:01
如何用云服務(wù)器搭建個人網(wǎng)站?云服務(wù)器自主建站的5大步驟

閱讀 3082·2021-11-23 10:07
職業(yè)迷茫，測試危機到了頭上，該如何找準自我定位？

閱讀 3369·2021-10-12 10:12
搬瓦工安裝Centos7+鏡像部署圖形化輕量桌面遠程環(huán)境（XFCE+VNC）

閱讀 3459·2021-08-30 09:45
CloudPowerall：$29.99/年/512MB內(nèi)存/10GB NVMe空間/500GB流量

閱讀 2198·2021-08-20 09:36
前端基礎(chǔ)工作流：sass自動化編輯成css

閱讀 3587·2019-08-30 12:59
寫給自己的React HOC(高階組件)手冊

閱讀 2437·2019-08-26 13:52
JS專題之事件模型

閱讀 936·2019-08-26 13:24

国产xxxx99真实实拍_久久不雅视频_高清韩国a级特黄毛片_嗯老师别我我受不了了小说

資訊專欄INFORMATION COLUMN

上云采購季！| 2核2G4M爆款云服務(wù)器低至59元/年，更有多臺、長期優(yōu)惠，快來選購！

Python圖像處理之圖片文字識別（OCR）

相關(guān)文章

**識別圖片中的文字 - Tesseract 和百度云OCR的對比**

Python圖像處理之圖片驗證碼識別

如何識別圖片文字，PaddleOCR機器學(xué)習(xí)開源項目使用 | 機器學(xué)習(xí)

發(fā)表評論

0條評論

W4n9Hu1

男|高級講師

TA的文章

下載tensorflow

如何用云服務(wù)器搭建個人網(wǎng)站?云服務(wù)器自主建站的5大步驟

職業(yè)迷茫，測試危機到了頭上，該如何找準自我定位？

搬瓦工安裝Centos7+鏡像部署圖形化輕量桌面遠程環(huán)境（XFCE+VNC）

CloudPowerall：$29.99/年/512MB內(nèi)存/10GB NVMe空間/500GB流量

前端基礎(chǔ)工作流：sass自動化編輯成css

寫給自己的React HOC(高階組件)手冊

JS專題之事件模型

最新活動