提示：文章写完后，目录可以自动生成，如何生成可参考右边的帮助文档

文章目录

前言
一、tesseract-ocr是什么？
二、使用步骤
- 1.下载exe安装包
- 2.安装
- 3.使用
- 3.设置全局path
二、java如何进行调用
- 1.引入依赖
- 2.demo使用
- 3.环境变量配置

前言

公司使用AI进行OCR文字识别效果不好，并且提供的服务不稳定，本次查找到使用java也能连接的OCR开源项目进行识别的学习

一、tesseract-ocr是什么？

tesseract-ocr是一个开源的OCR文字识别项目，目前版本已经更新到5.X.X了，并且提供多种环境的安装，本次我们在window进行安装并且使用。

二、使用步骤

1.下载exe安装包

说明：tesseract-ocr目前训练的数据是放在tessdata文件夹下，后缀为traineddata文件，目前支持100多种语言。今天安装的为第三方支持的安装包。

https://github.com/UB-Mannheim/tesseract/wiki

该页面下有支持64位和32位的安装包

tesseract-ocr-w32-setup-5.3.0.20221222.exe (32 bit) andtesseract-ocr-w64-setup-5.3.0.20221222.exe (64 bit) resp.

“

2.安装

在软件安装时，默认只会安装英文训练的数据集合，要使用其他文字，需要在安装时，进行勾选。

3.使用

该exe安装的软件可以直接使用tesseract.exe进行命令行执行文字识别。进入到exe存在的目录下。cmd进入到命命令执行框

//官方tesseract imagename outputbase [-l lang] [--oem ocrenginemode] [--psm pagesegmode] [configfiles...]

imagename ：图片的位置
outputbase：输出的文件名字，不加后缀保存为txt格式
-l lang：识别的语言类型，不加默认为英文，中文使用-l chi_sim,使用多种语言识别如 -l eng+deu
–psm pagesegmode:参数
–oem:使用识别的引擎，新版都是用 –oem 1（LSTM模式）
configfiles: 可以执行输入的格式如 pdf, hocr ,tsv

-psm 后携带的参数:0 =方向和脚本检测(OSD)。1 =自动页面分割与OSD。2 =自动页面分割，但没有OSD，或OCR3 =全自动页面分割，无OSD。(默认)4 =假设一列文本大小可变。5 =假设有一个垂直对齐的文本块。6 =假设有一个统一的文本块。7 =将图像视为单个文本行。8 =把图像看成一个单词。9 =把图像看成一个圆圈里的单个单词。10 =将图像视为单个字符。-l lang和/或-psm pagesegmode必须出现在任何configfile之前。

tesseract.exe C:\Users\Lenovo\Pictures\联想截图\联想截图_20230220144409.png out -l chi_sim

识别结果默认为out.txt在exe目录下

3.设置全局path

要想在其他目录使用tesseract.exe工具，那么奖该工具父目录添加到环境变量中

二、java如何进行调用

1.引入依赖

tess4j是针对java对tesseract封装调用的api依赖，我们只需要在项目中引入pom即可开箱使用，注意，版本可能会影响，目前我引入的版本为5.0.0

<!-- https://mvnrepository.com/artifact/net.sourceforge.tess4j/tess4j --><dependency><groupId>net.sourceforge.tess4j</groupId><artifactId>tess4j</artifactId><version>5.0.0</version></dependency>

2.demo使用

public static void main(String[] args) throws IOException {// 创建实例ITesseract instance = new Tesseract();// 设置识别语言 //instance.setLanguage("chi_sim");instance.setLanguage("jpn");// 设置识别引擎 instance.setOcrEngineMode(1);instance.setPageSegMode(6); // 读取文件 BufferedImage image = ImageIO.read(new File("C:\\Users\\Lenovo\\Pictures\\联想截图\\联想截图_20230220143248.png"));try {// 识别//String res = instance.doOCR(new File("C:\\Users\\Lenovo\\Pictures\\联想截图\\联想截图_20230220144409.png"));String result = instance.doOCR(image);System.out.println(result); } catch (TesseractException e) {System.err.println(e.getMessage()); } }

注意：在新版本中识别引擎不能为0，否则报错

3.环境变量配置

我是用idea时需要配置环境变量，告知tessdata文件夹的位置，并且加入到Environment variables:TESSDATA_PREFIX=D:\Tesseract-OCR\tessdata

java使用tesseract-ocr进行文字识别

文章目录

前言

一、tesseract-ocr是什么？

二、使用步骤

1.下载exe安装包

2.安装

3.使用

3.设置全局path

二、java如何进行调用

1.引入依赖

2.demo使用

3.环境变量配置

最新关注

热文推荐

传统分布式网络架构

网格交易策略

Vue Element UI 中 el-table 树形数据 tree-props 多层级使用避坑

Linux centos安装Redis数据库并远程连接

如何高效开发一款微信小程序

MySQL知识【数据库相关概念】第一章

java使用tesseract-ocr进行文字识别

文章目录

前言

一、tesseract-ocr是什么？

二、使用步骤

1.下载exe安装包

2.安装

3.使用

3.设置全局path

二、java如何进行调用

1.引入依赖

2.demo使用

3.环境变量配置

相关文章

最新关注

热文推荐