使用tesseract进行图形验证码识别

maven

        <dependency>
            <groupId>org.bytedeco.javacpp-presets</groupId>
            <artifactId>tesseract-platform</artifactId>
            <version>3.04.01-1.3</version>
        </dependency>

配置

在resources目录下新建tessdata目录,然后从tessdata获取一个ENG.traineddata,再在tessdata目录下新建configs目录,设置几个配置文件

  • api_config
tessedit_zero_rejection T

表示开启tessedit_zero_rejection

  • digits
    可以设置白名单
tessedit_char_whitelist 0123456789ABCDEFGHIJKLMNOPQRSTUVWXYZabcdefghijklmnopqrstuvwxyz
  • hocr
tessedit_create_hocr 1

tessedit_create_hocr 1,表示输出Html的意思

使用

public static String recognize(String fileName)  {
        BytePointer outText;

        tesseract.TessBaseAPI api = new tesseract.TessBaseAPI();
        String path = OcrUtil.class.getClassLoader().getResource("").getPath();
        if (api.Init(path, "ENG") != 0) {
            System.err.println("Could not initialize tesseract.");
            System.exit(1);
        }

//        api.SetVariable("tessedit_char_whitelist", "0123456789ABCDEFGHIJKLMNOPQRSTUVWXYZabcdefghijklmnopqrstuvwxyz");
//        api.SetPageSegMode(tesseract.PSM_SINGLE_LINE);

        // Open input image with leptonica library
        lept.PIX image = pixRead(fileName);
        api.SetImage(image);
        // Get OCR result
        outText = api.GetUTF8Text();
        String captcha = outText.getString();
        // Destroy used object and release memory
        api.End();
        outText.deallocate();
        pixDestroy(image);
        api.close();
        return captcha.trim();
    }

doc

最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

相关阅读更多精彩内容

友情链接更多精彩内容