项目名称:PaddleOCR
项目作者:PaddlePaddle
开源许可协议:Apache-2.0
项目地址:https://gitee.com/paddlepaddle/PaddleOCR
项目简介
PaddleOCR 旨在打造一套丰富、领先、且实用的 OCR 工具库,助力使用者训练出更好的模型,并应用落地。
PaddleOCR 是基于飞桨的 OCR 工具库,包含总模型仅8.6M的超轻量级中文 OCR,单模型支持中英文数字组合识别、竖排文本识别、长文本识别。同时支持多种文本检测、文本识别的训练算法。
项目特性
- 超轻量级中文OCR模型,总模型仅8.6M
- 单模型支持中英文数字组合识别、竖排文本识别、长文本识别
- 检测模型DB(4.1M)+识别模型CRNN(4.5M)
- 使用通用中文OCR模型
- 多种预测推理部署方案,包括服务部署和端侧部署
- 多种文本检测训练算法,EAST、DB
- 多种文本识别训练算法,Rosetta、CRNN、STAR-Net、RARE
- 可运行于Linux、Windows、MacOS等多种系统
效果展示
算法介绍
1.文本检测算法
2.文本识别算法
3.端到端 OCR 算法
数据集
PaddleOCR 还为开发者们提供了多种数据集和工具供大家选择使用
- 通用中英文OCR数据集
- 手写中文OCR数据集
- 垂类多语言OCR数据集
- 常用数据标注工具
- 常用数据合成工具
有一说一,这次百度开源的这款 OCR 工具集确实非常不错,如果你对它也感兴趣,想要了解更多信息的话,那么就点击下方了解更多前往项目主页看看吧。