本项目是对论文 Robust Scene Text Recognition with Automatic Rectification ( https://arxiv.org/abs/1603.03915v2 ) 的具体实现
- 能够识别黑体楷体宋体汉字、数字、英文字符、所有标点符号以及特殊符号(@#$%&^等)
- 模型对于绝大部分不规则的文本图像(图片亮度不足、清晰度较低、文本倾斜或弯曲)的识别效果较好;对于现实情境下的文本识别有较强的鲁棒性
- 准确率(平均):93%
- 置信度(平均):0.587
Spatial Transformer Network ( STN ) + Sequence Recognition Network ( SRN )
-
STN:
- Localization Network:CNN 网络,预测基准点集;
- Grid Generator:网格生成器,利用 TPS 变换生成采样网格;
- Smapler: 利用采样网格将输入的带文本图像校正为较规则的文本图像;
- 技术要点:TPS ( Thin-Plate-Spline ) 变换:变换矩阵(T)存储 TPS 参数,将输入图像的各点坐标映射至基准坐标系下的规范点坐标;由于是矩阵乘法,自然可以传播梯度;
-
SRN
- Encoder:CRNN 网络,对输入图像生成特征向量序列 ( CNN+BLSTM );
- Decoder:GRU + Attention,每一步解码由 attention 机制决定,循环生成一个基于输入序列的字符序列
- STN 和 SRN 的训练是一体贯通的,即 STN 没有对基准点的 label,STN 接收从 SRN 反向传播回的梯度,对基准点的位置进行调整