ocr v6校准数据集
#18289
Replies: 1 comment
|
量化校准集不需要标注文件,但需要和真实部署输入“同分布”。因此,一般不建议为了 PP-OCRv6 单独寻找一个通用校准集;最可靠的是从自己的业务图片中抽取一份只用于校准的代表性样本。 如果量化的是完整 OCR 流程,建议把检测和识别分开准备:
可先从几百张有代表性的检测图、几百到一两千个文本行裁切开始,这是工程上的起点而不是固定要求;继续增加样本,直到量化统计和验证集精度基本稳定。若目前只有部分训练数据,只要其中的图片与生产输入接近,即使没有标签,也可以用于校准。 官方公开数据集列表可用来做流程验证,但通常不能替代自己的业务分布: 最后还需要明确你使用的量化链路(PaddleX、PaddleSlim、ONNX Runtime、TensorRT 或 OpenVINO)以及要量化的是 det 还是 rec,因为不同后端要求的校准输入格式不同。若贴一下当前导出/量化命令和模型目录,我可以按该后端给出可直接运行的目录结构与命令。 |
0 replies
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
Uh oh!
There was an error while loading. Please reload this page.
这边需要将ocr v6的模型量化成int8的格式,需要校准,请问下校准数据集社区有吗,参考这个只拿到了部分训练数据:https://paddlepaddle.github.io/PaddleX/latest/en/data_annotations/ocr_modules/text_detection_recognition.html#3-data-format
All reactions