Replies: 2 comments 5 replies
|
Hi @ollbao! I'm Dosu and I’m helping the MinerU team. 造成官网和 API 提取同一 PDF 得到的 markdown 内容不一致,主要原因是两者默认的“后端类型”(如 pipeline、VLM、hybrid)、模型版本和参数设置(如是否强制 OCR、语言、表格/公式识别开关)可能不同。即使底层核心解析引擎一致,不同的后端/参数会导致内容结构、识别质量和细节有明显差异,比如部分 API 客户端或插件(如 Dify 旧版)无法选择官网默认的 VLM 后端,只能用 pipeline 或 PaddleOCR,识别效果会低于官网默认的 VLM 模型相关说明。 要保证官网和 API 提取结果一致,需确保:
建议操作步骤:
如已确保参数完全一致仍有差异,可提供 sample 文件、配置、模型 hash 及 debug 输出,便于进一步定位问题。 To reply, just mention @dosu. Share context across your team and agents. Try Dosu. |
0 replies
|
还有为什么通过 api 下载的解析文件里没什么没有block_list.json 这个文件呢,有没有大佬解答下呢?很急!! |
5 replies
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
Uh oh!
There was an error while loading. Please reload this page.
同一个 pdf文件,用你们官网提取的 markdown 内容和 api 提取的 markdown 内容为什么不一致呢?


官网的:
api提取的:
All reactions