提取文本
把 PDF 里的文字取出来,变成能编辑的东西。逐页、按阅读顺序,输出纯文本或 Markdown。
拖入需要提取文字的 PDF
或者 选择文件
报告、论文、电子书、账单都可以。扫描页没有文字层,勾选下方的「识别扫描页(OCR)」可以识别它们。
—
—ℹ️
先说清楚"阅读顺序"在这里是什么意思。PDF 里没有段落,也没有栏,只有一堆被摆到坐标上的文字块。所谓提取,就是从这些坐标把顺序猜回来: 把基线相同的归成一行,再从左到右排,大多数正常排版都能对上。分栏版面、表格、夹在正文里的图注, 就是猜到会露馅的地方。这里不把软换行并成段落, 因为猜错的代价是标题被上一段吃掉,比老老实实留一个换行更糟。
页眉页脚只在每页最前 3 行、最后 3 行里找,并且要求同一行在至少 60% 的页面上重复出现才会被去掉。 标题推断以正文字号中位数为基准,所以偶尔会把加粗的图注误当成标题。 这两项处理了什么,结果里都会如实列出来。
OCR 会在你的浏览器里运行约 7 MB 的识别引擎,只在首次使用时下载一次。 它识别印刷体英文;手写或低画质扫描件的结果会有偏差,请核对结果。
可以直接改:版面排错的地方,导出或复制之前先修掉。
