OCR文字识别

识别扫描PDF或图片中的文字。

阅读教程 →

拖放PDF或图片文件到此处

选择文件

为什么选择 PDFNeo?

速度、隐私、简洁,一个不少。

极速处理

优化的引擎,秒级处理文件

100% 安全

文件本地处理,绝不上传服务器

随处可用

任何设备、任何浏览器、随时使用

无需注册 离线可用 无文件限制 永久免费
您的文件在本地处理,从不上传到任何服务器。

关于 PDF文字识别

把扫描版PDF变成可搜索、可选中的文字。因为对着截图打字一点都不好玩。

如何对扫描版PDF进行OCR文字识别

有个扫描版PDF,选不了文字也搜不了?OCR(光学字符识别)可以搞定,把图片文字变成真正的数字文字。

  1. 上传扫描版PDF。 把扫描版PDF或图片文件拖入上传区域。扫描文档、文字照片、截图——只要里面有文字就行。
  2. OCR引擎开始分析。 工具会对每一页进行光学字符识别,检测文字并将图片像素转换成真正的数字文字字符。
  3. 添加文字层。 OCR会在原始扫描图片上面添加一层看不见的文字层。页面看起来没变,但现在你可以选中、复制和搜索文字了。
  4. 下载可搜索的PDF。 下载经过OCR处理的新PDF。打开试试选中文字、搜索关键词,现在应该都能用了。全程都在你设备本地处理。
为什么选择在线OCR,而不是桌面软件?

以前的桌面OCR软件又贵又复杂。买个ABBYY FineReader或者Adobe Acrobat Pro,安装、调设置、等半天才能处理完。现在根本不用这些了。在线OCR工具更快、更简单、还免费。拖入文件就能开始。PDFNeo的OCR最厉害的地方是完全在浏览器里运行。你的扫描文档不会上传到服务器。想想看——如果你要识别的是机密合同、病历或者个人文件,你真想把它们发到什么公司的云上去处理吗?当然不想。本地处理意味着绝对隐私。而且有浏览器的设备都能用——手机、平板、Chromebook,全部可以。

什么时候需要给PDF做OCR?

让扫描文档变得可搜索。 你扫了一摞纸质文件,结果全是图片PDF。搜不了名字,复制不了段落,什么都找不到。OCR把它们变成真正可搜索的PDF。

从图片或截图中提取文字。 你有个文字截图或者白板照片,想要里面的文字内容。OCR读出图片里的文字,你就可以复制粘贴到有用的地方去了。

把纸质档案数字化。 你有几箱旧文件——发票、合同、信件——想数字化方便查找。全都扫一遍,跑个OCR,几年的纸质档案几秒钟就能搜到。

让PDF更具无障碍性。 扫描版PDF对屏幕阅读器不友好,因为没有真正的文字,只有文字的图片。OCR添加文字层,辅助技术才能朗读文档内容。

PDF文字识别的专业技巧

先把扫描件清理干净。输入图片质量越好,OCR结果越准。把歪的页调正,去掉灰尘斑点,确保文字清晰。OCR前花一点时间清理,能省很多事后校正的功夫。

知道你的文档是什么语言。OCR知道是什么语言的时候效果最好。如果你的文档是中文、西班牙文、德文或者别的语言,结果可能没那么准。大多数OCR引擎都是优先优化英文的。

输出一定要校对,重要文件尤其如此。OCR很准——现在真的很准——但不是完美的。数字、长得像的字母(l和1,O和0)、特殊字体都可能出错。名字、日期、数字这些关键内容一定要复查。

用你有的最高清版本。OCR需要清晰的文字才能工作。如果有72DPI和300DPI两个版本可选,每次都选300DPI的。准确率的差别是天壤之别。

常见问题
OCR的准确率有多高?

对于干净、高清的标准字体扫描件,准确率通常在95%到99%之间。质量差的扫描件、手写文字、特殊字体,准确率会下降。重要文件一定要校对一遍。

对手写文字有效吗?

效果不好。OCR是为印刷体文字设计的。人与人的手写差异太大了。还是用打印或打字的文件效果最好。

我的PDF会上传到服务器吗?

不会。所有处理都在浏览器里用JavaScript OCR库本地运行。你的文档从未离开过设备。关掉标签页,就从内存里清除了。

原来的扫描画质会变吗?

完全不会。OCR只是在原图上加了一层看不见的文字。扫描图片本身保持原样。你看到的还是原始文档——只是现在可以选文字了。

OCR支持哪些语言?

OCR引擎对英文效果最好。其他拉丁字母语言也能处理,准确率各不相同。中文、阿拉伯语、日语等非拉丁文字符支持可能有限。

能只识别多页PDF中的某一页吗?

目前工具会对整个文档做OCR。如果只需要一页,先用提取工具把那页抽出来,再单独做OCR。

OCR需要多长时间?

取决于文档长度和质量。单页可能只要几秒。一本100页的书可能要几分钟。你设备的处理速度也有影响。