速度、隐私、简洁,一个不少。
优化的引擎,秒级处理文件
文件本地处理,绝不上传服务器
任何设备、任何浏览器、随时使用
把扫描版PDF变成可搜索、可选中的文字。因为对着截图打字一点都不好玩。
有个扫描版PDF,选不了文字也搜不了?OCR(光学字符识别)可以搞定,把图片文字变成真正的数字文字。
以前的桌面OCR软件又贵又复杂。买个ABBYY FineReader或者Adobe Acrobat Pro,安装、调设置、等半天才能处理完。现在根本不用这些了。在线OCR工具更快、更简单、还免费。拖入文件就能开始。PDFNeo的OCR最厉害的地方是完全在浏览器里运行。你的扫描文档不会上传到服务器。想想看——如果你要识别的是机密合同、病历或者个人文件,你真想把它们发到什么公司的云上去处理吗?当然不想。本地处理意味着绝对隐私。而且有浏览器的设备都能用——手机、平板、Chromebook,全部可以。
让扫描文档变得可搜索。 你扫了一摞纸质文件,结果全是图片PDF。搜不了名字,复制不了段落,什么都找不到。OCR把它们变成真正可搜索的PDF。
从图片或截图中提取文字。 你有个文字截图或者白板照片,想要里面的文字内容。OCR读出图片里的文字,你就可以复制粘贴到有用的地方去了。
把纸质档案数字化。 你有几箱旧文件——发票、合同、信件——想数字化方便查找。全都扫一遍,跑个OCR,几年的纸质档案几秒钟就能搜到。
让PDF更具无障碍性。 扫描版PDF对屏幕阅读器不友好,因为没有真正的文字,只有文字的图片。OCR添加文字层,辅助技术才能朗读文档内容。
先把扫描件清理干净。输入图片质量越好,OCR结果越准。把歪的页调正,去掉灰尘斑点,确保文字清晰。OCR前花一点时间清理,能省很多事后校正的功夫。
知道你的文档是什么语言。OCR知道是什么语言的时候效果最好。如果你的文档是中文、西班牙文、德文或者别的语言,结果可能没那么准。大多数OCR引擎都是优先优化英文的。
输出一定要校对,重要文件尤其如此。OCR很准——现在真的很准——但不是完美的。数字、长得像的字母(l和1,O和0)、特殊字体都可能出错。名字、日期、数字这些关键内容一定要复查。
用你有的最高清版本。OCR需要清晰的文字才能工作。如果有72DPI和300DPI两个版本可选,每次都选300DPI的。准确率的差别是天壤之别。
对于干净、高清的标准字体扫描件,准确率通常在95%到99%之间。质量差的扫描件、手写文字、特殊字体,准确率会下降。重要文件一定要校对一遍。
效果不好。OCR是为印刷体文字设计的。人与人的手写差异太大了。还是用打印或打字的文件效果最好。
不会。所有处理都在浏览器里用JavaScript OCR库本地运行。你的文档从未离开过设备。关掉标签页,就从内存里清除了。
完全不会。OCR只是在原图上加了一层看不见的文字。扫描图片本身保持原样。你看到的还是原始文档——只是现在可以选文字了。
OCR引擎对英文效果最好。其他拉丁字母语言也能处理,准确率各不相同。中文、阿拉伯语、日语等非拉丁文字符支持可能有限。
目前工具会对整个文档做OCR。如果只需要一页,先用提取工具把那页抽出来,再单独做OCR。
取决于文档长度和质量。单页可能只要几秒。一本100页的书可能要几分钟。你设备的处理速度也有影响。