如何让PDF文字可以搜索与复制|用手机进行OCR
把纸质文件扫描成了PDF,里面的文字却既不能搜索也不能复制——这样的经历是不是也遇到过?这是因为PDF以“图像”形式保存而产生的常见问题。本文将介绍如何使用手机应用的OCR功能,让PDF文字变得可以搜索与复制。
简单来说,使用OCR(文字识别)功能,可以在不改变扫描PDF外观的情况下,为其添加可搜索、可复制的文字信息。
为什么扫描的PDF文字无法搜索与复制?
用相机拍摄纸质文件生成PDF时,整个页面是作为一张“图像”被保存下来的。虽然肉眼能看到文字,但在电脑上它只是普通的图像数据,并未被识别为文字信息。因此,在搜索框中输入关键词也搜不到对应页面,也无法通过拖拽选中文字进行复制。
OCR(文字识别)是什么?
OCR(Optical Character Recognition,光学字符识别)是一种解析图像中文字形状、并将其识别为文本数据的技术。执行OCR处理后,原本以图像形式保存的PDF会被添加上“可搜索、可复制的文字信息”,外观保持不变,同时也能作为文本来处理。
在PDF工具箱中进行OCR处理的步骤是?
- 在PDF工具箱中,打开想要识别文字的PDF
- 从菜单中选择OCR(文字识别)功能
- 执行处理后,PDF内的文字会被识别,变为可搜索、可复制的状态
由于处理全部在设备本地完成,即使是包含合同或个人信息的文件,也不会被发送到外部服务器。
OCR处理在哪些场景下有用?
- 想搜索过去的合同或资料:从大量扫描的文件中,用关键词快速找到对应页面
- 想引用或转录文件的一部分:无需手动输入,直接复制文字即可
- 想将纸质资料保存为文本数据:无需再手动重新输入
总结
扫描的PDF文字之所以无法搜索与复制,是因为PDF以图像形式保存。使用OCR功能,可以在不改变外观排版的情况下,为PDF添加可搜索、可复制的文字信息。想提升文件管理与检索效率的朋友,不妨试试看。
常见问题
Q. 什么是OCR?
A. 这是一种识别以图像形式保存的文字,并将其转换为可搜索、可复制的文本数据的技术。
Q. 为什么扫描的PDF文字无法复制?
A. 通过扫描或相机拍摄制作的PDF,整个页面是以“图像”形式保存的,不带有文字信息,因此无法直接搜索或复制。
Q. OCR的识别精度如何?
A. 精度会因文字的清晰程度和拍摄状态而不同。在没有倾斜、没有阴影、光线明亮的环境下拍摄的扫描件,识别精度会更高。
Q. 手写文字也能用OCR识别吗?
A. 相比印刷体,手写文字的识别精度往往较低。特别是潦草或不规整的手写字迹,有可能无法被正确识别。
Q. 进行OCR处理后,PDF原有的排版会被破坏吗?
A. PDF工具箱的OCR会保持页面外观的图像不变,只是在其背后添加可搜索的文字信息,因此不会破坏原有排版。