如何让PDF文字可以搜索与复制|用手机进行OCR

把纸质文件扫描成了PDF,里面的文字却既不能搜索也不能复制——这样的经历是不是也遇到过?这是因为PDF以“图像”形式保存而产生的常见问题。本文将介绍如何使用手机应用的OCR功能,让PDF文字变得可以搜索与复制。

简单来说,使用OCR(文字识别)功能,可以在不改变扫描PDF外观的情况下,为其添加可搜索、可复制的文字信息。

为什么扫描的PDF文字无法搜索与复制?

用相机拍摄纸质文件生成PDF时,整个页面是作为一张“图像”被保存下来的。虽然肉眼能看到文字,但在电脑上它只是普通的图像数据,并未被识别为文字信息。因此,在搜索框中输入关键词也搜不到对应页面,也无法通过拖拽选中文字进行复制。

OCR(文字识别)是什么?

OCR(Optical Character Recognition,光学字符识别)是一种解析图像中文字形状、并将其识别为文本数据的技术。执行OCR处理后,原本以图像形式保存的PDF会被添加上“可搜索、可复制的文字信息”,外观保持不变,同时也能作为文本来处理。

在PDF工具箱中进行OCR处理的步骤是?

  1. 在PDF工具箱中,打开想要识别文字的PDF
  2. 从菜单中选择OCR(文字识别)功能
  3. 执行处理后,PDF内的文字会被识别,变为可搜索、可复制的状态

由于处理全部在设备本地完成,即使是包含合同或个人信息的文件,也不会被发送到外部服务器。

OCR的识别精度很大程度上取决于拍摄或扫描时的画质。在没有倾斜、没有阴影、文字清晰的状态下扫描,可以提高后续OCR处理的精度。

OCR处理在哪些场景下有用?

  • 想搜索过去的合同或资料:从大量扫描的文件中,用关键词快速找到对应页面
  • 想引用或转录文件的一部分:无需手动输入,直接复制文字即可
  • 想将纸质资料保存为文本数据:无需再手动重新输入

总结

扫描的PDF文字之所以无法搜索与复制,是因为PDF以图像形式保存。使用OCR功能,可以在不改变外观排版的情况下,为PDF添加可搜索、可复制的文字信息。想提升文件管理与检索效率的朋友,不妨试试看。

PDF工具箱 icon

PDF工具箱

扫描、合并、分割、压缩、OCR文字识别,一个应用全搞定。拍照即可立即生成PDF的免费应用。

📲 免费下载

常见问题

Q. 什么是OCR?

A. 这是一种识别以图像形式保存的文字,并将其转换为可搜索、可复制的文本数据的技术。

Q. 为什么扫描的PDF文字无法复制?

A. 通过扫描或相机拍摄制作的PDF,整个页面是以“图像”形式保存的,不带有文字信息,因此无法直接搜索或复制。

Q. OCR的识别精度如何?

A. 精度会因文字的清晰程度和拍摄状态而不同。在没有倾斜、没有阴影、光线明亮的环境下拍摄的扫描件,识别精度会更高。

Q. 手写文字也能用OCR识别吗?

A. 相比印刷体,手写文字的识别精度往往较低。特别是潦草或不规整的手写字迹,有可能无法被正确识别。

Q. 进行OCR处理后,PDF原有的排版会被破坏吗?

A. PDF工具箱的OCR会保持页面外观的图像不变,只是在其背后添加可搜索的文字信息,因此不会破坏原有排版。

作者:佐藤雄一(实业家・自组电脑100台以上经验/PADI认证潜水员)。详细简介请见这里。