DOC软件文档百宝箱

扫描件 OCR 转可编辑文字教程

拍照或扫描得到的 PDF 是整页图片,改不了字也搜不到。本篇讲怎么用 PDFelement 的文字识别(OCR)把扫描件变成可搜索、可复制、可编辑的文件,以及识别质量不行时从哪里排查。相关文档:手机上怎么编辑PDF文字与图片 · PDF合并拆分与页面整理方法

一、什么文件需要 OCR

先确认手里的是不是扫描件,别白跑一遍识别:

二、识别步骤

以 PDFelement 安卓版为例(OCR 属于会员能力,未开通时进入会提示升级):

  1. 打开这份扫描件;
  2. 在工具区找到「OCR」或「文字识别」入口;
  3. 选识别语言——语言要与文件正文一致,选错语言是识别出乱码最常见的原因;
  4. 等识别完成,应用会生成一层可搜索的文字层;
  5. 之后这份文件就能全文搜索、复制文字、直接改字,编辑操作见 手机上怎么编辑PDF文字与图片。

三、识别质量怎么保证

识别效果七分在原件、三分在操作:

环节做法
拍摄光线均匀、对焦清晰、页面拍正、整页入镜,四角不要缺
原件打印体识别好于手写体;字号太小的先放大复印再扫
语言与正文一致;混排文件选主语言
识别后通读一遍再交付,重点核对数字、人名、金额这类易错内容

四、识别不出来怎么排查

顺带一提,PDFelement 除扫描与 OCR 外也支持把 PDF 转成 Word 继续处理,页面整理(合并、拆分、提取)的做法见 PDF合并拆分与页面整理方法;功能总览与安装文件资源入口在 PDFelement 安卓版介绍站。

同站更多