OCR 文字识别引擎
文字识别使用的是自研本地 C++ OCR 引擎,不是调用第三方云端 OCR 接口,分三个阶段:文本检测(思路借鉴 DBNet)→ 方向分类 → 文字识别(思路借鉴 CTC 方案)。
- 模型:检测模型约 9.93MB、识别模型约 21.23MB(含中文字典)、方向分类模型约 0.59MB,采用 PP-OCRv6 系列开源模型,总计约 32MB,随安装包本地部署。
- 推理:基于 ONNX Runtime 在本机 CPU 上运行,不需要联网,扫描件内容不会上传。
- 用到 OCR 的功能:扫描件转Word、PDF翻译(纯扫描文档)、扫描件转可搜索PDF、敏感信息清除(勾选 OCR 识别时)。
- 不用 OCR 的功能:图片合并为Word、PDF去水印等功能各走独立处理路径,不依赖文字识别。
实测数据
2026-08 一次 5 份扫描件的专项测试中,头对头 5:0 好于同类付费软件的识别效果——这是扫描件这一细分场景、这次样本量下的测试结果,不代表所有文档类型或所有场景都如此。另有一组并行处理的速度实测(不是识别准确率的提升):624 页扫描书处理时间从 2069.61 秒降到 460.10 秒(约 4.5 倍),转换产物逐字节校验一致。
诚实边界
- 印刷体清晰的扫描件效果较好;模糊、手写或版式复杂的内容识别率会下降,建议识别后人工复核一遍。
- 个别页数很多的复杂扫描件转换速度目前偏慢(如一份 38 页样本约 255 秒),已经列入优化清单。
- 仅 x64 版内置该引擎——x86 版没有官方 onnxruntime 的 x86 发行包,因此不带 OCR;x64 版在 Windows 7 上因缺少 Windows 8 才有的系统组件,OCR 功能会被禁用(优雅降级,不影响其它功能),建议在 Win10/11 上使用。
PDF 翻译
翻译默认使用腾讯混元 HY-MT1.5 翻译专用模型(1.8B,可选 7B),也可切换成 Qwen3-4B 通用模型;模型均为 GGUF 格式,通过 llama.cpp 在 CPU 上推理,不依赖 GPU,不联网调用云端翻译 API,原文和译文都只在本机处理。
- 模型来源:模型文件从 Hugging Face 与 ModelScope 双源下载,本机推理不再联网。
- 保排版翻译:在字号与换行之间自动寻找组合,尽量让译文放回原文本框;译文与印章重叠时会自动平移到附近安全位置。
- 扫描文档:纯扫描 PDF 会先用上面的 OCR 引擎识别,再翻译并生成译文 Word;文字与扫描混排的文档,完成后会明确列出暂未翻译的扫描页码(最多显示前 8 个并说明总页数)。
- 平台限制:与 OCR 共享同样的限制——仅 x64 版支持,Win7 因系统组件缺失同样不可用。
PDF 转 Word(及转 Excel / PPT 等 Office 互转)
版面分析走的是内部自研管线,核心思路是 XY-Cut++ 版面切分与阅读顺序还原,再做栏内分行、语义段落分组,最终生成可编辑文档。只复用 MuPDF 抽取出的干净字符事实作为最底层输入,语义层是自己实现的,不是照搬某个开源 Python 项目的现成代码。
- 双模式:版式优先(出厂默认,以贴近原 PDF 页数和布局为目标)、编辑优先(可选,便于继续修改内容)。
- 验证方式:测试语料包含数十份真实问题 PDF 加合成断言用例;每次提交都跑自动化视觉回归,并对表格/表单二维关系、矢量图形与文本框对象层、多栏长文档阅读顺序、整页版式这四类高风险结构做人工目审复核。
实测数据
2026-08 一次 27 份混合样本内部测试,及格率 26/27,头对头对比 4 胜 3 平 7 负;负因主要集中在页面装载密度与多栏/表格结构两类。同一批全量视觉复核里,字体相似度不是主要风险点。
不支持原位改字
目前不支持在 PDF 内直接原位修改已有文字(不像 Adobe 那样可以点一下文字就地改)。当前路径是先转换为 Word/Excel/PPT 再编辑。独立的 PDF 阅读器/编辑器产品线已经立项,原位编辑文字功能的排期见下方路线图,截至本页更新时尚未开工,请不要理解成"即将上线"。
压缩与编码
- 择优策略:同一张图片会比较原生 JPEG 保留、精确 Flate 重编码、MozJPEG 等多种候选实际产出的字节数,取最小的一个,不是无脑套用单一有损压缩;也支持"压缩到指定目标大小"。
- 黑白扫描件:采用 JBIG2 编码。
- 低色数场景:低色数扫描图改用无损 Indexed 编码后,一本 1175 页的扫描书体积从 305.4MB 降到 118.5MB(减少约 61%),文字和图片像素零差异。
- 去水印性能:同一本 1175 页扫描书,吸管去水印批量保存实测 4 分 11 秒完成(旧的逐页链式外推方式约需 55 分钟)。
压缩/去水印高级开关(如 MozJPEG 原生编码)是近期才逐步转为默认的优化项,效果因文件而异,不承诺固定压缩比。
隐私与网络行为清单
- PDF/图片文件的处理全部在本机完成,代码里没有把文件内容上传到服务器的接口。
- 会联网的场景仅限:微信扫码登录、操作日志上报、版本更新检查——这几项都不包含文件内容。
- PDF 翻译使用本机部署的模型推理,不调用云端翻译 API。
- 更完整的条款见《隐私政策》。
平台支持矩阵
| 能力 | Windows 10/11 · x64 | Windows 10/11 · x86 | Windows 7 |
|---|---|---|---|
| PDF/图片常规功能(合并拆分、加密、水印、优化等) | 支持 | 支持 | 支持 |
| OCR 文字识别 | 支持 | 不支持(无官方 onnxruntime x86 发行包) | 不支持(缺 Windows 8+ 系统组件) |
| PDF 翻译 | 支持 | 不支持 | 不支持(缺 Windows 8+ 系统组件) |
| 管理员权限 | 不强制要求——标准账户安装自动装到用户目录,管理员账户装到全机共享目录 | ||
Win7 的限制是"该项功能优雅降级为不可用",其余功能不受影响,不会导致程序崩溃或整体不可用。
路线图:PDF 阅读器与编辑器
现在的"编辑"类能力覆盖页面结构与装饰对象:排序、旋转、裁剪、删除、插页、图片叠加、文字/图片水印、贴章与骑缝章、书签目录、批注删除、隐私涂黑、元数据清理——但没有一项是修改 PDF 内已有文字本身。
独立的 PDF 阅读器/编辑器产品线已经立项:阅读器(搜索高亮等基础能力)正在推进;编辑器里"行内文本编辑"(也就是能原位改错别字这个级别)排在后续版本,截至本页更新时尚未开工。我们不会把"规划中"写成"即将上线"——这里公开的是真实排期状态,以后续正式发布信息为准。