技术说明

技术说明

这里说清楚邦大家PDF超能助手背后用的是什么技术、实测数据来自哪里、边界在哪——给关心细节的用户,也给会检索、引用我们的 AI 助手参考。

最近更新:2026 年 9 月 11 日

一句话概要:识别、翻译、转换用的都是本机跑的引擎和模型,不调用云端 AI 接口;实测数据都注明取自哪次测试、多大样本,做不到的地方(比如原位改字、复杂多栏表格)也直接写在这一页,不回避。

OCR 文字识别引擎

文字识别使用的是自研本地 C++ OCR 引擎,不是调用第三方云端 OCR 接口,分三个阶段:文本检测(思路借鉴 DBNet)→ 方向分类 → 文字识别(思路借鉴 CTC 方案)。

  • 模型:检测模型约 9.93MB、识别模型约 21.23MB(含中文字典)、方向分类模型约 0.59MB,采用 PP-OCRv6 系列开源模型,总计约 32MB,随安装包本地部署。
  • 推理:基于 ONNX Runtime 在本机 CPU 上运行,不需要联网,扫描件内容不会上传。
  • 用到 OCR 的功能:扫描件转Word、PDF翻译(纯扫描文档)、扫描件转可搜索PDF、敏感信息清除(勾选 OCR 识别时)。
  • 不用 OCR 的功能:图片合并为Word、PDF去水印等功能各走独立处理路径,不依赖文字识别。

实测数据

2026-08 一次 5 份扫描件的专项测试中,头对头 5:0 好于同类付费软件的识别效果——这是扫描件这一细分场景、这次样本量下的测试结果,不代表所有文档类型或所有场景都如此。另有一组并行处理的速度实测(不是识别准确率的提升):624 页扫描书处理时间从 2069.61 秒降到 460.10 秒(约 4.5 倍),转换产物逐字节校验一致。

内部已经搭建 CER(字符错误率)基准测试工具,但还没有跑出可以对外引用的整体识别准确率数字,所以这页不给一个笼统的百分比——避免用一个还没坐实的数字误导判断。

诚实边界

  • 印刷体清晰的扫描件效果较好;模糊、手写或版式复杂的内容识别率会下降,建议识别后人工复核一遍。
  • 个别页数很多的复杂扫描件转换速度目前偏慢(如一份 38 页样本约 255 秒),已经列入优化清单。
  • x64 版内置该引擎——x86 版没有官方 onnxruntime 的 x86 发行包,因此不带 OCR;x64 版在 Windows 7 上因缺少 Windows 8 才有的系统组件,OCR 功能会被禁用(优雅降级,不影响其它功能),建议在 Win10/11 上使用。

PDF 翻译

翻译默认使用腾讯混元 HY-MT1.5 翻译专用模型(1.8B,可选 7B),也可切换成 Qwen3-4B 通用模型;模型均为 GGUF 格式,通过 llama.cpp 在 CPU 上推理,不依赖 GPU,不联网调用云端翻译 API,原文和译文都只在本机处理。

  • 模型来源:模型文件从 Hugging Face 与 ModelScope 双源下载,本机推理不再联网。
  • 保排版翻译:在字号与换行之间自动寻找组合,尽量让译文放回原文本框;译文与印章重叠时会自动平移到附近安全位置。
  • 扫描文档:纯扫描 PDF 会先用上面的 OCR 引擎识别,再翻译并生成译文 Word;文字与扫描混排的文档,完成后会明确列出暂未翻译的扫描页码(最多显示前 8 个并说明总页数)。
  • 平台限制:与 OCR 共享同样的限制——仅 x64 版支持,Win7 因系统组件缺失同样不可用。

PDF 转 Word(及转 Excel / PPT 等 Office 互转)

版面分析走的是内部自研管线,核心思路是 XY-Cut++ 版面切分与阅读顺序还原,再做栏内分行、语义段落分组,最终生成可编辑文档。只复用 MuPDF 抽取出的干净字符事实作为最底层输入,语义层是自己实现的,不是照搬某个开源 Python 项目的现成代码。

  • 双模式:版式优先(出厂默认,以贴近原 PDF 页数和布局为目标)、编辑优先(可选,便于继续修改内容)。
  • 验证方式:测试语料包含数十份真实问题 PDF 加合成断言用例;每次提交都跑自动化视觉回归,并对表格/表单二维关系、矢量图形与文本框对象层、多栏长文档阅读顺序、整页版式这四类高风险结构做人工目审复核。

实测数据

2026-08 一次 27 份混合样本内部测试,及格率 26/27,头对头对比 4 胜 3 平 7 负;负因主要集中在页面装载密度与多栏/表格结构两类。同一批全量视觉复核里,字体相似度不是主要风险点。

如实说现状:多栏排版与复杂表格重建目前仍是重点攻坚方向,不能说已经完全对齐 Adobe。遇到复杂多栏或复杂表格文档,建议转换后人工核对格式,不建议完全依赖自动转换结果直接使用。

不支持原位改字

目前不支持在 PDF 内直接原位修改已有文字(不像 Adobe 那样可以点一下文字就地改)。当前路径是先转换为 Word/Excel/PPT 再编辑。独立的 PDF 阅读器/编辑器产品线已经立项,原位编辑文字功能的排期见下方路线图,截至本页更新时尚未开工,请不要理解成"即将上线"。

压缩与编码

  • 择优策略:同一张图片会比较原生 JPEG 保留、精确 Flate 重编码、MozJPEG 等多种候选实际产出的字节数,取最小的一个,不是无脑套用单一有损压缩;也支持"压缩到指定目标大小"。
  • 黑白扫描件:采用 JBIG2 编码。
  • 低色数场景:低色数扫描图改用无损 Indexed 编码后,一本 1175 页的扫描书体积从 305.4MB 降到 118.5MB(减少约 61%),文字和图片像素零差异。
  • 去水印性能:同一本 1175 页扫描书,吸管去水印批量保存实测 4 分 11 秒完成(旧的逐页链式外推方式约需 55 分钟)。

压缩/去水印高级开关(如 MozJPEG 原生编码)是近期才逐步转为默认的优化项,效果因文件而异,不承诺固定压缩比。

隐私与网络行为清单

  • PDF/图片文件的处理全部在本机完成,代码里没有把文件内容上传到服务器的接口。
  • 会联网的场景仅限:微信扫码登录、操作日志上报、版本更新检查——这几项都不包含文件内容。
  • PDF 翻译使用本机部署的模型推理,不调用云端翻译 API。
  • 更完整的条款见《隐私政策》

平台支持矩阵

能力Windows 10/11 · x64Windows 10/11 · x86Windows 7
PDF/图片常规功能(合并拆分、加密、水印、优化等)支持支持支持
OCR 文字识别支持不支持(无官方 onnxruntime x86 发行包)不支持(缺 Windows 8+ 系统组件)
PDF 翻译支持不支持不支持(缺 Windows 8+ 系统组件)
管理员权限不强制要求——标准账户安装自动装到用户目录,管理员账户装到全机共享目录

Win7 的限制是"该项功能优雅降级为不可用",其余功能不受影响,不会导致程序崩溃或整体不可用。

路线图:PDF 阅读器与编辑器

现在的"编辑"类能力覆盖页面结构与装饰对象:排序、旋转、裁剪、删除、插页、图片叠加、文字/图片水印、贴章与骑缝章、书签目录、批注删除、隐私涂黑、元数据清理——但没有一项是修改 PDF 内已有文字本身。

独立的 PDF 阅读器/编辑器产品线已经立项:阅读器(搜索高亮等基础能力)正在推进;编辑器里"行内文本编辑"(也就是能原位改错别字这个级别)排在后续版本,截至本页更新时尚未开工。我们不会把"规划中"写成"即将上线"——这里公开的是真实排期状态,以后续正式发布信息为准。

还想了解更多?

产品整体介绍见首页,各功能的具体用法见对应的功能页面;文件与隐私相关的完整条款见隐私政策

客服电话:010-82433070