平时截图、票据、备忘录照片想要提取文字,大多数在线 OCR 工具,都会把你的图片上传到后台服务器。工作截图、隐私照片很容易存在泄露风险。
今天给大家科普一款可以完全在浏览器本地运行的文字识别工具 PP‑OCRv6,不用上传照片,数据全程保存在本机。
PP‑OCRv6 是百度飞桨推出的新一代离线文字识别模型,一共分为三个版本,适配不一样的使用场景:
Tiny 轻量版:体积小巧,加载速度快,适合手机网页;
Small 均衡版:支持 50 个国家语种,大小和识别精度平衡得最好,普通网页首选;
Medium 高精度版:识别效果最强,但文件体积过大,电脑软件更加适配,浏览器并不推荐。
想要在网页当中开启本地识别,目前主流有两个 JavaScript 开发库,二者差别大家可以直接看表格:
表格
对比维度 | 官方 @paddleocr/paddleocr‑js | 第三方 ppu‑paddle‑ocr |
|---|---|---|
开发方 | 百度飞桨官方 | 社区开发者封装 |
运行环境 | 仅支持浏览器 | 网页、电脑后端、命令行均可使用 |
模型文件 | 需要手动下载配置权重 | 自动下载,浏览器本地缓存 |
上手难度 | 繁琐,需要配置字典文件 | 开箱即用,一行代码切换模型 |
开源协议 | Apache‑2.0 | MIT 宽松协议 |
简单来说,追求原生稳定、后续需要表格识别可以选择官方库;普通用户搭建网页工具,优先选择第三方封装库,操作门槛更低。
很多人会担心商用、二次使用的版权问题,这里通俗讲清楚规则:
PP‑OCRv6 模型采用 Apache‑2.0 开源协议,允许免费、商用,只需要页面标注模型来源,不需要强制公开自己网页的源码。
第三方封装库为 MIT 协议,可以自由修改、二次开发,限制很少。只需要底部标注好工具依赖就能够合规使用。
本地 OCR 还有不少实用优点。
它不会像 AI 大模型一样凭空编造文字,小票、快递面单、屏幕点阵字、模糊的印刷字符都能够稳定识别。
所有运算依靠浏览器内置引擎完成,图片不会发送至外网,聊天截图、证件照片、工作资料不用担心隐私外泄。
日常我们可以把它做成网页小工具、浏览器截图插件,电脑手机打开网页就可以一键提取文字。
不需要安装软件、不用注册账号,打开网页即可使用,对于经常需要提取图片文字的上班族十分友好。
