OCR(光学字符识别)指让软件自动读出图片里的文字,把它们转成可以复制、编辑、搜索的文本。Umi-OCR 是一款免费开源的文字识别桌面软件,截图识别、批量图片识别、PDF 文字提取、二维码扫描与生成、公式识别都内置其中,安装后完全离线运行,图片不会上传到任何服务器。它在 GitHub 上已收获 47.3k Star,采用 MIT 协议授权,个人使用和商业使用都没有限制。

文字识别需求背后通常站着两类人:一类偶尔从截图里取几行字,另一类每天要处理扫描文档和成批的图片资料。Umi-OCR 对两类人都适用,而「批量」和「离线」这两个特性,让它在处理大量敏感资料时比在线工具更稳妥:识别全程不联网,内容不会离开你的电脑。

截图识别:快捷键唤起,框选即认

打开截图 OCR 标签页后,可以用快捷键唤起截图,框住屏幕上任意区域,其中的文字立刻被识别出来,显示在右侧记录栏里,支持直接划选复制。图片也可以从剪贴板粘贴进来识别。遇到数学公式时,可以调用公式识别功能,把公式图片转成可编辑的公式文本。

批量识别:几百张图片一次跑完

批量 OCR 标签页支持导入 jpg、png、webp、bmp、tif 等常见图片格式,没有数量上限,一次导入几百张图也能排队识别。识别结果可以保存为 txt、jsonl、md、csv 等格式,其中 csv 可以直接用 Excel 打开。任务结束后还可以设置自动关机或待机,适合挂机处理大批量扫描件。

批量识别里有一个「忽略区域」功能:先框住图片中不需要识别的区域(如水印、页眉页脚、Logo),这些位置会在任务中被跳过,避免无关文字混进结果。

PDF 与文档识别:扫描件变成可搜索文本

文档识别标签页支持 pdf、epub、mobi、fb2 等格式。对于扫描版 PDF,它可以先做 OCR 再输出「双层可搜索 PDF」:上层是原始影像,下层是识别出的文字层,文字因此可以被搜索和复制。对于本身已带文字层的电子书,则直接提取原文,不需要识别。

二维码与公式:内置的周边能力

Umi-OCR 还带二维码功能:能扫描截图或图片中的二维码、条形码(支持 19 种协议),也能输入文本生成二维码图片。公式识别面向经常处理数学文档的用户,把公式图片转换为可编辑的公式文本。

两个离线引擎可选

软件内置两套离线识别引擎,可以随时切换:Rapid-OCR 兼容性更好,Paddle-OCR 速度稍快。识别引擎完全在本地运行,这正是整个软件「离线可用」的基础。此外它还提供命令行和 HTTP 接口,开发者可以把识别能力接进自己的脚本或程序。

平台与版本现状

Umi-OCR 支持 Windows 7 x64 及以上与 Linux x64,解压即用、无需安装。最新稳定版为 v2.1.5(2025 年 3 月发布)。项目以 Python 为主、界面使用 QML(一种声明式界面描述语言),由作者 hiroi-sora 维护,配套有插件库和 Windows、Linux 运行库等子仓库,界面支持简体中文、英文、日语等多国语言。

适合谁用

  • 注重隐私的用户:识别过程不联网,图片不出本机;
  • 高频处理扫描件的办公人员:PDF 双层化、批量识别、完成后自动关机;
  • 开发者:命令行与 HTTP 接口可以嵌入现有流程;
  • 经费有限的个人或小团队:完全免费,无订阅与用量限制。

结论是:当文字识别需求涉及隐私、批量或成本时,本地离线工具是比在线 OCR 更合适的选择,而 Umi-OCR 是目前把「免费、离线、批量」三件事都做齐的代表性开源方案。