Koharu 是一个用 Rust 编写的开源漫画翻译工具,把「识别文字、抠掉原文、翻译、重新排版」整条流水线都放在本地电脑上运行。项目在 GitHub 上已有 5.5k star、373 fork,最新版本 0.81.5 发布于 2026 年 9 月 3 日,采用 MIT 或 Apache-2.0 双许可,Windows、macOS、Linux 都有构建包。它与在线翻译服务的根本区别是:视觉模型和大语言模型都在本机运行,图片不需要上传到任何服务器。
它解决什么问题
漫画翻译通常要经过这几步:定位画面里的文字气泡、识别日文原文、擦掉原文并修复被遮挡的画面、翻译成目标语言、再把译文排版回气泡。在线服务需要把整页漫画上传到云端,原稿和未公开内容存在泄露风险,翻译质量也不可控。Koharu 把这五步自动化,全部在本地完成,数据不出机器,质量和进度都由自己掌握。
整条流程怎么跑
Koharu 的流水线分为五个环节,每个环节都可以单独选模型:
- 检测与分割:Koharu Layout RF-DETR Seg 2XL 模型定位文字区域、气泡和需要清理的区域;
- 文字识别(OCR):支持 PaddleOCR VL 1.6、Manga OCR、Baberu OCR、Hayai OCR 等多个模型,读取气泡内的对话和页面说明文字;
- 画面修复(inpainting):用 FLUX.2 Klein、LaMa、AOT GAN 等生成式模型重建被原文遮挡的画面,翻译前先把原字擦干净;
- 翻译:可以用本地 GGUF 模型(Qwen 3.5、Gemma 4、Ministral 3 等),也可以接云端 API(OpenAI、DeepSeek、DeepL、彩云等);
- 排版与导出:译文自动适配文本框,支持字体回退、竖排中文和从右到左的阅读顺序,成品可导出扁平图片或分层 PSD。
每个环节独立配置,比如检测用本地模型、翻译用云端 API,可以自由组合。
本地翻译与云端 API 的选择
在意隐私的场景可以全部用本地模型:视觉模型和 LLM 都在本机推理,断网也能工作。追求翻译质量时,可以只把翻译环节接到云端:支持 OpenAI、Gemini、Claude、DeepSeek、OpenRouter 等大模型 API,也支持 DeepL、Google Cloud Translation、彩云等机器翻译服务,还兼容 OpenAI 格式的任意端点。两种方式可以在同一个项目里混用。
硬件要求
官方说明支持 CUDA 13.0(需要 NVIDIA Turing 或更新的显卡、R580 以上驱动)、ROCm/HIP 10.0(AMD 显卡)、Apple 芯片的 Metal,以及 Windows 和 Linux 上的 Vulkan。不需要安装完整的 CUDA 或 ROCm SDK,驱动保持最新即可。CPU 也可以跑推理,但速度明显慢。编辑画布基于 WebGPU,即使推理在 CPU 上运行,也需要较新的显卡驱动支持。
安装与项目状态
Windows 上一条命令安装:
winget install koharu
macOS 上用 Homebrew:
brew install --cask koharu
项目已有 2,225 次提交、53 名贡献者、230 个 release,最近一次发版 0.81.5 在 2026 年 9 月 3 日,仍在活跃更新。官方文档站 koharu.rs 提供简体中文文档,上手门槛不高。
结论
Koharu 是目前把漫画翻译全流程本地化的完整开源方案:免费、双许可开源、数据不出本机,一条命令即可安装。如果你经常翻译漫画、在意原稿隐私,或者想完全掌控翻译流程,它值得直接上手试一次。