Handy 是一个免费、开源的桌面语音输入应用:按下一个快捷键开始说话,松开后你说的话就会被转成文字,并自动输入到当前光标所在的任意文本框里。整个过程都在你自己的电脑上完成,语音不会上传到任何服务器。它面向所有想在电脑上「用嘴打字」的人——比如不想手敲长文的普通用户、需要语音输入的无障碍人群,以及一切在意语音隐私的人。

这个项目在 GitHub 上已经拿到 31.5k star(仓库 cjpais/Handy),最新版本 v0.9.6 发布于 2026 年 8 月 24 日,支持 Windows、macOS 和 Linux 三大桌面系统。

它解决什么问题

主流语音输入的普遍做法是「云端识别」:录音被传到服务器,识别成文字后再传回来。好处是识别模型可以做得很大,坏处是你的每一句话都经过了别人家的服务器——内容、口音、环境音都可能被留存。

Handy 换了一条路:把语音识别模型直接装进本地电脑,录音、识别、输出全在本机完成。官方对它的定位很明确:语音不进云端,无障碍工具不该被付费墙挡住。它自认的目标也不是「最好的语音转文字应用」,而是「最容易被二次开发的那一个」——代码完全开放,任何人都能 fork(复制一份代码自己改)扩展。

怎么用它

使用流程只有三步:

  1. 按下设置的快捷键开始录音(可以按住说话,也可以按一下切换开关)
  2. 说完松开,识别在本机完成
  3. 转好的文字自动粘贴进你正在用的应用——聊天窗口、邮件、代码编辑器都行

安装也很简单:Windows 上执行 winget install cjpais.Handy,macOS 上执行 brew install --cask handy,也可以直接去 GitHub Releases 页面下载安装包。首次启动后在设置里授权麦克风和辅助功能权限、配置快捷键即可。

本地识别是怎么做到的

Handy 的技术底座是 Tauri——一种用 Rust 语言写系统层、用网页技术写界面的桌面应用框架,比传统的 Electron 方案更轻量、内存占用更小。前端界面用 React + TypeScript,后端用 Rust 处理音频和模型推理。

识别部分提供两类模型选择:

  • Whisper 系列:OpenAI 开源的语音识别模型,提供 Small / Medium / Turbo / Large 四档,有 GPU 时自动加速,适合追求高准确率的用户
  • Parakeet V3:NVIDIA 推出的 CPU 优化模型,不需要独显也能跑,中端 CPU(官方在 i5 上测试)大约能以 5 倍实时速度处理语音——说 1 秒的话,约 0.2 秒就出结果,还支持自动语言识别,不用手动选语言

此外,录音时会有 VAD(语音活动检测) 把关——它负责判断「人什么时候开始说话、什么时候停」,把沉默的片段过滤掉,既省算力也减少误识别。

适合谁用

  • 隐私敏感用户:工作内容、个人对话不想经过云端,Handy 的本地处理是硬性保障
  • 语音输入高频用户:写长文、回消息、记笔记不想一直敲键盘的人
  • 无障碍需求人群:手部不便、需要纯语音操作电脑的用户,免费开源意味着没有订阅门槛
  • 开发者:想研究或改造语音输入方案的人,可以直接基于它二次开发,官方还提供命令行参数和 Raycast 集成(macOS 上通过 Raycast 插件控制开始/停止录音)

现状与已知限制

Handy 目前支持 Windows x64、macOS(Intel 和 Apple Silicon)以及 Linux x64,仓库已有 64 个正式版本、171 位贡献者,采用 MIT 许可(项目名称和 Logo 等品牌资产不开放使用)。

需要注意的已知问题:Linux 的 Wayland 图形环境支持有限,需要额外安装 wtype / dotool 之类的输入工具才能正常把文字送进文本框;Whisper 模型在部分 Windows 和 Linux 配置下存在崩溃报告,项目正在社区里征集修复。

结论

如果你的诉求是「语音输入,但语音绝不出本机」,Handy 是目前免费开源方案里最值得一试的一个:安装一条命令、使用三步搞定、模型可选 CPU 或 GPU,隐私和可控性都握在自己手里。