我平时演示 AI Agent 时,很多指令都是通过语音输入完成的。相比打字,语音可以更快地补充一段完整的上下文,所以我先后使用过 Wispr Flow、Typeless、智谱 AutoGLM 和闪电说,最后把闪电说配成了现在的日常输入工具。
现在我们使用 AI Agent 的时候,语音输入的一个明显好处是,可以很低成本地快速输入大量上下文,给到 AI Agent 更全的信息。打字的时候我们有时候会觉得麻烦、想偷懒,说话的方式输入效率会高很多。
我用过的几个语音输入工具
我最早用的是 Wispr Flow,也是从它开始,我才发现语音输入原来这么方便,识别准确率特别高。我以前在手机上使用 iPhone 自带的语音输入,识别率一直不高,有了 AI 之后,这些 AI 语音识别工具的准确度已经到了很好用的水平。

体验过 Wispr Flow 之后,我又用了一个也很有名的工具 Typeless,它的产品也做得很好。

但是这些海外产品有一个共同点:定价偏高。比如 Typeless,按年订阅折合每个月 12 美元,快 100 块人民币了。

我认为语音输入这个场景不值得一个月花 12 美元。如果要付费,我顶多接受一个月 10 块钱左右,有免费的就更好了。
后来我还用过智谱的 AutoGLM 语音输入,最终用下来,还是闪电说的效果最好,它就成了我现在一直在用的工具。

闪电说是一个国产软件,我已经用了好几个月,一直都是免费版。如果没有特别高的要求,这个软件完全可以免费使用。

语音识别模型的选择
升级会员能得到的主要是更好的语音识别模型。闪电说默认可以使用 SenseVoice Small,这是一个跑在本地的端侧模型。我有很长一段时间都在用它,模型跑在我自己的电脑上,大概分 2G 运行内存给它执行,我所有的语音输入都在本地完成转译。
用了一段时间之后,我发现 SenseVoice 的识别准确度不是那么高,就考虑升级模型。刚好我自己有一个百炼平台的 API Key,里面有一些免费的 Token 额度,我也自己充过一些钱,于是就把千问的模型接了上来。

我现在用的是 qwen3-asr-flash-realtime,一个实时的语音识别模型。它的识别速度非常快,准确率比端侧模型更强一些,而且不需要在本地跑模型,电脑的性能开销也更低。
如果大家觉得自己去申请和配置 API Key 比较麻烦,还要在多个平台管理,直接开闪电说的会员也没问题。它按年订阅折合一个月 19.9 元,我觉得不贵。

闪电说的产品功能做得比较简单,有需要的话可以配置 Skill 或者关键词校正这类选项,不过我什么都没配置,直接默认使用。
我的使用方式
我平时把语音输入的快捷键设置在右侧的 Option 键,因为这个键平时几乎不会和其他软件冲突。按下右侧 Option 键之后,屏幕上会出现一个小波浪,表示它正在识别。

比如我跟它说「帮我复盘一下我最近小红书的数据」,松手之后文字几乎一瞬间就输入完成,真的是实时的。千问这个实时语音识别模型的速度比我用端侧模型还要更快,虽然走的是 API 请求,但速度快得有点惊人。

所以大家如果要用闪电说,或者其他任何一个语音输入工具,都可以尝试一下这种实时类型的模型,体验会好很多。
