另外windows的朋友可以考虑 light whisper
求个内推就好
有空研究一下 iOS 真的搞得心累 ![]()
话说typeless在ios上面也是url跳转实现的吧 这是他们的核心竞争力吗 ![]()
算是的吧 我尝试做过 他们估计是动态维护了一张巨大的常用app跳转的表 所以冷门小众app无法跳转 这个直接远超我一人力所能及的范围
虽然我不用LLM,但是我今天发现handy也有LLM post processing的选项了。
我之前一直用这个小众宝藏开源版,有llm后处理
![]()
这个做得非常棒啊,感觉LZ花了不少心思,一个观察:现在handy也有post processing,两边同时试了一下用同一个groq的model,hoah感觉transcribing + apply AI action这两步速度还是有点慢,而handy感觉相对较快,一个小小feedback
作者这个产品做得真棒!我本来用闪电说的,发现不如你这个方便。
apply AI action 这个完全取决于api provider没办法
transcribing 最近升级换默认模型为千问之后快多了 系统资源没问题的时候稳定 < 500ms
吼蛙吼蛙
吼蛙最新版更新了Local Streaming 不过可以想像比较吃硬件
666 我回头用我尊贵的m1max 试试
用了一段时间了,中英文混用好用的!赞!
纯英文的时候试了Qwen3和Parakeet V3,感觉实时转录的时候如果有气口都没法很好地断句
Just. Think about it. For now. We don’t need to run any experiment. Yet. Just theoretical.
同样的句子拿FluidVoice - Free Open Source Voice-to-Text for macOS 试了一下感觉没有问题,不知道lz有没有遇到过类似情况
Just think about it for now. We don’t need to run any experiment yet. Just theoretical.
模型选择不一样 QWen3 我记得训练用了很多10秒以内的短句 Parakeet 应该也差不多 Whisper 用的是 30秒
其实不一定,因为具体他用的是哪个版本的模型,其实是还有用的是什么管线,可能是不一样的。我其实没有怎么去关注过这个项目,因为我对他的印象就是比较粗制滥造的垃圾。
就是很神奇,我最开始做之前,我也以为,嗯,这个东西其实就是模型套壳就可以了,但是发现就是大家做出来的效果,其实还是千差万别的。
btw
吼蛙很可耻的只更新到 3.8.3 因为有人联系rebrand了一下在做付费版 从3.8.3到现在我自己也没想到能优化这么多 目前各种工况下都有点sota
比如常用的听写长度 QWen, GLM, Parakeet 都从300 - 500ms 稳定压到了100ms - 200ms 极端可以到50ms Whisper 也从 1秒压到了 500ms 优化了很多冷启动 内存管理
AI Action 延迟也做到了常态 500ms 以内
我还优化了非常多本地流式听写,我不记得3.8.3有没有这个功能了。
我试了一圈,这个同类型的产品。我觉得好像只有,Handy 是做的比较好的,其他的我感觉都不咋地。我也是觉得做到了,好像比 handy 还要好的时候,我觉得可以开始做收费的版本。就是,如果今年,收费版的不咋赚钱,没什么人用,我就直接开源,我觉得可以把很多同类型产品的骨灰都给扬了。
吼蛙吼蛙 ![]()
最近薅了一个 Wispr Flow 的免费试用九十天。我发现 Wispr Flow 有两个非常好用的功能:
-
添加自定义的关键词词典,这样的话就可以在听写的过程中放进去一些特定的常用词汇。
-
Wispr Flow 声称自己可以 index Cursor 里面的文件和变量名,这样可以自动听写出来文件名和变量名。
但第二个功能我目前用的比较少,我还是习惯手敲。不知道这两个是否容易实现。

