【吼蛙】Vibe了一个 Mac 听写转文字LLM后处理的App (新增选中文本一键处理)

另外windows的朋友可以考虑 light whisper

1 个赞

求个内推就好

1 个赞

有空研究一下 iOS 真的搞得心累 :joy:

话说typeless在ios上面也是url跳转实现的吧 这是他们的核心竞争力吗 :yaoming:

算是的吧 我尝试做过 他们估计是动态维护了一张巨大的常用app跳转的表 所以冷门小众app无法跳转 这个直接远超我一人力所能及的范围

虽然我不用LLM,但是我今天发现handy也有LLM post processing的选项了。

1 个赞

我之前一直用这个小众宝藏开源版,有llm后处理

:troll: :troll: :troll:

这个做得非常棒啊,感觉LZ花了不少心思,一个观察:现在handy也有post processing,两边同时试了一下用同一个groq的model,hoah感觉transcribing + apply AI action这两步速度还是有点慢,而handy感觉相对较快,一个小小feedback

作者这个产品做得真棒!我本来用闪电说的,发现不如你这个方便。

apply AI action 这个完全取决于api provider没办法
transcribing 最近升级换默认模型为千问之后快多了 系统资源没问题的时候稳定 < 500ms

:yanjing: 吼蛙吼蛙

吼蛙最新版更新了Local Streaming 不过可以想像比较吃硬件

666 我回头用我尊贵的m1max 试试

用了一段时间了,中英文混用好用的!赞!

纯英文的时候试了Qwen3和Parakeet V3,感觉实时转录的时候如果有气口都没法很好地断句

Just. Think about it. For now. We don’t need to run any experiment. Yet. Just theoretical.

同样的句子拿FluidVoice - Free Open Source Voice-to-Text for macOS 试了一下感觉没有问题,不知道lz有没有遇到过类似情况

Just think about it for now. We don’t need to run any experiment yet. Just theoretical.

模型选择不一样 QWen3 我记得训练用了很多10秒以内的短句 Parakeet 应该也差不多 Whisper 用的是 30秒

但是我在FluidVoice里面也是选的Parakeet V3,所以理论上模型是一样?

其实不一定,因为具体他用的是哪个版本的模型,其实是还有用的是什么管线,可能是不一样的。我其实没有怎么去关注过这个项目,因为我对他的印象就是比较粗制滥造的垃圾。
就是很神奇,我最开始做之前,我也以为,嗯,这个东西其实就是模型套壳就可以了,但是发现就是大家做出来的效果,其实还是千差万别的。
btw :yanjing: 吼蛙很可耻的只更新到 3.8.3 因为有人联系rebrand了一下在做付费版 从3.8.3到现在我自己也没想到能优化这么多 目前各种工况下都有点sota
比如常用的听写长度 QWen, GLM, Parakeet 都从300 - 500ms 稳定压到了100ms - 200ms 极端可以到50ms Whisper 也从 1秒压到了 500ms 优化了很多冷启动 内存管理
AI Action 延迟也做到了常态 500ms 以内
我还优化了非常多本地流式听写,我不记得3.8.3有没有这个功能了。

我试了一圈,这个同类型的产品。我觉得好像只有,Handy 是做的比较好的,其他的我感觉都不咋地。我也是觉得做到了,好像比 handy 还要好的时候,我觉得可以开始做收费的版本。就是,如果今年,收费版的不咋赚钱,没什么人用,我就直接开源,我觉得可以把很多同类型产品的骨灰都给扬了。

6 个赞

吼蛙吼蛙 :mobaidalao:

1 个赞

最近薅了一个 Wispr Flow 的免费试用九十天。我发现 Wispr Flow 有两个非常好用的功能:

  1. 添加自定义的关键词词典,这样的话就可以在听写的过程中放进去一些特定的常用词汇。

  2. Wispr Flow 声称自己可以 index Cursor 里面的文件和变量名,这样可以自动听写出来文件名和变量名。

但第二个功能我目前用的比较少,我还是习惯手敲。不知道这两个是否容易实现。