就山

fivestone: 当我使用语音输入法,而且是不在线不个人定制的本地模型的时候,我说话的方式会渐渐趋向于,避免让输入法混淆,减少失误的样子。譬如避免太潮太生僻的用词,避免冒出单个词,而把它放在可识别的句子语境中。我不知道这是否导致我日常对人说话方式也发生改变?某种意义上,也是一种对同质化的迎合。

这里的离线语音识别,主要是说千问的 SenseVoice Small,最小的约 200MB 的模型,对于普通话和日常英文输入,基本够用了。可以使用 SenseVoice 本地模型,实现脱机语音输入的程序:

  • 安卓手机上用 “说点啥(BiBi Keyboard)”,可以无缝嵌入到修改后的小企鹅(Fcitx5)或者同文(Trime)输入法里,不需要专门的悬浮按钮,而是按空格自动启用语音输入。
  • Windows 和 MacOS 上的 “闪电说

其它离线语音输入的模型和方案:

  • Spokenly,支持多平台,本地模型可以使用 Nvidia Parakeet(多语言但只有西文)或 Whisper Large V3 Turbo(支持中文),但 Whisper 的开销很大,电脑配置低的话,无法实用。
  • 老牌的讯飞输入法也支持下载讯飞模型后离线使用,大约 800MB,效果感觉比 SenseVoice 更好一点?但是,讯飞虽然号称 “离线使用”,但如果真把输入法的联网权限完全禁止,程序会报错无法使用。所以,涉及更敏感的场合,还是不让人放心。
  • 网友说 豆包输入法 在 ios 上也可以下载模型离线使用。我还没有试过,不确定是不是真的 “离线”。

跑题了。其实我想说的是,似乎更多的人,在讨论语音输入法时更偏向于:哪些 ai 做得更好,能够在滚动训练的过程中,识别更复杂更时兴的言语。总之更着眼于技术如何贴近人类的使用习惯,而不是在找到一个够用的工具后,去迎合工具。——显然我这种使用的方式,并不利于技术滚滚发展,而且,能否离线输入,乃至苛求是否 “真·离线”,不同人应用的场合不同,也只能算是个很小众的需求。只是,这种机缘巧合的 “迎合”,也算是种有趣的细微感受。


类似的例子是前不久看到网友的文章《为什么你应该停止在中西文间使用空格》,理由大概是,应该由软件显示时自动在中英文间添加空白,而不是作者手动插入。如今很多软件都支持自动空白了(Word、微信、ios、浏览器……),未来会更好。

这仍然是一个【山来就我 vs 我去就山】的思路差别。

  • 原文不留空格,而让软件添加空白,更偏向于:这个完美的解决方案,需要整个软件世界的配合,然后 等待 / 督促 / 努力建设,让这个世界渐渐向这个方案靠拢;
  • 自己手动添加空格,更偏向于:这个方案不需要等外界配合,我自己动手就可以了,虽然不是最好看,但也可以用了。即使以后整个软件世界都自动添加空白,我这边显示效果会差一点,但也可以用了。

我还是更倾向于后者的,原因是:

  1. 我不太觉得最终真会有一切软件都自动处理空白的世界,更不要谈命令行界面,和等宽字体的环境了。我想象不出这样的世界是什么样子的。
  2. 我对这个世界的其它方面的期待太多了,不想在没什么必要的领域,再加一份期待,有个 80/20 的方案就挺好了。
  3. 如果真有一天,世界在一些方面,成为了我期待的样子。那么,如果再有什么要去突破这个世界的事情,现在享受的这份完美,会不会成为(至少在自身能动性上的)阻力?

Comments

Leave a Reply

Your email address will not be published. Required fields are marked *




Enter Captcha Here :