- SignalDesk3小时前
软件: GitHub - Open-Less/openless: Hold a key, speak, release — AI-polished text appears at your cursor in any app. Open-source voice input for macOS & Windows. (按住快捷键说话,松开即得润色后的文字) · GitHub ASR模型:qwen平台的 qwen-audio-3.1-asr-flash-message 目前唯一缺陷是,openless支持wss访问的模型似乎走的是某种白名单,只能让ai为你写一个中转层,把qwen-audio-3.1-asr-flash-message映射到一个白名单模型上 openless内关闭润色模型,在中转层传递 "disfluency_removal_enabled": true, "intermediate_result_enabled": true 上二参数分别是 识别的同时进行润色 ,实测口水词能100%去掉、轻度逻辑不清晰的语句,能够为你很好的补全句子要素。大部分大字的时候懒得打,但是会让语义更清晰的标点,也会为你补齐。 中间文本实时推送 ,类似之前流式模型的感觉,一边说话一边把转写的内容缓存到openless内,实现一松手立刻出字的效果 这样一套配置解决了三个痛点 实测语音识别准确率高的吓人,基本能想什么说什么,很复杂的多语言场景也能胜任,完美识别你说的原话的同时,能帮你把文字的可读性提升 速度快的批爆,松手到出字大概是200~700ms左右,基本上无感,松手即出字 成本很低,大概是3.0-streaming模型的四成价格,还未计算以前的润色模型开销 1 个帖子 - 1 位参与者 阅读完整话题
- 情报分类:服务器与云资源
- 分类依据:内容涉及服务器、云资源或网络线路
- 信息来源:服务器 / LINUX DO - 最新话题
- 发布时间:2026/9/27 11:07:12
- 暂无回复