自己想做一个的产品,跟这个紧密相关。早在 23 年 gpt 刚发布的时候,我用它当时的 wishper 模型尝试过的,基础体验很差(很明显,当时的技术还不成熟)。 现在我体验豆包、跟 GPT 的 实时语音聊天,感觉已经非常好了。语气、延时、对用户打断的判断、实时的智能输出。 我跟 GPT 最新大模型聊了大概几天吧,最后的方案简单描述就是: 1.客户端收集录音上传至 语音模型服务,获取文字解析结果(输入内容是模糊或复杂的,所以需要语言模型识别,而不是单纯的语音转文字) 2.将文字结果+特定上下文,发个语言模型,获取回答 3.将回答发给语音模型获取音频,播放给用户 这种就会有很多细节要注意,延时、用户打断、意图判断、上下文管理等等。 延时也会很高,所以想请教,还有其他方向吗?


  • 情报分类:技术价值
  • 命中依据:语音实时对话实现的技术探讨
  • 来源:服务器 / V2EX
  • 原作者:rangoBen
  • 发布时间:2026/9/9 18:00:13