个人最近在vibe一个小玩意,大致就是用模拟某位博主的声音去做视频 然后此前选定的克隆模型是gpt sovits v2plus,但实际跑出来感觉效果不尽人意,所以特来问下有无更好更轻量的推荐(运行的显存需求最好控制在8g以内) 除此之外我还希望这个可以像gpt sovits那样支持放一段参考音频那种去可以操控下说话感情,当然假如模型强大到能自主识别的话也没问题 除此之外有点想了解有没有将音频和视频对齐的项目或者方案推荐,我当前是参考的NarratoAI 这个开源项目,去创建一条时间轴去安排对齐的,可是这样观感还不是很好,且跑不同的类别的时候可能又会发生错位 多谢各位佬了 4 个帖子 - 4 位参与者 阅读完整话题


  • 情报分类:技术价值
  • 命中依据:语音克隆模型推荐,有技术选型价值
  • 来源:服务器 / LINUX DO - 最新话题
  • 原作者:sihasiha
  • 发布时间:2026/9/9 19:50:11