开源推广 (点击了解更多详细信息) 现在 DeepSeek V4.1 Flash 等比较新的模型需要用到诸如 fp8、fp4 等特性,而 A100 是 Blackwell(sm_80)架构的,对此没有原生支持。vllm 等工具的官方文档已经没有 A100 的配方,很多民间方案需要 A100 80GB × 8 才能跑起来,门槛过高。 前一阵发现了 这个项目 ,作者通过重写算子等方法实现了 A100 80GB × 4 条件下部署原版 DeepSeek V4.1 Flash。如果需要视觉、DSpark 功能,可能还要再加一块卡。 这个项目里有很多作者个性化的配置,我部署的时候遇到了不少问题。比如: OpenAI compatible 的交互行为有些异常,部分软件接入有问题 Token 解码存在一定问题,使 emoji 无法显示,部分情况下会发生截断 Dspark、图像链路、前缀缓存、1M 上下文等功能不能兼得(一些 DS 特有的技术解释可以参看我的 可视化 ) 在 AI Agent 的帮助下,我基本解决了上面这些问题,并进行了性能优化。测下来单线程解码速度可以到 55~85 token/s (具体取决于 Dspark 接受率等情况)。 既然得到开源项目的帮助,我的经验也一并开源: github.com GitHub - concentrate1/deepseekv4.1-A100-custom 通过在 GitHub 上创建帐户来为 concentrate1/deepseekv4.1-A100-custom 开发做出贡献。 虽然在有限的测试中没有发现新问题,但毕竟没有经过大规模验证,仅供参考。 1 个帖子 - 1 位参与者 阅读完整话题


  • 情报分类:开源项目与落地
  • 分类依据:内容涉及项目实践、创业、副业或变现
  • 信息来源:服务器 / LINUX DO - 最新话题
  • 发布时间:2026/9/27 15:54:16