闲着用电脑上的4090和llama.cpp搭了个本地的API,模型是unsloth的Qwen3.8-27B-UD-Q4_K_XL,24G显存用Q8 kv cache后也只能128K的上下文。 然后今天用本地部署的Qwen3.8-27b完整做一个洗稿的项目,项目规划先用codex做好了,然后丢给DeepSeek Harness调用本地API执行,结果断断续续差不多跑了5个多小时,平均63 t/s的速度,感觉用这东西日常干活还是慢啊。 准备明天给luna max相同的规划方案再跑一次,两边对比下,这种简单的洗稿项目,plus订阅的luna max应该半天也能跑完了。 3 个帖子 - 3 位参与者 阅读完整话题


  • 情报分类:技术价值
  • 命中依据:模型选型对比讨论,有选型参考价值
  • 来源:服务器 / LINUX DO - 最新话题
  • 原作者:找找
  • 发布时间:2026/9/9 17:31:45