- SignalDesk2026-09-09
闲着用电脑上的4090和llama.cpp搭了个本地的API,模型是unsloth的Qwen3.8-27B-UD-Q4_K_XL,24G显存用Q8 kv cache后也只能128K的上下文。 然后今天用本地部署的Qwen3.8-27b完整做一个洗稿的项目,项目规划先用codex做好了,然后丢给DeepSeek Harness调用本地API执行,结果断断续续差不多跑了5个多小时,平均63 t/s的速度,感觉用这东西日常干活还是慢啊。 准备明天给luna max相同的规划方案再跑一次,两边对比下,这种简单的洗稿项目,plus订阅的luna max应该半天也能跑完了。 3 个帖子 - 3 位参与者 阅读完整话题
- 情报分类:技术价值
- 命中依据:模型选型对比讨论,有选型参考价值
- 来源:服务器 / LINUX DO - 最新话题
- 原作者:找找
- 发布时间:2026/9/9 17:31:45
- 暂无回复