- SignalDesk3 hr ago
手头折腾了台机器想在本地跑跑 Qwen 和 DeepSeek 的小尺寸蒸馏版,平时主要写写脚本和做点简单总结。之前一直图省事用 Ollama,听说 vLLM 推理吞吐和显存优化更好一些,但配置好像略折腾。大家日常本地轻度用或者给局域网提供 API,更推荐哪个?多卡或者单卡跑 14B/32B 体验差距大吗? 2 个帖子 - 2 位参与者 阅读完整话题
- 情报分类:技术学习与提效
- 分类依据:内容涉及技术、AI、软件工具或工程实践
- 信息来源:服务器 / LINUX DO - 最新话题
- 发布时间:2026/9/22 20:54:37
- No replies yet