- SignalDesk19 hr ago
llama.cpp 折腾日记 之前主力用的是 Qwen3.8-Flash-Next (从 Qwen3.8 27B 切过来的),部署方案是经典的 llama.cpp + Unsloth UD-Q4_XL 量化。 说实话,短上下文(比如几千字对话)体验确实不错,速度能稳在 40 t/s ,质量也没啥问题。 但一旦遇到长文档场景(比如 100k 上下文),直接崩盘: Decode 速度腰斩 :从 40 t/s 掉到 20 t/s ,生成速度肉眼可见地变慢,基本没法用。 Prefill 太慢 :刚开始读文档那会儿(Prefill阶段),峰值也就 500 t/s 左右,随着上下文累积,速度还会进一步掉到 300+ t/s。处理一个长 PDF 得干等着,体验极差。 换引擎vllm 最近看到社区有个针对长上下文优化的版本:huggingface上面的 albucino/Qwen3.8-Flash-Next-W4A16-FP8PLE`。我让本地qwen3.8 27b折腾了下部署,效果炸裂. 实测数据对比(100k 长上下文场景) 指标 旧方案 (llama.cpp) 新方案 (vLLM + W4A16) 提升幅度 Prefill (读入速度) ~300-500 t/s > 1000 t/s 2-3 倍 Decode (生成速度) ~20 t/s > 50 t/s 2.5 倍+ 代码编写场景 18-25t/s ~60 t/s 流畅 我的“垃圾佬”硬件配置 这套方案是在消费级魔改卡上跑的,配置如下: GPU :2x 魔改 RTX 3080 20GB (部署qwen3.8 flash next) 3x 魔改 RTX 2080 Ti *(部署qwen3.8 27b) CPU :AMD 7543 内存 : 32GB x 8 DDR4-2666MHz 显存占用 测试了几道常见题目效果(xhigh模式) 秦始皇骑骡子巡游古长城svg动画 鹈鹕骑摩托车svg动画 8 个帖子 - 3 位参与者 阅读完整话题
- 情报分类:硬件与数码
- 分类依据:内容涉及硬件、数码产品或通信卡
- 信息来源:服务器 / LINUX DO - 最新话题
- 发布时间:2026/9/18 21:46:43
- No replies yet