- SignalDesk2小时前
Original Summary
如题 Reddit 老哥给 Qwen3.8 flash next 开发了一个专用推理引擎 Strata 在同样的 5070 12G + 64G 5600内存 + 六核 7600 CPU 配置下能够跑到 Q2_0 → 65.1 tps decode + 543 tps prefill IQ2_XS → 52.0 tps decode + 472 tps prefill IQ3_XXS → 44.8 tps decode + 414 tps prefill 与此同时 llama.cpp 的decode只有15tps 另附上原帖链接: https://www.reddit.com/r/LocalLLaMA/comments/1wp7zyb/qwen38flashnext_on_12gb_vram_65_tokens_per_second/ 老哥Twitter: Niko Veit (@coldniko) / X Github项目仓库: GitHub - Niko1221/Strata: Qwen3.8-Flash-Next (125B MoE) on a 12-24 GB NVIDIA GPU + 64 GB RAM: one-click install for Windows / Linux. Strata inference engine, OpenAI/Anthropic API on localhost, optional image input. · GitHub 1 个帖子 - 1 位参与者 阅读完整话题
- 情报分类:硬件与数码
- 分类依据:内容涉及硬件、数码产品或通信卡
- 信息来源:服务器 / LINUX DO - 最新话题
- 发布时间:2026/9/26 19:37:34
- 暂无回复