- SignalDesk2小时前
有人自己写了个推理引擎,用 RTX 3090,把千问 27B 跑到了每秒 273 token! 这位开发者叫 @coffeecup2020,引擎叫 tqllm,跑的是 Qwen3.8-27B 的 TQ3_4S-v2 量化版。 273 token/s 是什么概念? 用人的阅读速度比喻: - 30 token/s:输出已经很流畅,可以边看边读,不用一直等下一个字。 - 60–70 token/s:文字明显跑在阅读前面,一段还没读完,后面的内容已经出来了。 - 273 token/s:更像一块块文字迅速铺出来,你还在看开头,后面已经生成了一大截。 那千问 27B 有多聪明? 官方说的是和Claude Opus 4.6 Max相当 所以现在等着大佬把这个推理引擎放出来了,这下面这个项目的那个 160 多少 GB 的那个 近这几天推理部署已经变天了 铁锤人 : 12GB 显存 + 64GB 内存,也能跑千亿模型了!! 这个开源项目叫 Strata,跑的是 Qwen3.8-Flash-Next 的量化版 作者的测试配置是 RTX 5070(12GB 显存)+ Ryzen 5 7600 + 64GB 内存,短聊天生成速度: Q2_0 版约 94 token/s IQ3_S 版约 53 token/s 但 94 token/s 对应的是压缩更狠的 Link: https://x.com/lxfater/status/2106363641704366281
- 情报分类:硬件与数码
- 分类依据:内容涉及硬件、数码产品或通信卡
- 信息来源:AI / AI前沿 / 铁锤人 @lxfater
- 发布时间:2026/10/4 19:40:01
- 暂无回复