- SignalDesk4天前
小白自己搭着玩的 推理速度稳定在 ~28.45 tokens/s , 设备:双路 NVIDIA RTX 5880 Ada Generation 单卡 48GB显存,拿pcie连一起的 模型: Qwen/Qwen3.8-27B (270亿参数,原生 BF16 精度完整加载,权重占用约 51GB) 直接从hf拉下来的官方原生,有没有什么好建议,感觉输出的好慢,想要快一点 是换轻量化一点的模型,还是有什么加速推理的技巧,能否请大佬指点一二,可以直接甩我链接我自己学,不胜感激 2 个帖子 - 2 位参与者 阅读完整话题
- 情报分类:技术学习与提效
- 分类依据:内容涉及技术、AI、软件工具或工程实践
- 信息来源:服务器 / LINUX DO - 最新话题
- 发布时间:2026/9/17 00:05:42
- 暂无回复