- SignalDesk2小时前
12GB 显存 + 64GB 内存,也能跑千亿模型了!! 这个开源项目叫 Strata,跑的是 Qwen3.8-Flash-Next 的量化版 作者的测试配置是 RTX 5070(12GB 显存)+ Ryzen 5 7600 + 64GB 内存,短聊天生成速度: Q2_0 版约 94 token/s IQ3_S 版约 53 token/s 但 94 token/s 对应的是压缩更狠的 Q2_0,换量化版本、拉长上下文,速度都会变,实际效果也要按自己的任务试 但还有更离谱: @ivanalog_com 用 Strata 加自己的代码优化,单张 5070 Ti 跑到约 2200 token/s 输入处理、67 token/s 生成 所以,问题是家用显卡如何塞得下千亿参数的模型? 实际上,这个项目利用 MoE 模型每次只调用一部分“专家”的特点,常用的放显存,其余由内存和 CPU 配合处理,SSD 还负责一张查询表,负责调度 我已经打算想在自己电脑上折腾大模型这个了 项目地址可以看看这个👇 https://github.com/Niko1221/Strata seekinganythingbutalpha : 过去一周多,可能以后被证明是AI推理部署史上天翻地覆的一周。 上个周末,我的本地机双5070ti试跑Qwen Flash,只能做到200 prefill,10decode。 今天,在Strata和我自制的PR的支持下,目前可以跑到2200/67,而且只需要一张卡。 即读写速度都提高了近十倍。 Link: https://x.com/ivanalog_com/status/2105869490718232989
- 情报分类:硬件与数码
- 分类依据:内容涉及硬件、数码产品或通信卡
- 信息来源:AI / AI前沿 / 铁锤人 @lxfater
- 发布时间:2026/10/3 20:40:01
- 暂无回复