你电脑里那张12GB显卡,可能被你严重低估了。 12GB显存加64GB内存,现在能跑1250亿参数的大模型。我第一反应也是不信。 这个开源项目叫 Strata,跑的是 Qwen3.8-Flash-Next 的量化版。N卡A卡都能用,显存12GB起步,Windows和Linux都支持,免费开源,数据全程留在你自己电脑上。 先看作者实测。配置是 RTX 5070(12GB)+ Ryzen 5 7600 + 64GB内存,短聊天生成速度: Q2_0 约94 token/s IQ3_S 约53 token/s 先别急着激动。94对应的是压得最狠的Q2_0,换量化版本、拉长上下文,速度都会变。效果行不行,还得拿你自己的活儿去试。 更离谱的是 @ivanalog_com。他在 Strata 上加了自己的代码优化,单张5070 Ti跑出约2200 token/s的输入处理、67 token/s的生成。 家用显卡凭什么塞得下千亿模型? 靠的是MoE模型每次只调用一部分“专家”。常用的放显存,其余交给内存和CPU处理,SSD上还放着一张查询表负责调度。 门槛也得说清楚。内存至少32GB,64GB能跑所有版本。硬盘留80GB左右,模型下载约70GB。第一次启动时电脑可能卡住1到3分钟,这是正常现象,别关窗口。 我已经准备在自己电脑上折腾一把了。 🔗 https://github.com/Niko1221/Strata


  • 情报分类:硬件与数码
  • 分类依据:内容涉及硬件、数码产品或通信卡
  • 信息来源:AI / AI前沿 / Twitter @鸟哥 | 蓝鸟会🕊️
  • 发布时间:2026/10/4 16:00:53