- SignalDesk1小时前
两张老 V100,也能在本地跑 3210 亿参数的 GLM-5.3-Flash!! 这个开源项目叫 Project Maya。 前几天我写过,12GB 显存 + 64GB 内存,用 Strata 就能跑千问的千亿模型。 这次 Maya 也是基于 Strata 做的,把引擎改成了适配 GLM。 作者实测: 2 张 V100 32GB + 约 32GB 内存 + NVMe SSD, 生成速度最高 40 token/s。 原理还是把常用的模型专家放显存,其他的分散到内存和 SSD,按需调进来。 默认用约 90GB 的 Maya-S 量化模型。 自带网页聊天、图片理解,还兼容 OpenAI / Anthropic API,可以接编程 Agent, 全程本地运行。 目前支持 Linux,Windows / WSL2 还不支持。 有这套硬件、想在本地跑 GLM 的可以看看: https://github.com/mw00/project-maya
- 情报分类:硬件与数码
- 分类依据:内容涉及硬件、数码产品或通信卡
- 信息来源:AI / AI前沿 / 铁锤人 @lxfater
- 发布时间:2026/10/7 23:09:01
- 暂无回复