像本地部署一些满血的开源模型,想要预估一下成本,比如部署GLM-5.3-Flash,原生 FP8,需要最低及以上需要哪些nvidia A/N系列的卡能部署,这些卡各需要多少张,8/32/64并发的情况下各能产生多少token/s 不考虑硬件成本,卡的事情不用担心 可以私聊或者线下都可以(有报酬的) 5 个帖子 - 4 位参与者 阅读完整话题