在Kaggle T4 x2上跑了Qwen 3.6 35B-A3B Q4_K_M, cap 256k, q4 kv 刚跑时用的少, 1500左右PP, 30左右decode 用到200k左右时,掉到1k左右PP, 20左右decode 还跑了Qwen 3.8 27B, 100到300PP, 10到15 decode, 后面没再用 现在本地模型里, 速度和效果怎么选好 1 个帖子 - 1 位参与者 阅读完整话题