- SignalDesk23小时前
背景 上次部署了 Qwen3.8 Flash IQ3,后来没怎么用了,因为DeepSeek V4 Flash Vision Exp暂时满足我的需求了 然而最近拉闸了,都换成 → V4.1 Flash了,甲太厚了 受不了了,重操就业 本地部署了 因为我是不对称双卡,又有usb4这种低宽带的,跑不了vllm或者sgland 继续llama.cpp了,但是之前的输出速度我并不满意, Prefill 300-600 tps 20-30 于是想到了,直接让GPT6 Astra看llama.cpp给出优化,给出方案后让gemini 3.8 Flash按照方案去做和测试 模型配置 用的 Qwen 3.8 Flash Next 一个 iq2 uncensored 版本 和 unsloth q2kl 对话的话开ub1024 prefill能破1000,但是48k上下文,20k上下文时tps 40 写代码的话开ub512 prefill 600-700 比以前快了很多,以前就300多,基本上45tps KV Cache用 k8v4 51B的 Engram 放在内存 于是 鹈鹕,凑合吧 毕竟是Q2KL 要是用四张2080Ti 的话应该很爽,可以上 iq4然后拉满上下文 整张鹈鹕 后话 GPT6真厉害,感谢GPT6 另外这些llama.cpp的补丁代码我也不知道是不是可以提交,不知道是不是专项优化还是什么,也不懂 所以我也不敢提交 有一说一 这个orcarouter的uncensored版本做得不行,有很多回避 优化的内容 CUDA 256/256 稀疏 MMA Tensor Core 算子启用 Windows PLE 虚拟内存批量预读 CUDA 零显存单 CTA Top-K QSA 融合核函数 QSA Indexer 原生 2D 池化与 CPU 线性快路径 计算图中注入 QSA 稀疏长度提示 双卡流水线显存副本自适应与 QSA 总线饱和消除 QSA Indexer 前端融合与冗余拷贝消除 QSA Indexer Key 准备全链路算子大融合 1 个帖子 - 1 位参与者 阅读完整话题
- 情报分类:硬件与数码
- 分类依据:内容涉及硬件、数码产品或通信卡
- 信息来源:服务器 / LINUX DO - 最新话题
- 发布时间:2026/9/18 16:26:54
- 暂无回复