哦我的老天爷,宣传说32g内存+12g显存的电脑上就能跑tmd qwen3.8-flash-next,这strata简直像魔法一样, 我真想用我的靴子狠狠地踢只肯给那么点显存的老黄的屁股,哦我一定会的 但总归有些担心,这玩意儿会不会损失太多,还不如直接llama.cpp跑qwen3.8-27B啥的,所以假期最后一天,挂着做了一些测试 测试环境 (点击了解更多详细信息) 测试基线 llama.cpp qwen3.8-flash-next bf16 cpu计算版 值得注意的是,基线仅仅只是更改cpu计算跟gpu计算,都会产生挺大的差别,互相的KLD尽管只有0.0126,PPL 1.0001,但top-1一致率却只有95.4% opus对此的解释 (点击了解更多详细信息) 这也解释了为什么unsloth其他模型能接近99%的q8,在qwen3.8-flash却只有94.122%的原因,毕竟同模型换成gpu计算都能差这么多 根据硬件编解码跟软件编解码的经验,我觉得还是cpu大人算的最准,故选取cpu计算版作为基准 测试模型 Orcarouter/Qwen3.8-flash-next-uncensored IQ4_XS Orcarouter/Qwen3.8-flash-next-uncensored IQ3_XXS ISTA-DSLab/Qwen3.8-flash-next-GSQ-RCO IQ3_XXS 这个就是strata里setup时的推荐量化版 测试文本 AI生成的英文文本、代码文本 人写的古文诗歌 除非那个时候已经有AI了 人跟ai都有参与的、中日英三语交织的,我个人项目中的开发文档 测试结果 由于Strata引擎的限制,能实测的部分只有KLD@256,会比实际KLD略低一些,但llama.cpp两者都能实测,故Strata的KLD是由对应的KLD@256进行的估算(估算的比例系数由llama.cpp两者实测值提供) llama.cpp跟strata的差异 省流:仅仅只有误差等级,单纯改用strata本身不会导致kld跟top-1的劣化 数据 (点击了解更多详细信息) uncensored跟strata中自带的esp strata中自带了Experimental speed projection的去安全护栏补丁( 默认不开启,可以让ai帮忙配一下 ),尽大可能保留模型能力下,做到去除大部分的护栏 省流:推荐使用GSQ量化+esp,质量能跨级打uncensored的上一级量化,拒绝了再考虑orca 数据 (点击了解更多详细信息) 没找到啥benchmark,让ai帮忙找都会触发护栏,所以只是通过chat简单尝试了几种普遍的拒绝场景 拒绝率 (点击了解更多详细信息) Yarn拓宽到1M的损失 省流:此处测的是对262k以内这种本来完全不需要用Yarn的场景,比较吃惊的是损失还好,比用esp还小,当然确实存在损失 数据 (点击了解更多详细信息) 注意,测试结果的所有数据中的KLD不可与Unsloth等KLD直接比较,因为测试文本不尽相同(感觉中日英太复杂了拉低了好多),等下次放假用同文本补测个unsloth的一些量化版本,方便数据换算 什么?今年已经没有假了?补药这么对窝啊 只跑了一点的benchmark 只有一点点数据,由AI总结 (点击了解更多详细信息) 时间太久了,才知道原来跑一个benchmark这么耗费时间,最终选择了测KLD 本来是想qwen3.8-27b-uncensored q6跟qwen3.8-flash-next-uncensored iq4_xs对比的,结果光AIME都干了2h,lcbv6跟gpqa更是要跑一天,算鸟算鸟 1 个帖子 - 1 位参与者 阅读完整话题


  • 情报分类:硬件与数码
  • 分类依据:内容涉及硬件、数码产品或通信卡
  • 信息来源:服务器 / LINUX DO - 最新话题
  • 发布时间:2026/10/7 23:13:21