- SignalDesk2026-09-09
在先前的 讯飞 Spark-X2.5 测试 过后,官方推出了量化版本 GGUF,llama.cpp 也更新了相关架构。昨天,面壁智能发布了 MiniCPM5-2B 。此外,虽然 Qwen3.5-9B 已经出局了,但 有网友 让我也测一下民间做的 claude-opus-4.6 蒸馏版。所以就放到一起简单品鉴一下吧。 基础配置 所有模型都在 Windows 端 LM Studio 运行(利用其自带的API功能向外部开放),显卡为 RTX 5070 Ti 16GB。更新最新 CUDA 12 llama.cpp 运行时(v2.34.0)以支持 Spark-X2.5-4B 架构(不用自己编译了)。之后每道题都连续测 3 次,记录结果。 MiniCPM5-2B :FP16 原版,测试上下文为 131,072,显存占用 7.55 GB。已经是最高上下文。 Spark-X2.5-4B :Q4_K_M 量化,测试上下文为 131,072,显存占用 8.11 GB。上下文最高 1,048,576,此时显存预估 47.03 G。 Qwen3.5-9B 蒸馏版 :Q4_K_M 量化,测试上下文为 131,072,显存占用 11.86GB。上下文最高 262,144,此时显存预估 16.8 G。此模型支持视觉,本次测试不涉及。 测试 1:普通对话 先来测一下曾经大模型都容易翻车的问题: 9.11和9.9谁大? strawberrrry中有几个r? MiniCPM5-2B: 省流:9.9 对了2道,strawberrrry 对了2道 (点击了解更多详细信息) Spark-X2.5-4B: 省流:9.9 对了2道,strawberrrry 对了0道 (点击了解更多详细信息) Qwen3.5-9B 蒸馏版 : 省流:9.9 对了3道,strawberrrry 对了3道 (点击了解更多详细信息) 测试 2
- 情报分类:技术价值
- 命中依据:小模型测评,有技术参考价值
- 来源:服务器 / LINUX DO - 最新话题
- 原作者:c.1
- 发布时间:2026/9/9 19:19:02
- 暂无回复