趁着手里正在搞个人小项目,就用三个flash模型和四大agent平台分别测试了一下,最后用kimi统一评分,评分标准包括六大维度:准确性与证据质量/分析深度与洞察/覆盖广度/建议可操作性/结构与表达/内部一致性与结论可靠性。最后得分 分差<=2可以视为同一水平 。 结果如图: 大模型对比 : ds4f(76.3) 存在系统性短板,在 4 个系列中均为最低分(尤其是 ZCode-ds4f 仅得 60 分)。 glm5.3f(85.5) 与 qwen3.8f(85.3) 均值基本打平,但 glm5.3f 跨系列表现更加稳健(77~93),而 qwen3.8f 在不同底模下的离散度更高(73~92)。 agent对比 : Claude 综合均分第一且最为均衡(87.0,极差仅 11)。 OpenCode 与 Codex 综合得分接近, 但 Codex 的分数稳定性更高 :极差13:20 PS:剔除表现最差的ds4f以后, ZCode跃居第二 ,与Codex和OpenCode的差距小于误差范围(2),但是稳定性显著领先。 1 个帖子 - 1 位参与者 阅读完整话题


  • 情报分类:技术价值
  • 命中依据:AI模型实测评分,有选型参考价值
  • 来源:服务器 / LINUX DO - 最新话题
  • 原作者:doler
  • 发布时间:2026/9/12 11:51:00