- SignalDesk1小时前
众所周知,很多测试榜单都被刷爆了,导致跑分虚高实际体验拉胯。(点名AA榜第5的Muse Spark、DeepSWE短暂第一的哈基米、 Livebench对标Astra Fable的梁子)。Terminal Bench 4是8月底更新的,各家暂时来不及刷题,姑且可以当做有参考价值,上面提到的三个模型在这个榜单确实分数暴降。想问问佬们现在还有没有别的榜单相对有参考价值的? 1 个帖子 - 1 位参与者 阅读完整话题
- 情报分类:技术学习与提效
- 分类依据:讨论AI模型评测榜单可靠性与刷分现象,属技术学习与提效话题。
- 信息来源:服务器 / LINUX DO - 最新话题
- 发布时间:2026/9/23 09:26:20
- 暂无回复