最近经常看到各种询问模型哪个好用的帖子,我想大家不会每个模型都用一遍,订阅订错了也很亏钱,所以我来分享一下和我主观感觉接近的榜单和怎么通过云测评来云出一个大概率不会出错的答案,方便各位选型和更好的使用模型。 (防止查户口叠甲,本人是大部分模型感兴趣都会用用的类型,持有devin gpt claude glm command code google pro订阅,没有订阅的会通过白嫖渠道使用,平时评论推荐主要出于主观感受,以下内容也是纯主观感受,任何问题友好交流指正) 古德哈特定律 :一个 指标 变成 目标 时,它就不再是一个好指标。 指标原本是某个真实目标的代理。一旦它变成考核标准,人们就会直接优化这个代理本身,而不是它背后真正想要的东西。 所以首先我们排除所有出现在 模型发布页 的跑分表,除 tb4 这种新榜测旧模的情况以外 一切发布前测试的跑分榜单都有刷分风险,况且我想论坛内大部分都是使用ai写代码的,很多跑分场景其实和正常工作场景差很多,我列一下我常看的榜单。 FrontierCode ,cognition的榜单是比较贴近工程师思维的榜单,测试不同 模型 不同 思考等级 写的代码的pr的 可合并性 ,可以说非常贴近大部分码农的使用场景,也是我觉得最值得参考的榜单。 cursorbench ,什么?你想要一个许愿机不想写一堆描述?Cursor通过采集用户数据发现他的用户们也这么想,所以榜单的核心是 真实人机交互与模糊意图理解 ,意图推断多重要我想用过 opus5.5 许愿机的都懂。 nao榜 ,这个榜单的测试集我也了解不多只知道作者在混元上班,且群众认可度高,国模比较全,我想这么小众的榜单没有模型会针对刷分吧?注意如果你是代码区,那么看的是Agentic部分,代表是在非主流语言和复杂系统架构下的能力表现。 AA的 写作榜 ,可以当成 说人话 模型的排行榜,这榜单的opus4.6能看出这大半年各大厂商训练的侧重点…我们rp区的未来… 通过以上榜单对照参考,通过侧重点选型后呢,就到了 思考等级 的问题,同一个模型的不同思考等级先不说能力, 成本差距和完工速度 可以说是巨大的,参考opus5.5, xhigh 和 max 成本差了一倍,成本也代表大致代表步骤,步骤 少 速度肯定更 快 。 同时可以注意到cognition的榜单大部分模型都是 忽上忽下 的折线 思考等级过高或者说过度 RL 导致的 过度思考 会使代码的可交付性 下降 并出现其他一系列 影响体验的行为 , 跑分提高实际体验很烂 ,参考cognition的 报告 cursor的 相关报告 所以参考cognition跑分表和cursor的表可以得出大部分模型的甜点思考等级是Medium / High,且部分高思考等级带来的成本提升高于提升模型等级的成本,举个例子就是sonnet 5.5和opus 5.5,后者的Medium档位明显比sonnet 5.5开 xhigh 便宜。所以不要默认越高就是好了…(有没有看推特牙医的high max大战的) 除此之外,对于我个人来说最重要的,就是 tps 一个模型的输出速度基本决定了我对他的好感度,快就是好是毋庸置疑的,我宁愿用gemini-3.8-flash返工三轮也不想用龟速gpt-5.6-luna写东西,当然只是主观。 tps的指标可以从 openrouter 的模型页分厂商查看 参考这么多当然还是要看实际体验如何,不过本贴是讨论怎么从互联网拼出个能力范围选择模型。 通过这些就可以开始模型论战了 gpt-6-astra vs opus-5.5 你们知道吗? 1 个帖子 - 1 位参与者 阅读完整话题


  • 情报分类:技术学习与提效
  • 分类依据:内容涉及技术、AI、软件工具或工程实践
  • 信息来源:服务器 / LINUX DO - 最新话题
  • 发布时间:2026/10/5 15:08:35