- SignalDesk3 hr ago
省流版:(基于以下评测) 最新模型Opus 5.5,GPT-6.1 Sol 的确效率高,但思考强度选 Medium 就好, 效果好还省钱 简单项目用GPT-6 Luna,思考强度一定选 Max 国产就考虑Kimi K3和GLM 5.3 flash 评测原文: FrontierCode Leaderboard | Cognition 以下为手写版。AI润色版稍后发公众号。 Cognition公司(Devin开发商)发布了其FrontierCode 1.1的最新排行榜,加入了新鲜出炉的GPT-6.1 Sol以及Claude Sonnet 5.5的评测结果。 FrontierCode专注于代码正确性和代码质量,也是第一个衡量可合并性的基准:代码维护者是否愿意合并这个AI生成的PR? 我们的标准使用一系列评分技术(包括单元测试、评分标准和新型验证器)来评估端到端代码质量(正确性、测试质量、范围规范、风格和对代码库标准的遵守情况)。 每个任务都由其所属开源仓库的维护者精心打造:20 多位世界一流的开发者构建了真实、多样化且具有挑战性的任务,每个任务耗时超过 40 小时,并且他们定义了各自仓库中“可合并”的含义。由于评分标准具有主观性,我们构建了一套完善的质量控制流程,包括对抗性测试、校准和多阶段审查,其中每个任务都由认知研究员进行人工审核。 FrontierCode还限制了互联网的使用。模型可以像工程师一样使用互联网,例如阅读文档和搜索错误信息,但任何访问包含解决方案的来源(例如原始拉取请求)的运行都会被检测到,并被评为零分。 除了给大模型的代码质量打分之外,该评测也列出了任务平均token费用,让我们来看看目前哪款模型“质价比”最高? 先上一个评测结果全家福。纵轴为根据评分标准各项指标的加权总分,横轴为每次任务的平均美元支出。即左上角的模型效率最高,右下角最低。 从这份评测结果里我们首先可以获得一个反直觉的结论:模型思考强度越高token消耗一定更多,但代码质量未必更好。比如Opus-5,Opus-5.5,GPT-6.1 Sol等模型的 Medium 思考强度都比Max分数更高,任务费用也更低。 第一梯队 :Opus 5.5 medium以54.6%的最高分略微领先GPT-6 Astra max,从分数上看差距很小,然而Opus 5.5使用medium思考强度获得的这一最好成绩,平均费用仅为GPT-6 Astra max的17%,质价比不可思议的断层领先。 A社其他模型 :Sonnet 5.5相比Opus 5.5似乎并不划算,唯一值得一用的是Sonnet 5.5 high,得分落后Opus 5.5 5个点,但费用节省一半。Fable 5/5.1目前已不值得使用,得分被Opus 5.5压制,且费用高很多。 再来看看OpenAI家:GPT-6.1 Sol medium的表现在第二梯队非常抢眼,平均费用显著低于分数更低的众多模型。 虽然分数比GPT-6 Astra max低一些,但是费用之后前者的8%啊。 而在成本敏感的场景, GPT-6 Luna max 则是秒杀一切的存在,以全场最低的$0.1平均运行费用牢牢把控得分排行榜的中段位置。 Gemini和Grok家则都出现了新模型退步的状况 。Gemini 3.7 Flash好过Gemini 3.8 Flash,Grok 4.6好过Grok 4.7。还是期待一下Gemini 4 pro能否有惊喜吧。 至于 国产模型 ,目前的最强者是Kimi K3,能力略逊于Opus 4.8 max但强过GPT-5.5 xhigh 和 Sonnet 5 xhigh,费用也有一定的优势,值得鼓励! GLM 5.3 flash Max分数为31.8%,平均花费$1.15,在国产中有一定性价比。 而其他几位选手表现就不不尽如人意了,GLM 5.3 max偏贵,Deepseek,MiniMax M3得分较低。可惜的是,评测中并未加入Deepseek v4.1 flash以及Qwen 3.8。另外国产模型采用的都不是自家的Code CLI,也可能一定程度上影响分数。 最后总结一下,根据这份评测推荐编程模型如下: Anthropic 用户 :优先考虑 Claude Opus 5.5,推理强度选择 medium 。 OpenAI 用户 :优先考虑 GPT-6.1 Sol, medium 模式在成本和质量之间取得了较好平衡。 成本优先 :可以考虑 GPT-6 Luna,使用 max 模式获得极低的单次任务成本。 国产模型 :优先关注 Kimi K3;对成本更加敏感时,可以考虑 GLM 5.3 Flash。 1 个帖子 - 1 位参与者 阅读完整话题
- 情报分类:技术学习与提效
- 分类依据:内容涉及技术、AI、软件工具或工程实践
- 信息来源:服务器 / LINUX DO - 最新话题
- 发布时间:2026/10/1 02:25:46
- No replies yet