- SignalDesk2 hr ago
原文链接: 如何评价 9 月 28 日发布的Claude Sonnet 5.5? 作者: 某科学的仙人仉 TL;DR:没降多少成本的,性能下降也不多。 建议使用情况: 1、常见开发任务,使用high effort,刚好在速度、开销、质量的甜点位。 2、一般日常工作,如文字处理、搜索、信息处理,high或medium均可,几乎可以低消耗cover一般需求。 横向对比GPT,在一般通用工作、前端开发、审美与文字能力上明显强于GPT6 sol,有着优秀的品味,不仅仅是审美,科研辅助与后端开发等需要深度推理的任务上相比6 sol也不弱。但token消耗明显高于6 sol,在科研一类任务上,暂时没有明显优势。 纵向对比opus,由于价格相比Opus 5.5优势不大(甚至缓存价格一样),性价比被opus 5.5挤压严重,绝大多数任务非常不推荐使用sonnet max档位,而可以考虑用opus high或xhigh替代。甚至sonnet xhigh用opus high替代在多数情况也是性能和价格均更好的选择。同时,由于审美人文和opus 5.5相比差距较大,不要期待在相对开放、并不常规的任务下,仅凭wish能做到和Opus一样的效果。但对于一些相对常规的“分布内任务”,sonnet的性能与opus相差无几,小优于6 sol,价格与速度比opus要好得多。 完成一个任务的价格,平均来看,high档位下,sonnet是opus的60%,但却是6sol xhigh的2~3倍,在我看来需求清晰且审美无关的任务还是应该交给GPT处理。 以下是更详细的分析和一些其他想法: 当前讨论一个模型的性能时,我一向习惯于分为code/work/research三个场景。 而从GPT5.2/opus 4.6开始,模型有了一定的补全需求的能力,幻觉与harness的状态管理也逐渐可以支撑长链无人类辅助的任务,于是传统的vibe xx开始转向wish xx(我自己这样称呼它),这一点在astra/fable和opus 5.5发布后尤其明显。 vibe可以理解为,模型是你手的延伸。你需要不断拆解需求、不断把最终目标细化成一些具体的指令与验收标准、读测试、做可视化、回滚与具体制定迭代方向。但你不需要直接接触最dirty的实现。 wish则可以理解为,模型是你大脑的延伸。你有一个idea,尽可能清晰地从各方面描述这个idea让模型对此有一个清晰的认识,规定出必须要验收的一些需求,然后就 而结合规定的应用场景(vibe, wish) x (code, work, research),我们可以得到一个六维的能力分布: vibe coding就是最传统的衡量模型辅助程序员的工作能力。 vibe work则是各类“脑力劳动”工作者使用对应模型的工作效率。 vibe research就是自GPT5以来大量用于科研辅助的,比如文献调研、代码实现、循环调优、复现结果之类的research assistant的工作。 wish coding应该追溯到kingfall/GPT5一句话生成Minecraft,现在来看就是衡量模型能多大程度替代一个初级/中级程序员的水平。(题外话,软件工程范式逐渐成熟以来,teamwork越来越像leader作为主agent使用其他员工,其他员工存在的主要目的是避免琐碎的细节把leader的context撑爆)(笑)。 wish work自然就是衡量一个模型能多大程度达到一个一般意义上的“虚拟员工”,处理各种文员工作的能力。 wish research现阶段来看是一个迫近的圣杯。短期内,即使是astra在足够非凡的纯open problem上也没有独立的、相较于顶尖人类研究者足够好的taste(即使是数学,LLM的探索有人类的指点也是事半功倍的,但我没办法对openai的内部模型解决NS的过程妄加定论)。短期来看vibe research效率还是高于wish research的。但人类的参与确实正在逐渐减少,并且LLM确实已经具备了相当的独立研究能力,所以这一分项是有足够的梯度且非常重要的。 所以以下的讨论考虑(vibe, wish) x (code, work, research)六项能力,目前只能给出定性且不算准确的体感,现阶段仅代表个人的部分工作场景,供大致参考。后续会使用一些具体、统一评判标准的测试,感兴趣可以关注。 vibe coding: 前端opus 5.5>astra≈sonnet 5.5≈fable5.1(各有所重)>opus 5≈k3>GPT6 sol≈GPT5.6 sol>其他(下略)(对Grok和Gemini使用不多,不算在内) 后端astra>fable5.1>=opus 5.5≈GPT6 sol≈GPT5.6 sol>sonnet 5.5>opus 5>k3 wish coding: opus 5.5>astra≈fable>sonnet 5.5>=GPT 6 sol>=GPT5.6 sol≈opus 5>=k3 vibe working和wish working目前相对缺少数据,暂时不太清楚普遍需求的分布是怎样的,所以不乱评价,仅我自己的用途而言: astra>=fable≈opus 5.5>sonnet 5.5>=GPT 5.6 sol≈GPT 6 sol>opus 5>=k3 vibe research :astra>fable>GPT5.6 sol≈opus 5.5≈GPT6 sol>sonnet 5.5>opus 5≈k3 wish research :astra>fable >> opus 5.5>=GPT5.6 sol≈GPT6 sol>sonnet 5.5>opus 5≈k3 3 个帖子 - 3 位参与者 阅读完整话题
- 情报分类:技术学习与提效
- 分类依据:内容涉及技术、AI、软件工具或工程实践
- 信息来源:服务器 / LINUX DO - 最新话题
- 发布时间:2026/9/29 11:22:25
- No replies yet