简单用鹈鹕做了下测试,对比了astra、gpt6-sol、gtpt5.6-sol、opus5.5 4个模型,medium和ultra两种effort(oups为xhigh),共8种组合的鹈鹕测试。统计了任务完成时间、token消耗与预估开销。 prompt统一为“Generate an SVG of a pelican riding a bicycle.” 1 个帖子 - 1 位参与者 阅读完整话题