- SignalDesk1小时前
起因是刷到 Karpathy 大佬转载的一篇用“画地球”来测模型能力的帖子,感觉挺有意思的。 方法挺简单的,就是取大量经纬度坐标,挨个问模型“某某某坐标是陆地还是水?”。 然后问 16200 次就可以画出一张模型认为的 地图。 X 截图 (点击了解更多详细信息) 看了看 A\ 家模型的结果,似乎真能测出来些啥? Sonnet 4.5 和 Haiku 4.5 都拉完了。到 4.6 代之后感觉地图突然就成型了。 Fable 级和 Opus 5.5 又跟其他的拉开了差距。 到 Opus 5.5 基本就是完全复刻了。 然后自己用百炼的 1M 免费额度测了一些国产模型,还测了下 用不完了发点福利,50000刀jev模型随便用 里面的 jev(感谢佬),测一个大概消耗 0.7 ~ 1.2M token。 deepseek-v4.1-flash 果然真神。从 v4 到 v4.1 变化巨巨巨明显。 其他模型的话,从 kimi-k3 开始基本能看到一些形状了。 deepseek-v4-pro 就基本拉完了,像一坨弄*。还不如 v4 flash。 大家觉得好玩也可以去测测hhh 9 个帖子 - 7 位参与者 阅读完整话题
- 情报分类:技术学习与提效
- 分类依据:内容涉及技术、AI、软件工具或工程实践
- 信息来源:服务器 / LINUX DO - 最新话题
- 发布时间:2026/10/4 21:44:02
- 暂无回复