- SignalDesk2026-09-15
现在 GPT 和 Claude 基本成了O/和A/了,很多人想知道还有什么模型可以拯救一下当下工作 我这边只额外推荐一个:Grok 4.6 (限 Grok Bot / Grok Build 渠道) 为什么只推它: 思维链风格和 Claude 很接近,不是只会堆答案; 能力不弱,能扛住下面这种加强压测; DeepSeek、Gemini 这类,按我实测就先别指望了。 一、自己测:加强版「糖果博弈」 附件: candy-game.zip (1.8 KB) 专门测: • 内部推理够不够深; • 长任务 agent 会不会假完成、局部最优; • 最坏情况下能不能给出可执行保证策略; • 解题是全局分流,还是「有解就停」。 怎么看结果(别只看对错): 答案准不准; 解题思路像什么模型; 耗时(参考:Astra、Claude 能在约 15 分钟内做完且答对)。 二、第三问特别有意思 Astra 和 Claude 都能在时限内做对,但: • 第三问这两家都很难主动给出两种不同解题思路; • Astra 无论怎么测,第三问思路几乎永远同一条,很适合用来验证你手里的是不是真 Astra(同答案、同分流指纹)。 三、实测范围 & 求补测 我目前只测过:Gemini、DeepSeek、Astra、Opus。 其他国产模型手里没额度,测不了。有资源的朋友麻烦把完整作答贴出来(最好带耗时和第三问思路摘要)。 标准答案(仅对照用,测完再看): solution.zip (6.1 KB) 3 个帖子 - 2 位参与者 阅读完整话题
- 情报分类:技术学习与提效
- 分类依据:内容涉及技术、AI、软件工具或工程实践
- 信息来源:服务器 / LINUX DO - 最新话题
- 发布时间:2026/9/15 15:24:13
- 暂无回复