- SignalDesk55分钟前
有人做了一个"星际争霸"AI 对战测试(Brood War Bench),让当下主流大模型互相打即时战略,结果所有模型的水平都没超过新手。 《星际争霸:母巢之战》是 1998 年的经典即时战略游戏,也是 AI 研究的老朋友,2019 年 DeepMind 的 AlphaStar 就曾在这款游戏里击败职业选手。但那是专门训练的强化学习 AI。这次测试不同,它让通用大模型以 AI 智能体的形式直接上手操作,看看它们能不能自己建基地、造兵、打仗。 作者 Ben Swerdlow 原本只是做了一个"只能通过智能体操控"的星际争霸版本,拿来和朋友玩。没想到几个几乎没玩过星际的朋友表现还不错——他们说自己就下了句"去进攻"的命令,智能体就自己造了支小部队冲过去了。这让他好奇:如果完全让 AI 自己玩,能打到什么水平? 答案是:很菜,但很有意思。 排名第一的 Codex Astra 打了 18 场全胜,但它最擅长的不是正面作战,而是"骚扰":派一个采矿的工人(Probe)跑到对方基地捣乱。这招对 AI 对手特别好使,因为对面的智能体看到一个工人来了,会花几十秒思考该怎么办,期间什么都不干。而在正经的经济发展和大规模作战方面,Codex 反而比较弱,经常造一两个兵就往对面扔,而不是攒够兵力再出击。 Claude Fable 排第三,胜率 83.3%,是所有参赛模型里最"像在认真打游戏"的。它会老老实实发展经济、爬科技树,甚至在一局里造出了飞龙(Mutalisk),在另一局里研究到了圣堂武士科技。虽然有时候研发做了一堆,兵力没跟上,但至少在"试图理解游戏规则"这件事上,Fable 比谁都认真。 Grok 的表现最差。Grok 4.6 在一场 43 分钟的比赛里输出了超过 11000 个推理 token,却只发出了 6 批操作指令,全程没造过一个战斗单位。它本质上是把即时战略当成了回合制游戏,一直在想,忘了要动手。 这个测试揭示的核心问题是:当前大模型在需要持续观察、快速决策、多线程协调的实时环境中,还远远不够用。即使是表现最好的模型,一个会打"光子炮速推"(一种最基础的快攻战术)的人类新手就能赢下所有比赛。但反过来看,这些模型已经能理解建造、采矿、进攻的基本概念,只是在执行节奏和多任务协调上差得远。 测试的代码和对战平台已经开放,任何人都可以带自己的智能体上去打一局,地址是 http://bw.swerdlow.dev。
- 情报分类:技术学习与提效
- 分类依据:内容涉及技术、AI、软件工具或工程实践
- 信息来源:AI / AI前沿 / 宝玉 @dotey
- 发布时间:2026/9/22 02:12:28
- 暂无回复