在一项名为 Brood War Bench 的测试中,当前主流的大型AI模型被放入《星际争霸:母巢之战》的即时战略环境中相互对抗,结果显示它们的表现均未超越新手。这一结论颇具冲击力,因为《星际争霸》作为AI研究的经典测试平台,自1998年发布以来,一直是焦点。2019年,DeepMind研发的AlphaStar就曾在该游戏中击败职业选手,标志着AI在即时战略领域达到了人类顶尖水平。然而,AlphaStar的成功源于它专门的强化学习训练,而非通用模型。
Brood War Bench的测试围绕当下通用能力强大的大模型展开,这些模型在对话、写代码和处理各种任务方面表现出色,但在实际对战中却无法超越新手。这显示了专门训练的强化学习系统与通用模型之间的巨大差距。在同一款游戏中,两类系统的表现截然不同。
发表评论