每天听简报,了解最新科技、AI、软件资讯
有开发者构建了一个针对大模型智能体的《星际争霸:母巢之战》测试基准,让它们直接通过 API 实时操作游戏。评测结果显示,OpenAI 的 o1 和 o3-mini 模型在对战中表现最为出色,而 Grok 和 Codex 系列难以应对这种需要长期规划和战术协调的复杂场景。这个基准放弃了常见的做题式评估,要求智能体在受限视野下进行真实的战略决策。在社区讨论中,许多人认为即时战略游戏是检验模型推理与操作能力的绝佳环境。也有评论回顾了早期的 AlphaStar,期待通用模型未来能展现出相似的对战水平。
进度保存在本设备 · 登录同步