跳到正文
原文
rohanpaul_ai· @rohanpaul_ai · X·· 6 小时前AI 评分57

清华论文评测AI智能体从对局回放学习游戏策略:可登顶人类榜单但复杂规则下多停滞

AI 导读

清华一篇论文构建了 AAArena,包含来自清华年度 bot 构建比赛的 12 个游戏和 1,920 个存档人类程序作为对手,让一个编码智能体在模型权重不变的前提下读规则、选对手、研究回放并在比赛预算内重写自己的 bot。

正文 · AI 翻译

清华大学最新论文发现,通过比赛回放改进游戏机器人的 AI 智能体可以登上人类排行榜榜首,但在规则复杂的游戏上大多会陷入停滞。

让 AI 从有限的比赛场次中学习获胜策略仍然很困难,尤其是在面对不断变化的对手时。

他们基于清华大学年度机器人构建大赛的 12 款游戏构建了 AAArena,并以 1,920 个存档的人类程序作为对手。一个编码智能体在模型权重不变的情况下,阅读规则、选择对手、研究回放,并在比赛预算内重写其机器人。

在全部 3 款测试游戏中,详细回放都优于仅基于胜负的反馈。借助回放,一个吃豆人机器人达到了第 1 名,而没有回放时仅排第 11 名。

将比赛预算提高到三倍,并未使 4 个陷入停滞的机器人中的任何一个升至第 1 名。

– arxiv. org/abs/2610.12341

标题:《AI 智能体能通过学习登顶吗?在一场长期运行的游戏智能体竞赛中评估启发式学习》

来源:rohanpaul_ai · x.com