AgentOdyssey:面向测试时持续学习智能体的开放域长程文本游戏生成框架

arXiv:2606.24893v1 发布类型:全新
摘要:为了使智能体在测试时能够持续从与世界的交互中学习,它们必须能够有效进行探索、获取新的世界知识与技能、保留相关的阶段性经验,并在长期内进行规划。为评估测试时持续学习智能体的这些关键能力,我们提出了“AgentOdyssey”这一新颖的评估框架——该框架通过程序化生成方式,构建出具有丰富实体、复杂世界动态以及长期任务的开放式文本游戏。至关重要的是,“AgentOdyssey”突破了传统机器学习中“测试时不会发生学习”的假设,将智能体置于一个连续且长期内的环境中,在部署过程中交替进行学习与推理。我们进一步提出了一套多维度的评估方法,不仅衡量游戏进程,还针对世界知识的获取、阶段性记忆、对象与动作的探索、动作的多样性以及模型成本等关键指标开展诊断性测试。我们在所生成的游戏中对多种智能体范式进行了评估。实验结果揭示了智能体关键能力的若干重要局限,同时也发现了影响其“有意义的视野”的重要因素。尽管性能会随着基础模型的增强而提升,但即便是表现最出色的智能体,其水平仍远低于人类的表现,因此仍有巨大的改进空间。在智能体机制中,我们发现短期记忆对多种智能体范式均有益处,并且是智能体测试时训练的重要组成部分。

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论