开放式物理RL环境空间，智能体零样本解决未见过人类设计环境！

文摘 2024-11-25 09:00 新加坡

转载自：机器之心

智能体零样本解决未见过人类设计环境！全靠这个开放式物理RL环境空间

当物理推理能力进化后，通用强化学习智能体能在2D物理环境中执行多样化任务了。

在机器学习领域，开发一个在未见过领域表现出色的通用智能体一直是长期目标之一。一种观点认为，在大量离线文本和视频数据上训练的大型 transformer 最终可以实现这一目标。

不过，在离线强化学习（RL）设置中应用这些技术往往会将智能体能力限制在数据集内。另一种方法是使用在线 RL，其中智能体通过环境交互自己收集数据。

然而，除了一些明显的特例外，大多数 RL 环境都是一些狭窄且同质化的场景，限制了训练所得智能体的泛化能力。

近日，牛津大学的研究者提出了 Kinetix 框架，它可以表征 2D 物理环境中广阔的开放式空间，并用来训练通用智能体。

论文地址：https://arxiv.org/pdf/2410.23208
项目主页：https://kinetix-env.github.io/
论文标题：Kinetix: Investigating the Training of General Agents through Open-Ended Physics-Based Control Tasks

Kinetix 涵盖的范围足够广，可以表征机器人任务（如抓取和移动）、经典的 RL 环境（如 Cartpole、Acrobot 和 Lunar）、电子游戏（Pinball）和其他很多任务，如下图 1 所示。

此外，为了后端运行 Kinetix，研究者开发了一种硬件加速物理引擎 Jax2D，它能够高效地模拟训练智能体所需的数十亿次环境交互。他们表示，通过从可表征的 2D 物理问题空间中随机采样 Kinetix 环境，可以几乎无限地生成有意义的多样化训练任务。

研究者发现，在这些环境中训练的 RL 智能体表现出了对一般机械特性的理解，并能够零样本地解决未见过的手工环境。

他们进一步分析了在特定困难环境中微调该通用智能体能带来哪些好处，结果发现与白板智能体相比，这样做能够大大减少学习特定任务所需的样本数量。

同时，微调还带来了一些新能力，包括解决专门训练过的智能体无法取得进展的任务。

Kinetix 详解

Kinetix 是一个大型开放式 RL 环境，完全在 JAX 中实现。

Jax2D

为了支持 Kinetix，研究团队开发了基于脉冲的 2D 刚体物理引擎 ——Jax2D，完全用 JAX 编写，构成了 Kinetix 基准测试的基础。研究团队通过仅模拟几个基本组件来将 Jax2D 设计得尽可能具有表达能力。

为此，Jax2D 场景仅包含 4 个独特的实体：圆形、（凸）多边形、关节和推进器。从这些简单的构建块中，可以表征出多种多样的不同物理任务。

Jax2D 与 Brax 等其他基于 JAX 的物理模拟器的主要区别在于 Jax2D 场景几乎完全是动态指定的，这意味着每次模拟都会运行相同的底层计算图，使得能够通过 JAX vmap 操作并行处理不同任务，这是在多任务 RL 环境中利用硬件加速功能的关键组成部分。相比之下，Brax 几乎完全是静态指定的。

Kinetix：RL 环境规范

动作空间 Kinetix 支持多离散和连续动作空间。在多离散动作空间中，每个电机和推进器可以不活动，也可以在每个时间步以最大功率激活，电机可以向前或向后运行。

观察空间

使用符号观察，其中每个实体（形状、关节或推进器）由一系列物理属性值（包括位置、旋转和速度）定义。然后将观察定义为这些实体的集合，允许使用排列不变的网络架构，例如 transformer。这种观察空间使环境完全可观察，从而无需具有记忆的策略。还提供基于像素的观察和符号观察的选项，它可以简单地连接和展平实体信息。

奖励

为了实现通用智能体的目标，该研究选择了一个简单但具有高度表达力的奖励函数，该函数在所有环境中保持固定。每个场景必须包含一个绿色形状和一个蓝色形状 - 目标只是使这两个形状发生碰撞，此时该情节以 + 1 奖励结束。场景还可以包含红色形状，如果它们与绿色形状碰撞，将会以 -1 奖励终止该情节。如图 1 所示，这些简单且可解释的规则允许表示大量语义上不同的环境。

Kinetix 的表现力、多样性和速度使其成为研究开放性的理想环境，包括通用智能体、UED 和终身学习。为了使其对智能体训练和评估发挥最大作用，该研究提供了一个启发式环境生成器、一组手工设计的级别以及描述环境复杂性的环境分类法。

环境生成器 Kinetix 的优势在于它可以表示环境的多样性。然而，这个环境集包含许多退化的情况，如果简单地采样，它们可能会主导分布。因此，该研究提供了一个随机级别生成器，旨在最大程度地提高表达能力，同时最大限度地减少简并级别的数量。确保每个关卡都具有完全相同的绿色和蓝色形状，以及至少一个可控方面（电机或推进器）。

实验结果

研究者在程序生成的 Kinetix 关卡上进行训练，后者从静态定义分布中抽取。他们将来自该分布的采样关卡上的训练称为 DR。主要评估指标是在手动 holdout 关卡的解决率。智能体不会在这些关卡上训练，但它们确实存在于该训练分布的支持范围内。由于所有关卡都遵循相同的底层结构并完全可观察，因此理论上可以学习一种在分布内所有关卡上表现最佳的策略。

为了选择要训练的关卡，研究者使用了 SOTA UED 算法 SFL，它定期在随机生成的关卡上执行大量 rollout，然后选择具有高学习能力的子集，并在固定时间内对它进行训练，最后再次选择新的关卡。同时，研究者使用 PLR 和 ACCEL 进行了初步实验，但发现这些方法相较于 DR 没有任何改进。

架构

下图 2 是训练所用的基于 transforme r 的架构。可以看到，一个场景被分解为它的组成实体，然后通过网络传递。该网络由 L 层的自注意力和消息传递组成，K 个完全连接层紧随其后。

其中为了以置换不变的方式处理观察结果，研究者将每个实体表征为向量 v，其中包含物理属性，比如摩擦、质量和旋转。

零样本结果

在下图 3 中，研究者分别在 S、M 和 L 大小的环境中训练 SFL。在每种情况下，训练环境（随机）具有相应的大小，而研究者使用相应的 holdout 集来评估智能体的泛化能力。

可以看到，在每种情况下，智能体的性能都会在训练过程中提高，这表明它正在学习一种可以应用于未见过环境的通用策略。

接下来，研究者通过探索学得的通用智能体在受限目标遵循设置中的行为，仔细探究了它的零样本性能。具体来讲，他们创建的关卡在其中心具有单一形态（一组与电机连接并包含绿色形状的形状），目标（蓝色形状）固定在关卡顶部，并且位置 x 是随机的。

研究者测量了目标位置 x 与可控形态位置 x 之间的关联，如下图 4 所示。其中最佳智能体的行为表现为高相关性，因此会在对角线上表现出高发生率。他们还评估了在随机 M 关卡上训练 50 亿时间步的随机智能体和通用智能体。

正如预期的那样，随机智能体在可控形态和目标位置之间没有表现出相关性，而经过训练的智能体表现出了正相关性，表明它可以将操纵形态到目标位置。

微调结果

本节中，研究者探究了在使用给定有限样本数量来微调 holdout 任务时，通用智能体的性能。在下图 5 中，他们为 L holdout 集中的每个关卡训练了单独的专用智能体，并将它们与微调通用智能体进行比较。

研究者绘制了四个选定环境的学习曲线，以及整个 holdout 集的总体性能曲线。在其中三个关卡上，微调智能体的表现远远优于从头开始训练，尤其是对于 Mujoco-Hopper-Hard 和 Mujoco-Walker-Hard，微调智能体能够完全胜任这些关卡，而白板智能体无法始终如一地做到这一点。

深度强化学习实验室

【开源开放、共享共进】强化学习社区\x26amp;实验室，分享推动DeepRL技术落地与社区发展，社区 deeprlhub.com

清华团队提出RL专用神经网络优化器，性能位居榜首

【第二弹】强化微调，用少量样本训练专家模型

【清华大学】当鲁棒控制遇到强化学习：零和博弈视角的非线性拓展

【重磅】阿尔伯塔大学提出“Stream-X”强化学习新范式，无需经验重放、目标网络或批量更新。

强化学习之父Sutton万字采访：炮轰深度学习只是瞬时学习，持续学习才是智能突破的关键

开放式物理RL环境空间，智能体零样本解决未见过人类设计环境！

控制系统可控性检验理论的变革：从模型驱动到数据驱动

【图灵奖得主Yoshua Bengio】提出强化学习新策略，解决策略KL正则化漏洞问题。

【NeurlPS2024分享】北航提出“结构信息原理指导的高效智能体探索”(末尾附开源代码)

【Nature重磅】AlphaChip，谷歌用强化学习设计多代TPU芯片速度超越人类，开源预训练代码

【清华北大腾讯等】联合综述OpenAI o1背后的自博弈(Self-Play)方法原理与技术细节

【重磅发布】OpenAI o1模型(草莓)问世，五级AGI再突破！使用「强化学习」再立大功。

【Nature重磅】RL教父Rich. S. Sutton提出持续反向传播算法，Mujoco中效果良好，深度学习还不如浅层网络？

【清华大学】李升波教授团队总结“强化学习和模型预测控制的区别与联系”

【顶会速递】RLC2024—128篇Accept论文汇总

【首届RL领域会议】Barto、Sutton、Sliver师徒3代，7篇杰出论文奖，独有论文评审机制公布。

【重磅头条】Agent Q智能体发布，利用自我对弈和强化学习, 实现自我纠正和自主改进！

【人物观点】RLHF 只是勉强 RL，前OpenAI大牛Andrej Karpathy全面解读与AlphaGo区别

【滴滴实习生招聘】强化学习项目落地(有转正机会)

【重磅快讯】强化学习大牛John Schulman离职OpenAI, 曾开发PPO|TRPO等, 领导OpenAI强化学习团队！

【重磅最新】OpenAI为RL设计出新的奖励机制

【字节招聘】强化学习智能体研究员

【顶会速递】清华大学提出“利用强化学习破解火箭回收过程的控制难题”

【粉丝福利】抽奖赠书《GPT图解：大模型是怎样构建的》

【腾讯招聘】游戏AI强化学习算法研究员

从文字模型到世界模型！Meta新研究让AI Agent理解物理世界

【重磅开源】LeCun新作Puppeteer=基于强化学习+数据驱动+视觉全身人形控制方法

【好书力荐】大规模语言模型与强化学习：从理论到实践(文末抽奖赠送5本)

【最新综述！】「大模型+强化学习」详解四条主流技术路线

【今日头条招聘】机器人强化学习研究员(2024届优先)

重磅 | 南栖仙策发布强化学习工业决策软件REVIVE 1.0

【开放源码】强化学习经典教材《RL for Sequential Decision and Optimal Control》

【腾讯招聘】强化学习岗位汇总

【吴恩达来信】AI智能体的黎明时刻

【LSTM之父Schmidhuber总结博客】利用循环世界模型和人工好奇心进行强化学习和规划

Richard Sutton ||智能决策器通用模型的探索

【Nature重磅】DeepMind数学模型AlphaGeometry，做对25道几何题，GPT-4惨败得0分

2023计算机科学7项重大突破！「P与NP」50年经典难题，大模型密集涌现上榜

论文分享| AAAI 2024 北航开源社交机器人行为对抗仿真计算平台SIASM，高效提升网络行为对抗能力

【真伪鉴别】OpenAI内幕文件惊人曝出，Q*疑能破解加密！是否具有元认知能力？

新书《面向工业控制的强化学习理论与方法》

【书籍推荐】清华大学李升波教授撰写《面向工业控制的强化学习理论与方法》

OpenAI神秘Q*项目解密！诞生30+年「Q学习」算法引全球网友终极猜想

【官方公布】2023中国科学院院士、中国工程院增选当选院士名单公布

分类

时事

民生

政务

教育

文化

科技

财富

体娱

健康

情感

旅行

百科

职场

楼市

企业

乐活

学术

汽车

时尚

创业

美食

幽默

美体

文摘

原创标签

时事社会财经军事教育体育科技汽车科学房产搞笑综艺明星音乐动漫游戏时尚健康旅游美食生活摄影宠物职场育儿情感小说曲艺文化历史三农文学娱乐电影视频图片新闻宗教电视剧纪录片广告创意壁纸头像心灵鸡汤星座命理教育培训艺术文化金融财经健康医疗美妆时尚餐饮美食母婴育儿社会新闻工业农业时事政治星座占卜幽默笑话独立短篇连载作品文化历史科技互联网

发布位置

广东北京山东江苏河南浙江山西福建河北上海四川陕西湖南安徽湖北内蒙古江西云南广西甘肃辽宁黑龙江贵州新疆重庆吉林天津海南青海宁夏西藏香港澳门台湾美国加拿大澳大利亚日本新加坡英国西班牙新西兰韩国泰国法国德国意大利缅甸菲律宾马来西亚越南荷兰柬埔寨俄罗斯巴西智利卢森堡芬兰瑞典比利时瑞士土耳其斐济挪威朝鲜尼日利亚阿根廷匈牙利爱尔兰印度老挝葡萄牙乌克兰印度尼西亚哈萨克斯坦塔吉克斯坦希腊南非蒙古奥地利肯尼亚加纳丹麦津巴布韦埃及坦桑尼亚捷克阿联酋安哥拉