李飞飞吴佳俊团队新作：推出具身智能决策能力评价基准，o1-preview登顶 | NeurIPS

科技 2024-11-14 17:11 北京

克雷西发自凹非寺
量子位 | 公众号 QbitAI

大模型的具身智能决策能力，终于有系统的通用评估基准了。

李飞飞吴佳俊团队新提出的评估框架，对具身智能决策的四项关键子能力来了个全面检查。

这套基准已经被选为了NeurIPS数据和测试集（D&B）专栏Oral论文，同时也被收录进了PyPI，只要一行代码就能快速调用。

该框架名为Embodied Agent Interface（简称EAI），提供了连接不同模块和基准环境的标准接口。

利用这套框架，作者对18款主流模型进行了测试，形成了一篇超百页的论文。

测试结果显示，在已公开的大模型当中，o1-preview的综合成绩位列第一。

李飞飞本人表示，对这项合作研究感到非常兴奋。

有网友评价说，这项成果为大模型具身智能决策塑造了未来。

四项子能力全面评估

首先，EAI提供了一种统一的目标表示方法，能够兼容不同类型的目标，并支持复杂约束的描述。

团队认为，现有的具身决策任务通常针对特定领域设计目标，缺乏一致性和通用性。

例如，BEHAVIOR和VirtualHome都是具身智能体的评测基准和模拟环境，用于研究智能体在复杂环境中完成任务的能力。

但二者又有所区别，BEHAVIOR使用基于状态的目标，而VirtualHome使用时间扩展的目标。

EAI则通过引入线性时态逻辑（LTL），实现了目标表示方式的统一，提高了模块之间的互操作性，便于比较不同模型在同一任务上的表现。

在具体的评估过程当中，EAI采用了模块化的评估方式，并将评估指标进行了更细粒度的划分。

以往的研究通常将大模型作为整体进行评估，很少关注其在具身决策各个子任务上的表现；

同时，这些现有基准通常只关注任务的最终成功率，很少深入分析模型的错误类型和原因。

为了更深入理解大模型的行为模式和优劣势分布，EAI提出了四个关键能力模块，并设计了一系列细粒度的评估指标：

将模型能力分为四个关键模块；
定义了清晰的输入输出接口；
从轨迹可执行性、目标满足度、逻辑匹配性等多个角度评估模型的性能；
引入了丰富的注释（如目标状态、关系、动作），以实现自动化的错误分析。

具体来说，四个关键模块及内容分别是：

目标解释（Goal Interpretation）：将自然语言表述的任务目标转化为形式化的LTL目标公式；
子目标分解（Subgoal Decomposition）：将任务目标分解为一系列子目标，每个子目标也用LTL公式表示；
动作序列规划（Action Sequencing）：根据任务目标生成动作序列，在环境中执行以达成目标状态；
转换建模（Transition Modeling）：为每个动作或操作符生成前提条件和效果，形成环境转换模型。

另外，EAI选取了两个具有代表性但特点迥异的环境，也就是前面提到的BEHAVIOR和VirtualHome。

相比于单一环境评估，EAI更能考察大模型跨领域的泛化能力，有助于全面理解其适用范围和局限性。

o1-preview综合成绩第一

利用EAI这套标准，研究团队对GPT、Claude、Gemini等18款主流模型（型号）的决策能力进行了评估。

在BEHAVIOR和VirtualHome环境下，o1-preview均获得了排行榜综合成绩第一名。

其中在BEHAVIOR环境中，o1-preview得分为74.9，比第二名的Claude 3.5 Sonnet高了10多分，排在之后的是60分左右的Claude 3 Opus和GPT-4o。

到了VirtualHome环境下，依然是o1-preview领先，但前三名的成绩相对接近。

同时Gemini 1.5 Pro变成了第二名，不过整体来看排行靠前的几个模型和BEHAVIOR环境类似。

当然如果比较单项能力，不同模型也体现出了各自不同的优势项目。

比如在BEHAVIOR环境中，总分排第二的Claude 3.5 Sonnet，目标解释能力略高于总分排第一的o1-preview。

在VirtualHome环境中，总分相对靠后的Mistral Large，在动作序列规划上取得了第一名。

作者还对各模型的失败情况进行了深入分析，发现了将中间状态误识别为最终目标状态、对隐含的物理关系理解不足、忽略重要的前提条件等具体问题。

这些发现能够让研究人员对模型的优缺陷进行更深层的了解，为之后的研究提供了重要参考。

项目主页：
https://embodied-agent-interface.github.io/
论文：
https://arxiv.org/abs/2410.07166
代码：
https://github.com/embodied-agent-interface/embodied-agent-interface
数据集：
https://huggingface.co/datasets/Inevitablevalor/EmbodiedAgentInterface

— 完 —

报名即将截止！

「2024人工智能年度评选」

量子位2024人工智能年度评选将于11月15日截止报名，评选从企业、人物、产品三大维度设立了5类奖项。

欢迎扫码报名评选！评选结果将于12月MEET2025智能未来大会公布，期待与数百万从业者共同见证荣誉时刻。

点这里👇关注我，记得标星哦～

一键三连「点赞」、「分享」和「在看」

科技前沿进展日日相见 ~

http://mp.weixin.qq.com/s?__biz=MzIzNjc1NzUzMw==&mid=2247758331&idx=2&sn=d3e385c1e14bda7a5dad042bbebd100f

量子位

追踪人工智能新趋势，关注科技行业新突破

最新文章

“清华AI医院”上线！首批42位AI医生亮相，诊断覆盖300余种疾病

国产4o大模型，秒懂国风李子柒

人生搜索引擎免费用，开源版哈利波特“冥想盆”登GitHub热榜，支持中文

iPad可用AI绘画交互编辑神器火了，网友：颤抖吧PS

多样任务真实数据，大模型在线购物基准Shopping MMLU开源｜NeurIPS&KDD Cup 2024

定档12月11日，MEET2025智能未来大会报名通道已开启！

刚刚，星舰第六次试验成功！猛禽发动机实现“太空重启”，降落过程大秀身姿

2499，AI浓度爆表！戴上这副眼镜，一句话点咖啡/实时翻译/AR导航全搞定

特斯联首款通用智能体发布，实现对物理世界的高维感知

港科大具身机器人团队，连续获亿级融资

ChatGPT付费功能免费用！Mistral把Canvas、Artifact全复制了

Qwen2.5更新百万超长上下文，推理速度4.3倍加速，网友：RAG要过时了

AI自动操作VS Code，自然语言搞定各种配置，来自阿里通义智能计算实验室 | 开源

定档12月11日，MEET2025智能未来大会报名通道已开启！

腾讯AI大牛，被曝投身视频生成创业

北大等发布多模态版o1！首个慢思考VLM将开源，视觉推理超越闭源模型

猫猫运动方程，首次被物理学家破解！ |《美国物理学杂志》正经研究

如祺出行跑进智驾深水区 “数据闭环”为技术迭代提供更优解

智能交互创新赛落幕，哈工大AI智能背诵助手拿下特等奖｜OPPO智能体平台

AI能办专属信用卡了，Agent自己赚钱自己花，OpenAI合作伙伴打造

AI一键解析九大生物医学成像模式，用户只需文字prompt交互，微软UW等新研究登Nature Methods

定档12月11日，MEET2025智能未来大会报名通道已开启！

ChatGPT击败50名人类医生！疾病诊断准确率达90%，OpenAI总裁：人机合作还得加强

打破纪录！中国科学家让薛定谔的猫活了23分钟

视频大模型无损提速：删除多余token，训练时间减少30%，帧率越高效果越好 | NeurIPS

实测腾讯元宝2.0：图文视频啥都能搜，论文绘画全搞定

杨植麟发布Kimi新模型：数学对标o1，中考高考考研成绩全第一

航展附近这场无人机编队表演，竟用了钉钉AI助理出的方案

量化能让大模型“恢复记忆”，删掉的隐私版权内容全回来了，SU哈佛亚马逊最新研究引热议

不做Sora背后：百度的多模态路线是什么？

马斯克新官上任再起诉OpenAI！新证据称Ilya七年前就不放心奥特曼了

人大&港科大揭示大模型重要安全风险漏洞：利用概念激活向量破解大模型的安全对齐｜NeurIPS 2024

多个中国团队斩获EMNLP'24最佳论文！UCLA华人学者中三篇杰出论文，明年顶会落户苏州

谷歌杀回来了！新版Gemini跑分超o1登顶第一，CEO：这才哪到哪儿

ChatGPT深夜更新：Mac版支持“读屏编程”，Windows版全员可用了

AI在《我的世界》PK盖楼，新旧Claude差距过于明显，网友：审美也是智力的一种

最后1天！2024人工智能年度评选，AI时代的行业先锋就等你来

大模型上了火山方舟：数据唯你可见，唯你所用，唯你所有

李飞飞吴佳俊团队新作：推出具身智能决策能力评价基准，o1-preview登顶 | NeurIPS

Scaling Law遭遇瓶颈，OpenAI被曝押注智能体“Operator”

Meta最新触觉机械手登Science子刊封面，操作未知物体精度最高提升94%

大模型“取长补短”新思路入选NeurIPS'24，显著优于现有路由方法，南科大港科大出品

最后2天！2024人工智能年度评选，AI时代的行业先锋就等你来

把Runway、Luma们一锅端了！这款视频模型上“杀手级”功能：一致性魔咒终于打破

Keras之父，离职谷歌

百度打通两大国民产品！六边形AI创作新物种「自由画布」来了

小度为何押注AI眼镜？

今日最热论文：Scaling Law后继乏力，量化也不管用，AI大佬齐刷刷附议

稚晖君后宇树也来玩开源了：机器人操作数据集，采用抱抱脸LeRobot训练测试，网友：泰裤辣！

最后3天！2024人工智能年度评选，AI时代的行业先锋就等你来

分类

时事

民生

政务

教育

文化

科技

财富

体娱

健康

情感

旅行

百科

职场

楼市

企业

乐活

学术

汽车

时尚

创业

美食

幽默

美体

文摘

原创标签

时事社会财经军事教育体育科技汽车科学房产搞笑综艺明星音乐动漫游戏时尚健康旅游美食生活摄影宠物职场育儿情感小说曲艺文化历史三农文学娱乐电影视频图片新闻宗教电视剧纪录片广告创意壁纸头像心灵鸡汤星座命理教育培训艺术文化金融财经健康医疗美妆时尚餐饮美食母婴育儿社会新闻工业农业时事政治星座占卜幽默笑话独立短篇连载作品文化历史科技互联网

发布位置

广东北京山东江苏河南浙江山西福建河北上海四川陕西湖南安徽湖北内蒙古江西云南广西甘肃辽宁黑龙江贵州新疆重庆吉林天津海南青海宁夏西藏香港澳门台湾美国加拿大澳大利亚日本新加坡英国西班牙新西兰韩国泰国法国德国意大利缅甸菲律宾马来西亚越南荷兰柬埔寨俄罗斯巴西智利卢森堡芬兰瑞典比利时瑞士土耳其斐济挪威朝鲜尼日利亚阿根廷匈牙利爱尔兰印度老挝葡萄牙乌克兰印度尼西亚哈萨克斯坦塔吉克斯坦希腊南非蒙古奥地利肯尼亚加纳丹麦津巴布韦埃及坦桑尼亚捷克阿联酋安哥拉

李飞飞吴佳俊团队新作：推出具身智能决策能力评价基准，o1-preview登顶 | NeurIPS

克雷西 发自 凹非寺量子位 | 公众号 QbitAI

四项子能力全面评估

o1-preview综合成绩第一

克雷西发自凹非寺
量子位 | 公众号 QbitAI