吴恩达团队最新成果: ManyICL

情感 2024-08-10 11:57 湖北

本研究评估了先进多模态基础模型在 10 个数据集上的多样本上下文学习，揭示了持续的性能提升。批量查询显著降低了每个示例的延迟和推理成本而不牺牲性能。这些发现表明：利用大量演示示例可以快速适应新任务和新领域，而无需传统的微调。

论文地址：https://arxiv.org/abs/2405.09798
代码地址：https://github.com/stanfordmlgroup/ManyICL

背景介绍

在近期的多模态基础模型（Multimodal Foundation Model）研究中，上下文学习（In-Context Learning, ICL）已被证明是提高模型性能的有效方法之一。

然而，受限于基础模型的上下文长度，尤其是对于需要大量视觉 token 来表示图片的多模态基础模型，已有的相关研究只局限于在上下文中提供少量样本。

令人激动的是，最新的技术进步大大增加了模型的上下文长度，这为探索使用更多示例进行上下文学习提供了可能性。

基于此，斯坦福吴恩达团队的最新研究——ManyICL，主要评估了目前最先进的多模态基础模型在从少样本 (少于 100) 到多样本（最高至 2000）上下文学习中的表现。通过对多个领域和任务的数据集进行测试，团队验证了多样本上下文学习在提高模型性能方面的显著效果，并探讨了批量查询对性能和成本及延迟的影响。

Many-shot ICL与零样本、少样本ICL的比较。

方法概览

本研究选择了三种先进的多模态基础模型：GPT-4o、GPT4 (V)-Turbo 和 Gemini 1.5 Pro。出于 GPT-4o 优越的表现，研究团队在正文中着重讨论 GPT-4o 和 Gemini 1.5 Pro， GPT4 (V)-Turbo 的相关内容请于附录中查看。

数据集方面，研究团队在 10 个跨越不同领域（包括自然影像、医学影像、遥感影像和分子影像等）和任务（包括多分类、多标签分类和细粒度分类）的数据集上进行了广泛的实验。

基准数据集汇总。

为了测试增加示例数量对模型性能的影响，研究团队逐步增加了上下文中提供的示例数量，最高达到近 2000 个示例。同时，考虑到多样本学习的高成本和高延迟，研究团队还探索了批量处理查询的影响。在这里，批量查询指的是在单次 API 调用中处理多个查询。

实验结果

多样本上下文学习性能评估

总体表现：包含近 2000 个示例的多样本上下文学习在所有数据集上均优于少样本学习。随着示例数量的增加，Gemini 1.5 Pro 模型的性能呈现出持续的对数线性提升，而 GPT-4o 的表现则较不稳定。

数据效率：研究测量了模型的上下文学习数据效率，即模型从示例中学习的速度。结果表明，Gemini 1.5 Pro 在绝大部分数据集上显示出比 GPT-4o 更高的上下文学习数据效率，意味着它能够更有效地从示例中学习。

批量查询的影响

总体表现：在选择最优示例集大小下的零样本和多样本情境中，将多个查询合并为一次请求，不会降低性能。值得注意的是，在零样本场景中，单个查询在许多数据集上表现较差。相比之下，批量查询甚至可以提高性能。

零样本场景下的性能提升：对于某些数据集（如 UCMerced），批量查询在零样本场景下显著提高了性能。研究团队分析认为，这主要归因于领域校准 (domain calibration)、类别校准 (class calibration) 以及自我学习 (self-ICL)。

成本和延迟分析

多样本上下文学习虽然在推理时需要处理更长的输入上下文，但通过批量查询可以显著降低每个示例的延迟和推理成本。例如，在 HAM10000 数据集中，使用 Gemini 1.5 Pro 模型进行 350 个示例的批量查询，延迟从 17.3 秒降至 0.54 秒，成本从每个示例 0.842 美元降至 0.0877 美元。

结论

研究结果表明，多样本上下文学习能够显著提高多模态基础模型的表现，尤其是 Gemini 1.5 Pro 模型在多个数据集上表现出持续的性能提升，使其能够更有效地适应新任务和新领域，而无需传统的微调。

其次，批量处理查询可以在相似甚至更好的模型表现的同时，降低推理成本和延迟，显示出在实际应用中的巨大潜力。

总的来说，吴恩达团队的这项研究为多模态基础模型的应用开辟了新的路径，特别是在快速适应新任务和领域方面。

来源 | 机器之心

http://mp.weixin.qq.com/s?__biz=Mzg3ODY2MDAyMQ==&mid=2247560403&idx=2&sn=4a61810e6fdada8bec60d4a97a9a0e74

尤而小屋

尤而小屋，一个温馨且有爱的小屋🏡 小屋主人，一手代码谋求生存，一手掌勺享受生活，欢迎你的光临~

最新文章

时间序列预测神器Prophet【教程3】：突变点预测

酷炫！10张BI可视化大屏模板，拿来即用！

机器学习：欧式距离、曼哈顿距离、切比雪夫距离

Neo4j，图算法最强总结！

畅销19万册！MySQL入门经典书重磅升级

机器学习集成方法总结：Bagging, Boosting, Stacking, Voting, Blending

最强图解微型神经网络：多层感知器MLP

李飞飞：一位备受尊敬的女性AI学者

基于深度学习的工业异常检测

具身智能，下一波AI浪潮！

数据别愁！14个机器学习电影数据集

总结7大数据分析方法

Python实现10种顶流聚类算法（附代码）

由浅入深！100个pandas数据处理技巧

超强图解Transformer

豆瓣9.6，多语言版本全球发行，AWS经典再升级！

刚刚！阿里巴巴公布“姜萍时间”调查结果公布

大模型&推荐系统，强强联手！

从小白到Kaggle Grandmaster的比赛技巧

基于支持向量机和SVM的人脸识别案例

热销17万册，《算法图解》第二版终于来了！

8种高级特征工程技术

jupyter notebook进阶使用：nbextensions

中国高校面积Top10

大模型应用开发：RAG入门与实战（文末赠书）

2024年诺贝尔物理学奖，颁给了搞AI的！

刚刚，诺贝尔化学奖，揭晓！AI是没有边界的！

上海交大ACM班总教头俞勇教授团队第4本重磅新作出版啦！

后悔没早看！985研究生必备论文配图法

突发！高通准备收购英特尔？

《李宏毅：深度学习详解》终于出版了！

pandas处理时间序列数据：基础知识点

IBM中国裁员赔偿N+3！千人被裁，中国研发部彻底关闭！

基于长短期记忆模型LSTM的股价预测实战

机器学习神器Scikit-Learn超强图解

豆瓣评分9.3，畅销29年，深受哈佛、剑桥、清华等名校青睐

时间序列预测神器Prophet【教程2】：饱和预测

吴恩达，YYDS!

吴恩达团队最新成果: ManyICL

销量超10万+，这3本书凭什么能得到Python之父推荐？

数据预处理10大必备技巧

时间序列预测神器Prophet【教程1】：极简入门案例

Python实现10种概率分布（附代码）

文末赠书|AI for science：人工智能驱动科学创新

深度学习10种优化算法原理及实现（附代码）

2024最值得关注的10个深度学习算法

国产大模型之光-Kimi AI

机器学习：基于scikit-learn进行特征工程

彻底弄懂Python单星号、双星号的使用

超强Pandas图解教程

分类

时事

民生

政务

教育

文化

科技

财富

体娱

健康

情感

旅行

百科

职场

楼市

企业

乐活

学术

汽车

时尚

创业

美食

幽默

美体

文摘

原创标签

时事社会财经军事教育体育科技汽车科学房产搞笑综艺明星音乐动漫游戏时尚健康旅游美食生活摄影宠物职场育儿情感小说曲艺文化历史三农文学娱乐电影视频图片新闻宗教电视剧纪录片广告创意壁纸头像心灵鸡汤星座命理教育培训艺术文化金融财经健康医疗美妆时尚餐饮美食母婴育儿社会新闻工业农业时事政治星座占卜幽默笑话独立短篇连载作品文化历史科技互联网

发布位置

广东北京山东江苏河南浙江山西福建河北上海四川陕西湖南安徽湖北内蒙古江西云南广西甘肃辽宁黑龙江贵州新疆重庆吉林天津海南青海宁夏西藏香港澳门台湾美国加拿大澳大利亚日本新加坡英国西班牙新西兰韩国泰国法国德国意大利缅甸菲律宾马来西亚越南荷兰柬埔寨俄罗斯巴西智利卢森堡芬兰瑞典比利时瑞士土耳其斐济挪威朝鲜尼日利亚阿根廷匈牙利爱尔兰印度老挝葡萄牙乌克兰印度尼西亚哈萨克斯坦塔吉克斯坦希腊南非蒙古奥地利肯尼亚加纳丹麦津巴布韦埃及坦桑尼亚捷克阿联酋安哥拉