FoundTS：时间序列预测基础模型的全面统一测评基准

科技 2024-10-21 22:56 北京

点关注，不迷路，用心整理每一篇算法干货~

后台留言”交流“，加入圆圆算法交流群~

👇🏻扫码👇🏻加入圆圆算法知识星球~

（已有880+同学加入学习，700+干货笔记）

今天给大家介绍一篇华东师范大学联合丹麦奥尔堡大学和松鼠AI发布的时间序列模型统一评测基准FoundTS，这是一个针对时间序列预测基础模型的基准测评框架，旨在利用不同领域和特征的数据集对不同的时间序列预测基础模型进行全面、公平的测评。该论文在统一评测结果的基础上，分析了现有时序预测基础模型的优缺点，并为基础模型的提升提出一些可行的方向。

论文标题：FOUNDTS: COMPREHENSIVE AND UNIFIED BENCHMARKING OF FOUNDATION MODELS FOR TIME SERIES FORECASTING

论文地址：https://arxiv.org/pdf/2410.11802

背景

时间序列预测 (Time Series Forecasting, TSF) 是指根据历史观察来预测未来状态，从而指导相应的决策和行为，是金融分析、气象预测和能源管理等众多领域的关键任务。

近年来，针对特定领域数据集进行训练和推理的特定模型（Specific models）取得了快速发展，其预测准确度和推理速度显著提升。然而，这些模型的泛化能力较弱，面对新领域或新数据时表现欠佳。在多领域时间序列数据或大规模语言数据上进行预训练的基础模型（Foundation models）为提升时间序列预测模型的泛化能力提供了新的可能性，但目前对此类模型的认知还远远不足。主要原因有以下三个方面：

（1）现有基础模型工作的实验设置不具备一致性，如表1所示，难以仅根据现有结果对不同的基础模型的性能进行公平一致的比较；

（2）当前主流的时间序列测评基准主要集中在特定模型，涉及基础模型的测评基准很少；

（3）现有涉及基础模型的测评基准对此类模型的分析还停留在定性分析或单一场景测评。

为了解决上述问题，这篇论文提出了一个新的测评基准 FoundTS，以实现对时间序列预测基础模型进行全面、公平的评估和比较。FoundTS 涵盖了各种时间序列预测基础模型，包括基于多领域时间序列数据的预训练模型（Pre-trained models）和基于大规模语言的预训练模型（LLM-based models）。同时，FoundTS 支持不同的预测场景，如零样本（zero-shot）、少样本（few-shot）和全样本（full-shot）。

FoundTS评测框架

FoundTS 提供了一个标准化评估流程，包含了三个核心模块：数据（data）、模型（models）、评估（evaluation）。

数据模块包含10个来自不同领域（Stock, Health, Energy, Electricity, Environment, Traffic, Nature, Banking, Web, Economics）、具有多种特征（Seasonality, Trend, Stationarity, Transition, Shifting, Correlation, Non-Gaussianity）的时间序列数据集，为下游时间序列预测提供了全面的数据支持。

模型模块涵盖了各类时间序列预测模型，并对其进行了细致的分类与介绍。

基于多领域时间序列数据的预训练模型：论文中根据训练方法从重建、自回归、直接预测以及混合预测四个角度分别介绍此类模型；

基于大规模语言的预训练模型：通过参数高效微调或设计prompt的方式，利用 LLMs 强大的表征能力和序列建模能力来捕捉时间序列的复杂模式；

特定模型：使用特定数据集进行训练并在相应的数据集进行推理，常见框架有：基于CNN的模型、基于Transformer的模型、基于MLP的模型。

评估模块提供全面的测评场景、可扩展的流程和统一的评估环境：

涵盖 zero-shot、few-shot 和 full-shot 场景，全面评估时间序列预测基础模型在不同测试场景下的表现。

支持对评测流程的多个方面进行灵活定制，如回看窗口、预测窗口、数据划分与加载、采样策略等，能够对不同模型采用一致的评测流程，确保测试结果的公平与可靠。

提供各种评估指标（如平均绝对误差（MAE）和均方误差（MSE）），从不同角度提供深入的模型性能分析。

实验分析

论文在多个不同领域的数据集上对比了不同的时间序列预测基础模型以及端到端的特定模型在 zero-shot、few-shot 和 full-shot 场景下的性能表现，同时从不同角度对时间序列预测基础模型的优缺点进行了分析。

论文比较了时间序列预测基础模型在不同采样策略下的性能，表明数据采样策略在few-shot学习中起着至关重要的作用，只有在统一的实验设置下才能对模型进行公平评估。

论文探索了多变量时间序列的通道依赖性对时间序列预测基础模型性能影响，呼吁在构建基础模型时应充分考虑多变量数据的通道依赖性。

论文分析了不同框架的时间序列预测基础模型之间的性能差异，指出未来需要更深入地研究模型架构设计，找到性能和参数量之间的平衡。

论文在具有不同显著特征的数据集上对比了时间序列预测基础模型处理不同特征数据的能力。

论文评估了来自多领域时间序列数据或大规模语言数据的预训练知识对下游时间序列预测任务的实际效益。

论文通过衡量时间序列预测基础模型在 5% 数据的 few-shot 场景下微调时间与特定模型在 full-shot 场景下从头训练时间，讨论了时间序列预测基础模型的精度与应用效率。

发现与观点

基础模型是否优于特定模型？时间序列预测基础模型，相比于特定模型，表现出优越的 zero-shot 和 few-shot 的学习能力。但当有足够的训练数据时，基础模型并不总是优于特定模型。

哪些基础模型更优？时间序列预测基础模型的优势取决于评估的不同方面，没有任何一个基础模型能够在所有方面占据主导地位。

从哪些方面提升基础模型? (1)时间序列预测基础模型应具有更加通用的、处理多种预测场景的能力；(2)从训练数据、模型架构、预训练策略等角度优化设计以更充分利用大规模预训练知识；(3)如何在下游任务甚至预训练阶段充分建模各个通道之间的依赖性，是基础模型应对多变量时间序列的关键问题之一；(4)合理平衡预测精度与训练、微调、推理成本，是将时间序列预测基础模型进行实际应用不可忽视的问题。

END

后台留言”交流“，加入圆圆算法交流群~

后台留言”星球“，加入圆圆算法知识请星球~【时序预测专题课程持续更新中】

知识星球提供一文贯通笔记、经典代码解析、问答服务、新人入门，已有880+小伙伴加入，价格随人数增加和内容丰富上涨，感兴趣的同学尽早加入~

投稿&加交流群请加微信，备注机构+方向拉群~

【历史干货算法笔记】

生成式模型入门：一文讲懂3大类生成式模型

Sptial-Temporal时空预测总结：建模思路、优化方法梳理

时序预测顶会论文数据集、数据处理方法、训练方法汇总

时间序列预测实战方法概述：从数据到模型

Informer模型结构和代码解析

基于Transformer的时序预测模型TFT代码详解

时空预测经典模型STGCN原理和代码解读

一网打尽：14种预训练语言模型大汇总

Vision-Language多模态建模方法脉络梳理

花式Finetune方法大汇总

从ViT到Swin，10篇顶会论文看Transformer在CV领域的发展历程

如果觉得有帮助麻烦分享在看点赞~

http://mp.weixin.qq.com/s?__biz=MzIyOTUyMDIwNg==&mid=2247491328&idx=1&sn=77f019b70e88d3396c75315cbeb5b47b

圆圆的算法笔记

定期更新深度学习/算法干货笔记和世间万物学习记录~

最新文章

清华大学提出基于多模态大模型的时间序列异常检测方法

我发现了找顶会创新点的最强公式，真的不需要脑子

最全汇总！2024推荐系统大厂顶会工作整理

检索增强时序预测——大模型RAG建模思路在时序预测中的应用

今天面试了一个字节女生，当场想给她offer！

2024时序预测都有哪些经典工作——总结篇

针对长周期非平稳多元时间序列的异常检测方法

NeurIPS'24：针对时序预测中时间戳特征的研究

发一篇顶会真不难

高效的卷积+Attention多元时序预测模型结构，实现长短期&变量间关系建模

最后3天！双11星球特惠~

适用于各类结构&领域时序数据的通用时序预测模型

最后3天！双11星球特惠~

取代Mamba，超越Transformer！扩展LSTM到数十亿参数

Salesforce推出首个通用时序预测模型评测基准GIFT-Eval，助力时序通用基础模型研究

南大&阿里发布多模态大模型WINGS，解决基于LLM的多模态训练灾难遗忘问题

港科技&MIT&浙大联合发布通用时序特征机器TimeMixer++，多项任务取得SOTA效果

双11星球优惠券来啦~

Salesforce推出Moirai-MoE，新视角设计下一代时序基础模型

免费白皮书《从头训练大模型最佳实践》

清华大学NeurIPS'24：时序大模型AutoTimes，结合In-context Learning提升预测效果

时间序列模型深度解析知识库

NIPS 2024时间序列工作——公众号已更新文章汇总

多阶段对比学习+多专家CLIP实现细粒度多模态表征学习

FoundTS：时间序列预测基础模型的全面统一测评基准

剑桥大学时间序列对比学习新方法，缓解伪负样本影响

时间序列+深度学习干货笔记专栏

几篇KDD'24大厂推荐系统优化工作总结

华为诺亚方舟实验室与华东师范大学联合发布时序预测通用模型ROSE——轻量规模，SOTA效果！

（更新至27节）时间序列预测专题系列干货文章

清华大学最新发布：统一时序预测模型，上下文长度首次扩展至千级别，适用各类数据集

重磅！机器学习时间序列预测+Transformer，堪称顶会收割机！

阿里达摩院最新多模态大模型介绍，多项图文任务取得SOTA效果

20场kaggle时间序列比赛Top方案GrandMaster整理

时序预测数据处理新方法汇总：多粒度和频域的可逆归一化

腾讯KDD‘24公开最新广告推荐系统建模方案

近7年深度学习时序预测建模方法汇总

普林斯顿大学提出首个基于MoE的稀疏时序预测大模型，参数量扩展到2.4billion

15种金融时间序列预测方法总结

时序预测中的多类型模型组合建模方案

时间序列预测专题系列干货文章

KDD'24系列：统一时间序列预训练Transformer

Transformer手撕BP，当场拿了offer

不会捞“偏门”，这辈子别想发计算机顶会顶刊！

一文汇总：长周期时序预测有哪些优化点？

LSTM+transformer=金融时序预测超高精准度！

高维多变量下的Transformer时序预测建模方法

分类

时事

民生

政务

教育

文化

科技

财富

体娱

健康

情感

旅行

百科

职场

楼市

企业

乐活

学术

汽车

时尚

创业

美食

幽默

美体

文摘

原创标签

时事社会财经军事教育体育科技汽车科学房产搞笑综艺明星音乐动漫游戏时尚健康旅游美食生活摄影宠物职场育儿情感小说曲艺文化历史三农文学娱乐电影视频图片新闻宗教电视剧纪录片广告创意壁纸头像心灵鸡汤星座命理教育培训艺术文化金融财经健康医疗美妆时尚餐饮美食母婴育儿社会新闻工业农业时事政治星座占卜幽默笑话独立短篇连载作品文化历史科技互联网

发布位置

广东北京山东江苏河南浙江山西福建河北上海四川陕西湖南安徽湖北内蒙古江西云南广西甘肃辽宁黑龙江贵州新疆重庆吉林天津海南青海宁夏西藏香港澳门台湾美国加拿大澳大利亚日本新加坡英国西班牙新西兰韩国泰国法国德国意大利缅甸菲律宾马来西亚越南荷兰柬埔寨俄罗斯巴西智利卢森堡芬兰瑞典比利时瑞士土耳其斐济挪威朝鲜尼日利亚阿根廷匈牙利爱尔兰印度老挝葡萄牙乌克兰印度尼西亚哈萨克斯坦塔吉克斯坦希腊南非蒙古奥地利肯尼亚加纳丹麦津巴布韦埃及坦桑尼亚捷克阿联酋安哥拉