填补空白！Salesforce 提出首个通用时序预测模型评测基准 GIFT-Eval

科技 2024-11-09 20:30 浙江

点击名片

关注并星标

#TSer#

扫下方二维码，加入时序人学术星球

参与算法讨论，获取前沿资料

（280+篇专栏笔记，已有270+同学加入学习）

时间序列预测在各个领域变得越来越重要，近年来时序基础模型的研究得到广泛关注。然而，一些常用的公开数据集受限于自身数据特点，无法有效评估模型在多样化场景下的通用预测能力。因此构造一个高质量、多样化的评测基准，并对各种模型进行公平评估，对时序基础模型研究领域的发展至关重要。此类基准还有助于确定模型的优势和局限性，推动该领域的进步。

为此，来自 Salesforce、新加坡国立大学的研究者引入了 GIFT-Eval 这一新的综合基准，旨在评估通用的时间序列预测能力，特别针对时序预测基础模型。该基准引入了一个多样化的数据集集合，其中包括 28 个数据集，涵盖 144,000 个时间序列，总共包括 1.77 亿个数据点。GIFT-Eval 的数据覆盖了 7 个不同领域，10 种频率，单/多变量输入，预测长度从短期到长期不等。

GIFT-Eval 为每个数据集提供单独的训练集，测试集和验证集的分割，从而支持普通模型 full-shot 和基础模型 zero-shot 的评估。同时，GIFT-Eval 还包含一个非泄漏的预训练数据集，从而帮助基础模型的研究和开发。此外，作者团队还从不同维度的时序特征对数据集进行了详细分析，并将所有特征的结果进行汇总以获得对于时序预测模型的更有针对性的见解。

【论文标题】

GIFT-Eval: A Benchmark For General Time Series Forecasting Model Evaluation

【论文地址】

https://arxiv.org/abs/2410.10393

【相关链接】

https://huggingface.co/spaces/Salesforce/GIFT-Eval

研究动机

时间序列预测在金融、医疗以及云运维等领域中变得至关重要。伴随着通用预测模型的出现，对于支持各种数据集、频率和预测任务的多样化基准的需求也应运而生。而在基础模型（foundation model）的研究中，为了确保评估的公平性从而进一步突出模型存在的缺陷，拥有多样化的高质量基准变得尤为重要。例如，自然语言处理的研究得益于 GLUE 或 MMLU 等各种基准，但在时序预测领域，尚且缺乏如此全面的资源：现有数据集通常范围狭窄，专注于特定任务，无法测试模型处理各种预测场景的能力。同时，模型之间不一致的数据划分也会增加数据泄漏的风险，使得各种模型之间的比较复杂化，难以得到统一结论。

GIFT-Eval基准

GIFT-Eval 通过引入由预训练和训练/测试组件组成的综合时间序列预测基准来填补上述空白。GIFT-Eval 支持从短期到长期预测的广泛预测任务，同时能够在单变量和多变量设置下评估不同模型，为时间序列数据提供急需的多样性。

此外，GIFT-Eval 通过提供无泄漏的预训练数据，对于基础模型提供公平且一致的模型评估，更广泛的频率和预测长度以及对于零样本预测能力的评估, 使得 GITF-Eval 能够从其他评测基准中脱颖而出。

基准概述

GIFT-Eval 由两个关键组件组成：

训练/测试组件：包括 28 个数据集，涵盖 144,000 个时间序列，即 1.77 亿个数据点，提供跨不同领域、频率和变量设置的全面覆盖。

预训练数据集：其中包含分布在 88 个数据集的 2300 亿个数据点，旨在促进大规模模型预训练。

论文对代表性的统计模型、深度学习模型以及基础模型（共计17个）进行了详细的分析和基准测试。它提供了对模型性能的洞见，突出其优势并识别失败案例，以指导未来通用时间序列模型的设计。为了从结果中获得更细致的洞见，作者根据影响数据结构和建模的不同时间序列特征对 GIFT-Eval 数据集进行了分类。这些特征包括数据来源的领域（例如，金融、医疗保健）、观测频率（例如，每小时、每天）、预测长度或预测范围，以及序列是单变量还是多变量。

此外，时间序列具有诸如趋势、季节性强度、熵、赫斯特指数、稳定性和聚集性等统计特征，这些特征有助于捕捉数据中的模式和变异性。GIFT-Eval 考虑了这些特征，以确保在各种真实场景下对预测模型进行全面评估。下图展示了数据集在不同领域和频率上涵盖了多样化的时间性、难度和规律性特征。它既包含波动性大、不规则的模式，也包含稳定、可预测的趋势，确保对模型进行了全面的测试。这使得 GIFT-Eval 成为评估统一模型和基础模型在时间序列预测方面的通用能力的有力工具。

实验结果

使用 17 个模型进行实验，涵盖传统统计 moxing （例如 ARIMA、Theta）、深度学习模型（例如 PatchTST、iTransformer）和基础模型（例如 Moirai、Chronos）。文中展示了五个部分的结果，涵盖了领域、预测长度、频率和变量数等关键特征，然后汇总了所有结果。

领域

在大多数领域，基础模型通常优于统计模型和深度学习模型。然而，他们在以下领域面临困难：网络/云运维和交通，其中高熵、低趋势和块度使得零样本基础模型的数据难以预测。相比之下，深度学习模型在进行全面训练时在这些具有挑战性的领域表现更好，与基础模型相比，这可能受益于更有针对性的训练数据。

预测长度

基础模型在短期预测方面表现出色，可以有效捕捉即时趋势和波动。然而，随着预测长度延伸到中长期预测，它们的性能会下降，而像 PatchTST 和 iTransformer 这样的深度学习模型表现更好，成功捕获了长期依赖关系。尽管微调基础模型提高了其处理长期预测的能力，但基础模型和深度学习模型在中长期预测方面仍然存在显着的性能差距。这一差距凸显了进一步研究的可能性，以增强基础模型管理扩展预测范围的能力。

频率

对于频率最高的数据，例如秒级粒度，统计模型性能处于领先。而随着频率转向每分钟和每小时的数据，深度学习模型开始占据主导地位。基础模型在处理高频数据中的噪声模式时似乎遇到了困难，而专门的深度学习和统计模型在高频数据中表现更好。然而，当涉及较低频率时，例如每日到每年的数据，基础模型始终优于其他方法，利用其广泛的预训练来捕获更广泛的模式和更慢的动态。

变量数

在多变量环境中，深度学习模型在各个指标上都优于所有其他模型，而 Moirai 在基础模型中处于领先地位，但仍低于深度学习性能。这凸显了基础模型研究的差距，与深度学习模型相比，多元预测仍然是一个挑战。相反，在单变量场景中，基础模型，尤其是 Moirai 的大型变体，表现出色，提供优于深度学习模型的性能。

汇总结果

汇总所有结果，文章指出深度模型 PatchTST 排名第一，基础模型 Moirai Large 排名第二，并且经常出现在前两名。PatchTST 被证明具有强大的泛化能力，可以在不同的数据集上提供可靠的性能，同时 Moirai Large 在特定情况下表现出色。然而，拓展性法则（scaling laws）（较大的模型表现更好）仅适用于能源和单变量预测等特定领域。

更多的实验结果请参考原论文。

结论

总之，GIFT-Eval 是一个全面且多样化的基准，旨在评估跨关键特征（例如域、频率、变量数量和预测长度）的时间序列预测模型。提供多样化的预训练数据集和详细分析，以便对统计、深度学习和基础模型进行公平比较。希望该基准能够促进更强大、适应性更强的基础模型的开发，推动时间序列预测领域的发展。

扫下方二维码，加入时序人学术星球

星球专注于时间序列领域的知识整理，前沿追踪

提供论文合集、视频课程、问答服务等资源

280+篇专栏笔记，已有270+小伙伴加入

价格随着内容丰富而上涨，早入早享优惠哦~

时间序列学术前沿系列持续更新中 ⛳️

后台回复"讨论"，加入讨论组一起交流学习 🏃

往期推荐阅读

清华与深大提出TimeBridge，有效处理长期时间序列预测中的非平稳性问题

Salesforce 推出 Moirai-MoE，新视角设计下一代时序基础模型

一文解读：时序基础模型的缩放定律

FoundTS：首个覆盖多场景的时序预测基础模型评测基准

正常时序转化为图像，进行高效且可解释的多元时序异常检测

Time-MMD：首个涵盖9大主要数据领域的多域多模态时间序列数据集

华东师大团队首创！时间序列异常预测开启全新时序任务

时序异常检测新进展！华为诺亚方舟实验室&华东师大提出首个时序异常检测通用模型

如何处理多频段时序特征？这个Transformer变体显著提升预测效果

PeFAD：边缘设备中高效的联邦异常检测框架

KDD 2024 | 数据驱动的分布偏移检测与自适应

NeurIPS 2024 | 分段时序多分类任务下的一致性学习框架

KDD 2024 | 首个基于 Diffusion 的自监督时序表示方法

港大智慧城市大模型 OpenCity 来袭! 时空预测是否将在 GPT 时代重塑？

觉得不错，那就点个在看和赞吧

http://mp.weixin.qq.com/s?__biz=Mzg3NDUwNTM3MA==&mid=2247503475&idx=1&sn=11b45591f2ac8b0b536fe5ad95c70cec

时序人

专注于时间序列领域下的科研、工业干货分享，紧跟AI+等领域的科技前沿

最新文章

无惧漂移！D3R方法可用于不稳定多元时间序列异常检测，SOTA提升11%

无需安装，一个文件本地运行大模型！

EffiCANet：基于卷积注意力的高效时间序列预测，显著降低计算成本

NeurIPS 2024 | 重新审视时间戳信息在时序预测中的作用

快速学会登上nature的热门算法，LSTM！

综述 | 时空图神经网络模型在时间序列预测和分类中的应用

填补空白！Salesforce 提出首个通用时序预测模型评测基准 GIFT-Eval

LSTM依然能打！原作者带队最新开源成果吊打Transformer和Mamba

涨点神器！100个即插即用缝合模块【合集下载】

清华与深大提出TimeBridge，有效处理长期时间序列预测中的非平稳性问题

Salesforce 推出 Moirai-MoE，新视角设计下一代时序基础模型

一文解读：时序基础模型的缩放定律

FoundTS：首个覆盖多场景的时序预测基础模型评测基准

最强总结，99个时间序列+时空数据的顶会创新！

正常时序转化为图像，进行高效且可解释的多元时序异常检测

NeurIPS 2024 | 时间序列相关论文盘点（附原文源码）

Time-MMD：首个涵盖9大主要数据领域的多域多模态时间序列数据集

华东师大团队首创！时间序列异常预测开启全新时序任务

时序异常检测新进展！华为诺亚方舟实验室&华东师大提出首个时序异常检测通用模型

快速学会登上nature的热门算法，LSTM！

如何处理多频段时序特征？这个Transformer变体显著提升预测效果

20场Kaggle机器学习比赛Top方案GrandMaster整理

PeFAD：边缘设备中高效的联邦异常检测框架

KDD 2024 | 数据驱动的分布偏移检测与自适应

NeurIPS 2024 | 分段时序多分类任务下的一致性学习框架

KDD 2024 | 首个基于 Diffusion 的自监督时序表示方法

必看的11种主流注意力机制创新研究！(附代码）

港大智慧城市大模型 OpenCity 来袭! 时空预测是否将在 GPT 时代重塑？

KDD 2024 | RHiOTS：评估层级化时序预测算法的可靠性

博后招募 | 清华大学裴丹老师课题组招收时间序列博士后

这届审稿人是不是有毛病！？？？

时间序列预测中如何构建层级化的 Transformer 架构？

文末送书 | 豆瓣9.6，多语言版本全球发行，这本书为何这么受欢迎？

KDD 2024 | FNSPID：整合新闻与股价的大规模金融数据集

KDD 2024 | 检测并优化时序预测中的分布偏移问题

多模态融合，顶会超神了！

KDD 2024 | 时间序列相关论文盘点（附原文源码）

LSTM+Transformer=金融时序预测超高精准度！

LSTM又火了！最新52个创新思路+全部开源代码！

LSTM再升级！原作者携xLSTM回归，扩展LSTM到数十亿参数

发paper必备82个即插即用缝合模块！附下载

KDD 2024 | ShapeFormer：多维时序分类中基于形状的Transformer

综述 | 可解释性人工智能（XAI）在金融时间序列预测中的应用

文末送书 | AI for Science：一本书，洞察未来的科技生态！

AI顶会今年这情况，很严重，大家做好准备吧！

ICML 2024 | CaRiNG：在非可逆生成过程中学习时间因果表示

WWW 2024 | FCVAE：从频率角度重新审视 VAE 在无监督异常检测中的效果

清华第二届城市科学大会报名启动！文末赠送2个免费与会名额！

各位，请入局AI大模型，现在！立刻！马上！！

ICML 2024 | FlashST：一个简洁有效新范式，助力智慧城市时空预测

分类

时事

民生

政务

教育

文化

科技

财富

体娱

健康

情感

旅行

百科

职场

楼市

企业

乐活

学术

汽车

时尚

创业

美食

幽默

美体

文摘

原创标签

时事社会财经军事教育体育科技汽车科学房产搞笑综艺明星音乐动漫游戏时尚健康旅游美食生活摄影宠物职场育儿情感小说曲艺文化历史三农文学娱乐电影视频图片新闻宗教电视剧纪录片广告创意壁纸头像心灵鸡汤星座命理教育培训艺术文化金融财经健康医疗美妆时尚餐饮美食母婴育儿社会新闻工业农业时事政治星座占卜幽默笑话独立短篇连载作品文化历史科技互联网

发布位置

广东北京山东江苏河南浙江山西福建河北上海四川陕西湖南安徽湖北内蒙古江西云南广西甘肃辽宁黑龙江贵州新疆重庆吉林天津海南青海宁夏西藏香港澳门台湾美国加拿大澳大利亚日本新加坡英国西班牙新西兰韩国泰国法国德国意大利缅甸菲律宾马来西亚越南荷兰柬埔寨俄罗斯巴西智利卢森堡芬兰瑞典比利时瑞士土耳其斐济挪威朝鲜尼日利亚阿根廷匈牙利爱尔兰印度老挝葡萄牙乌克兰印度尼西亚哈萨克斯坦塔吉克斯坦希腊南非蒙古奥地利肯尼亚加纳丹麦津巴布韦埃及坦桑尼亚捷克阿联酋安哥拉