适用于各类结构&领域时序数据的通用时序预测模型

科技 2024-11-08 09:36 北京

点关注，不迷路，用心整理每一篇算法干货~

后台留言”交流“，加入圆圆算法交流群~

👇🏻扫码👇🏻加入圆圆算法知识星球~

（最后3天 双11优惠券！）

时间序列预测在金融、制造、零售、医疗保健和气象等多个领域中扮演着不可或缺的角色。然而，现有的时间序列预测模型通常假设数据是规则采样的、结构良好的，这限制了它们在包含缺失值、不等序列长度和不规则时间间隔的时间序列中的应用。

今天为大家介绍一篇来自德国L3S Research Center, Leibniz Universität Hannover 和南洋理工大学合作提出的通用时序预测范式：FlexTSF 能在在为规则和不规则时间序列数据集中表现出色。此外，经过自监督预训练后，FlexTSF 在零样本和少量样本设置下的时间序列预测中均显示出卓越的性能。

论文标题：FLEXTSF: A Universal Forecasting Model for Time Series with Variable Regularities

下载地址：https://arxiv.org/abs/2410.23160

研究背景

本文要解决的问题是如何开发一个通用的时间序列预测模型，以应对时间序列数据在领域和结构上的多样性。现有工作通常假设数据是规则采样的，结构良好，但在实际应用中，时间序列数据往往包含缺失值、不等序列长度和不规则的时间间隔。

处理不同测量类型（如收缩压、汇率、用电量）的时间序列，这些序列具有不同的尺度和时间粒度；处理缺失值、不等序列长度和不规则采样时间间隔的结构多样性。这些难点可以归纳为：领域多样性和结构多样性，本文也致力于解决这两个难点。

领域多样性：时间序列包含广泛的测量类型，如收缩压、汇率和电力消耗等，每种类型都表现出不同的尺度（例如，1-10，50-150）和时间粒度（例如，分钟、小时、天、月）。这种领域的多样性导致了各种时间模式，这些模式很难通过单一模型来捕捉。

结构多样性：时间序列展现出结构多样性，包括缺失值、变化的序列长度和不规则的采样时间间隔。例如，在下图中，(a)所示的血压观测数据在开始时较为稀疏，但随着时间推移由于患者病情恶化而变得密集。(b)中的某些数据因节假日等因素而缺失。(d)中的时间序列显示出明显的模式，而(c)中的模式则不太明显。

整体结构

FlexTSF是一种通用的时间序列预测模型，能够处理具有域多样性和结构多样性的时间序列，主要包括以下3个模块。

VT-Norm：提出了值和时间归一化策略（VT-Norm），通过解耦静态域信息和动态模式，使模型能够统一地学习时间模式和依赖关系。

IVP Patcher：引入了连续时间补丁模块（IVP Patcher），能够处理具有缺失值、任意长度和各种时间间隔的时间序列补丁。

LED Attention：设计了因果自注意力机制（LED Attention），结合了Leader节点、层间时间嵌入和虚拟补丁，以迭代处理时间序列并进行自回归预测。

在自我监督预训练后，FlexTSF在零样本和少样本设置中表现出色，展示了其作为基础模型的潜力和能力。文中在12个数据集上的实验表明，FlexTSF在经典、零样本和少样本场景中均优于专门为规则和不规则时间序列设计的最先进模型。

实现方法

这篇论文提出了FlexTSF，一种通用的时间序列预测模型，用于解决时间序列数据的领域和结构多样性问题。具体结构如下：

该过程首先通过VT-Norm进行值和时间戳的标准化，然后将时间序列分割成多个片段（patch），并在末尾附加一个虚拟片段。对于每个片段，IVP Patcher通过使用神经IVP求解器将片段内所有数据点衍生出的潜在状态反向传播，生成其向量表征。这些表征随后经过多个attention层处理，其中Leader节点包含了由VT-Norm提取的统计域特征。在前向传递之后，对应于虚拟片段的最终节点的表示被传递给IVP Patcher，该Patcher将潜在状态前向传播（与输入侧相反），以在指定的时间点生成未来的时间序列值。这些预测值替换之前的虚拟片段，使自回归过程能够继续进行，直到生成预测范围内的所有值。接下来，我们将详细介绍每个组件。

VT-Norm

为了应对时间序列数据的领域多样性，提出了值和时间归一化策略VT-Norm。该策略通过将静态域信息和动态时间模式解耦，实现了对不同特征的时间序列的统一标准化。具体步骤包括全局归一化和实例归一化，计算时间序列的全局均值和标准差，并对每个时间序列进行实例归一化。

全局归一化：计算时间序列的全局均值和标准差，并使用这些统计数据对时间序列进行标准化。

实例归一化：在将每个时间序列输入模型之前，对其进行实例归一化，计算序列的实例均值和标准差。

通过这两步归一化，VT-Norm能够有效地处理不同测量类型（如收缩压、汇率、电力消耗）的时间序列，这些序列具有不同的尺度和时间粒度。归一化后的时间序列可以在同一模型中进行统一处理，从而提高了模型的泛化能力；

IVP Patcher

IVP Patcher：为了应对时间序列的结构多样性，提出了IVP Patcher模块。该模块通过求解初始值问题（IVP），能够学习具有任意时间间隔的时间序列表示。具体步骤包括将时间序列输入分割成非重叠的patch，对每个patch使用神经IVP求解器从初始条件向后演化状态，并通过变分自编码器（VAE）推断patch的分布。这种方法允许我们以任意时间间隔推导出时间表示，并能够处理不同长度的数据片段。

LED Attention

LED Attention：为了更好地捕捉patch之间的相关性，提出了LED Attention机制。该机制结合了旋转位置编码（RoPE）技术，通过在自注意力模块中引入相对位置表示，能够有效捕捉不规则时间间隔的复杂依赖关系。此外，由于LED注意力机制是在patch表示上操作的，我们在序列末尾添加了一个虚拟patch，该片段与预测时间点相关联。由于因果自注意力机制限制每个节点只能关注其前驱节点，因此虚拟patch被策略性地放置在序列末尾，以汇总来自所有前序patch的潜在信息。这种信息的积累使虚拟patch能够作为整个序列的综合表现，进而用于生成更有表达能力的预测。

结果与分析

经典训练-验证-测试：在保留数据集组DhDh上进行经典训练-验证-测试实验，结果表明FlexTSF在所有数据集上均表现出色，尤其是在处理不规则时间序列数据时具有显著优势。

零样本预测：在预训练数据集组DpDp上预训练FlexTSF，并在保留数据集组DhDh上进行零样本预测实验，结果显示FlexTSF在大多数数据集上优于其他预训练模型，特别是在处理不规则时间序列数据时表现尤为突出。

少样本预测：在预训练数据集组DpDp上预训练FlexTSF，并在保留数据集组DhDh上进行少样本预测实验，结果表明FlexTSF在数据有限的情况下仍能保持较高的预测精度，且随着训练样本数量的增加，预测性能进一步提升。

消融研究：通过消融实验评估VT-Norm、IVP Patcher和LED Attention组件的贡献，结果表明去除任何一个组件都会导致模型性能显著下降，进一步验证了这三个组件在FlexTSF中的重要性。

总结

本文提出了FlexTSF，一种通用的时间序列预测模型，通过引入VT-Norm、IVP Patcher和LED Attention三个创新设计，成功解决了时间序列数据的领域和结构多样性问题。实验结果表明，FlexTSF在经典、零样本和少样本场景下均表现出色，具有广泛的适用性和潜力。未来的工作将进一步探索在大规模数据集上的预训练效果，以推动时间序列预测基础模型的进一步发展；

END

后台留言”交流“，加入圆圆算法交流群~

后台留言”星球“，加入圆圆算法知识请星球~【时序预测专题课程持续更新中】

知识星球提供一文贯通笔记、经典代码解析、问答服务、新人入门，已有910+小伙伴加入，价格随人数增加和内容丰富上涨，感兴趣的同学尽早加入~

双11优惠券，扫码领取！

投稿&加交流群请加微信，备注机构+方向拉群~

【历史干货算法笔记】

生成式模型入门：一文讲懂3大类生成式模型

Sptial-Temporal时空预测总结：建模思路、优化方法梳理

时序预测顶会论文数据集、数据处理方法、训练方法汇总

时间序列预测实战方法概述：从数据到模型

Informer模型结构和代码解析

基于Transformer的时序预测模型TFT代码详解

时空预测经典模型STGCN原理和代码解读

一网打尽：14种预训练语言模型大汇总

Vision-Language多模态建模方法脉络梳理

花式Finetune方法大汇总

从ViT到Swin，10篇顶会论文看Transformer在CV领域的发展历程

如果觉得有帮助麻烦分享在看点赞~

http://mp.weixin.qq.com/s?__biz=MzIyOTUyMDIwNg==&mid=2247491561&idx=1&sn=b2584c8d3e07d49c7ef60c806a7cec6d

圆圆的算法笔记

定期更新深度学习/算法干货笔记和世间万物学习记录~

最新文章

清华大学提出基于多模态大模型的时间序列异常检测方法

我发现了找顶会创新点的最强公式，真的不需要脑子

最全汇总！2024推荐系统大厂顶会工作整理

检索增强时序预测——大模型RAG建模思路在时序预测中的应用

今天面试了一个字节女生，当场想给她offer！

2024时序预测都有哪些经典工作——总结篇

针对长周期非平稳多元时间序列的异常检测方法

NeurIPS'24：针对时序预测中时间戳特征的研究

发一篇顶会真不难

高效的卷积+Attention多元时序预测模型结构，实现长短期&变量间关系建模

最后3天！双11星球特惠~

适用于各类结构&领域时序数据的通用时序预测模型

最后3天！双11星球特惠~

取代Mamba，超越Transformer！扩展LSTM到数十亿参数

Salesforce推出首个通用时序预测模型评测基准GIFT-Eval，助力时序通用基础模型研究

南大&阿里发布多模态大模型WINGS，解决基于LLM的多模态训练灾难遗忘问题

港科技&MIT&浙大联合发布通用时序特征机器TimeMixer++，多项任务取得SOTA效果

双11星球优惠券来啦~

Salesforce推出Moirai-MoE，新视角设计下一代时序基础模型

免费白皮书《从头训练大模型最佳实践》

清华大学NeurIPS'24：时序大模型AutoTimes，结合In-context Learning提升预测效果

时间序列模型深度解析知识库

NIPS 2024时间序列工作——公众号已更新文章汇总

多阶段对比学习+多专家CLIP实现细粒度多模态表征学习

FoundTS：时间序列预测基础模型的全面统一测评基准

剑桥大学时间序列对比学习新方法，缓解伪负样本影响

时间序列+深度学习干货笔记专栏

几篇KDD'24大厂推荐系统优化工作总结

华为诺亚方舟实验室与华东师范大学联合发布时序预测通用模型ROSE——轻量规模，SOTA效果！

（更新至27节）时间序列预测专题系列干货文章

清华大学最新发布：统一时序预测模型，上下文长度首次扩展至千级别，适用各类数据集

重磅！机器学习时间序列预测+Transformer，堪称顶会收割机！

阿里达摩院最新多模态大模型介绍，多项图文任务取得SOTA效果

20场kaggle时间序列比赛Top方案GrandMaster整理

时序预测数据处理新方法汇总：多粒度和频域的可逆归一化

腾讯KDD‘24公开最新广告推荐系统建模方案

近7年深度学习时序预测建模方法汇总

普林斯顿大学提出首个基于MoE的稀疏时序预测大模型，参数量扩展到2.4billion

15种金融时间序列预测方法总结

时序预测中的多类型模型组合建模方案

时间序列预测专题系列干货文章

KDD'24系列：统一时间序列预训练Transformer

Transformer手撕BP，当场拿了offer

不会捞“偏门”，这辈子别想发计算机顶会顶刊！

一文汇总：长周期时序预测有哪些优化点？

LSTM+transformer=金融时序预测超高精准度！

高维多变量下的Transformer时序预测建模方法

分类

时事

民生

政务

教育

文化

科技

财富

体娱

健康

情感

旅行

百科

职场

楼市

企业

乐活

学术

汽车

时尚

创业

美食

幽默

美体

文摘

原创标签

时事社会财经军事教育体育科技汽车科学房产搞笑综艺明星音乐动漫游戏时尚健康旅游美食生活摄影宠物职场育儿情感小说曲艺文化历史三农文学娱乐电影视频图片新闻宗教电视剧纪录片广告创意壁纸头像心灵鸡汤星座命理教育培训艺术文化金融财经健康医疗美妆时尚餐饮美食母婴育儿社会新闻工业农业时事政治星座占卜幽默笑话独立短篇连载作品文化历史科技互联网

发布位置

广东北京山东江苏河南浙江山西福建河北上海四川陕西湖南安徽湖北内蒙古江西云南广西甘肃辽宁黑龙江贵州新疆重庆吉林天津海南青海宁夏西藏香港澳门台湾美国加拿大澳大利亚日本新加坡英国西班牙新西兰韩国泰国法国德国意大利缅甸菲律宾马来西亚越南荷兰柬埔寨俄罗斯巴西智利卢森堡芬兰瑞典比利时瑞士土耳其斐济挪威朝鲜尼日利亚阿根廷匈牙利爱尔兰印度老挝葡萄牙乌克兰印度尼西亚哈萨克斯坦塔吉克斯坦希腊南非蒙古奥地利肯尼亚加纳丹麦津巴布韦埃及坦桑尼亚捷克阿联酋安哥拉