TSMamba：基于Mamba架构的高效时间序列预测基础模型

学术 2024-11-25 17:03 北京

本文约1800字，建议阅读5分钟
TSMamba通过其创新的架构设计和训练策略，成功解决了传统时间序列预测模型面临的多个关键问题。

在当今数据驱动的世界中，时间序列预测在多个领域扮演着关键角色。从医疗保健分析师预测患者流量，到金融分析师预测股市趋势，再到气候科学家预测环境变化，准确的时间序列预测都至关重要。然而，传统的预测模型面临着三个主要挑战：

数据获取难度：对于新兴模式的预测，相关训练数据往往难以获取或收集。例如，LOTSA（最大的公开时间序列数据集）仅包含约270亿个时间点，而相比之下，NLP领域的数据集如RedPajama-Data-v2包含数十万亿个标记。
泛化能力受限：传统模型难以在不同领域和应用场景之间迁移，每个新场景都需要重新训练模型。
数据效率低下：在训练数据有限的情况下容易出现过拟合现象。

论文创新与改进

1. 架构创新

TSMamba对传统Transformer架构进行了重大改进：

线性复杂度实现：

传统Transformer：输入长度的二次方复杂度
TSMamba：实现线性复杂度，显著提升处理效率
通过选择性状态空间实现信息的高效过滤与保留

双向编码器设计：

前向编码器：捕捉因果关系依赖
后向编码器：提取反向时间关系
时间卷积模块：对齐前向和后向表示

2. 两阶段迁移学习方法

TSMamba采用创新的两阶段迁移学习方法，有效解决了训练数据不足的问题：

第一阶段 - 骨干网络训练：

利用预训练的Mamba语言模型初始化
通过分片式自回归预测优化骨干网络
训练输入嵌入以适应时间序列数据

第二阶段 - 长期预测优化：

恢复完整TSMamba架构
加载第一阶段训练的骨干网络和嵌入层
使用差异化学习率策略进行训练

3. 通道压缩注意力机制

为处理多变量时间序列的复杂性，TSMamba引入了创新的通道压缩注意力模块：

该模块包含四个关键步骤：

时间卷积：对齐不同通道的时间维度
通道压缩：将通道数从D压缩到⌈log₂(D)⌉
注意力计算：在压缩通道维度上提取依赖关系
通道恢复：将压缩表示映射回原始通道数

这种设计既保证了对跨通道依赖关系的有效捕捉，又避免了过度拟合的风险。

实验评估与性能分析

实验设置

TSMamba在实验中采用以下配置：

3层编码器
768维嵌入大小
固定512长度的输入序列

实验评估分为两个主要场景：零样本预测和全量数据训练。

零样本预测结果

基准数据集评估

在ETTm2和Weather两个标准数据集上进行了全面测试：

预测周期：

短期：96小时
中期：192小时
长期：336小时、720小时

评估指标：

均方误差(MSE)
平均绝对误差(MAE)

关键发现

在长期预测(336和720小时)场景表现突出
与使用更大规模预训练数据的模型相比保持竞争力
在平均性能上达到领先水平，尤其是在数据效率方面

全量数据训练结果

实验数据集

在三个主要数据集上进行了详细评估：

ILI (流感数据集)
ETTm2 (电力负载数据集)
Weather (气象数据集)

性能对比

主要结果：

整体性能：

相比GPT4TS提升了15%的性能
超越了专门的时间序列预测模型PatchTST
在大多数预测长度上保持最优表现

分数据集表现：

ETTm2数据集：平均MSE降低至0.257，MAE降低至0.317
Weather数据集：平均MSE达到0.222，MAE达到0.258
ILI数据集：显著优于所有基准模型

稳定性分析：

在不同预测长度下保持稳定表现
预测结果的方差较小，显示出较高的可靠性

消融研究

为验证各个模块的有效性，进行了详细的消融实验：

通道压缩注意力模块的影响：

完整模型vs去除压缩机制
不同压缩比率的效果对比

两阶段训练策略的贡献：

单阶段vs两阶段训练的效果对比
不同预训练策略的影响

双向编码器的作用：

仅使用前向编码器的效果
双向编码器带来的性能提升

这些实验结果证实了TSMamba各个创新组件的必要性和有效性。

技术细节

论文没给源代码，我们按照论文的思路进行一个简单的复现。

关键技术实现

1. 模型核心组件

预处理模块

 class PreprocessModule(nn.Module):     def __init__(self):         super().__init__()         # 实例归一化         self.norm = ReverseInstanceNorm()         # 1D卷积实现输入嵌入         self.embedding = nn.Conv1d(             in_channels=1,             out_channels=model_dim,             kernel_size=patch_length,             stride=patch_length         )

通道压缩注意力模块

 class ChannelCompressedAttention(nn.Module):     def __init__(self, dim, num_channels):         super().__init__()         # 时间卷积层         self.temporal_conv = nn.Conv1d(dim, dim, kernel_size=3, padding=1)         # 通道压缩         compressed_channels = ceil(log2(num_channels))         self.channel_compress = nn.Conv1d(num_channels, compressed_channels, 1)         # 注意力层         self.attention = nn.MultiheadAttention(dim, num_heads=8)         # 通道恢复         self.channel_expand = nn.Conv1d(compressed_channels, num_channels, 1)

2. 优化策略

两阶段训练流程：

第一阶段：优化骨干网络
第二阶段：微调预测头
使用差异化学习率

损失函数设计：

 def huber_loss(y_pred, y_true, delta=1.0):     residual = torch.abs(y_pred - y_true)     quadratic_loss = 0.5 * residual.pow(2)     linear_loss = delta * residual - 0.5 * delta.pow(2)     return torch.mean(torch.where(residual <= delta,                                  quadratic_loss,                                  linear_loss))

总结

TSMamba通过其创新的架构设计和训练策略，成功解决了传统时间序列预测模型面临的多个关键问题。其主要贡献包括：

实现了线性复杂度的计算效率
提出了有效的两阶段迁移学习方法
设计了创新的通道压缩注意力机制

这些创新为时间序列预测领域提供了新的研究方向和实践指导。随着技术的不断发展，我们期待看到更多基于TSMamba的改进和应用，推动时间序列预测技术继续向前发展。

论文：

https://arxiv.org/abs/2411.02941

编辑：于腾凯

校对：梁锦程

关于我们

数据派THU作为数据科学类公众号，背靠清华大学大数据研究中心，分享前沿数据科学与大数据技术创新研究动态、持续传播数据科学知识，努力建设数据人才聚集平台、打造中国大数据最强集团军。

新浪微博：@数据派THU

微信视频号：数据派THU

今日头条：数据派THU

数据派THU

清华大数据研究中心官方平台，发布团队科研、教学等最新动态及大数据领域的相关信息~

最新文章

深入理解多重共线性：基本原理、影响、检验与修正策略

类GPT化学语言模型，9秒生成100种化合物，微软AI药物设计平台登Nature子刊

【阿姆斯特丹博士论文】优化、博弈与泛化界

独家｜ChatGPT搜索如何为AI代理铺路

普林斯顿王梦迪团队提出蛋白水印方法，助力AI蛋白生成的版权保护与安全

【NeurIPS2024】注意力迁移对视觉Transformer的惊人有效性研究

报名 | 揭秘AI科研神器，解锁跨学科创新密码！

独家｜在大型语言模型中对于 “涌现属性 ”的合理性检查

清华软件论坛 | 清华大学杰出访问教授樊文飞院士分享“AI = 机器学习 + 逻辑推理”

【博士论文】基于车载3D LiDAR的几何与语义场景理解深度学习研究

NeurIPS 2024 || GLBench: 面向大模型的图学习基准测试集

Token化一切，甚至网络！TokenFormer，Transformer从来没有这么灵活过！

【阿姆斯特丹博士论文】科学模拟的机器学习：推理与生成模型

基于LLM Graph Transformer的知识图谱构建技术研究：LangChain框架下的文本-图谱双模式转换机制实践

为什么卷积现在不火了：CNN研究热度降温的深层原因分析

【NeurIPS2024】SAFE: 慢速与快速参数高效调优用于基于预训练模型的持续学习

TSMamba：基于Mamba架构的高效时间序列预测基础模型

【阿姆斯特丹博士论文】在视觉挑战条件下的多模态学习

大数据系统软件国家工程研究中心共同主办首届北京数字人才发展大会

NeurIPS 2024 | 重新审视时间戳信息在时序预测中的作用

通过pin_memory 优化 PyTorch 数据加载和传输:工作原理、使用场景与性能分析

【牛津大学博士论文】通过贝叶斯实验设计实现自动化数据采集

基于MCMC的贝叶斯营销组合模型评估方法论：系统化诊断、校准及选择的理论框架

当视觉大模型陷入认知失调，马里兰大学构建了一个幻觉自动生成框架

【NeurIPS2024】通过超球面能量最小化 CKA 增强贝叶斯深度学习中的多样性

数据派志愿者招募 | 寻找最志同道合的你！

综述 | 时空图神经网络模型在时间序列预测和分类中的应用

LoRA、完全微调到底有何不同？MIT 21页论文讲明白了

【NeurIPS2024】强化学习梯度作为在线微调决策变换器的维生素

报名 | 全球证书项目Innovation and Entrepreneurship for the Al Economy

NeurIPS 2024 | 经典GNNs是强有力的节点分类基线模型

从哈佛哲学系到蛋白质设计大师，David Baker：AlphaFold令我深刻认识到深度学习的力量

【CMU博士论文】交错离散搜索与连续优化用于运动规划中的动力学运动规划

IoTDB 航空航天解决方案：从制造到试飞，助力国之重器翱翔长空

深度学习工程实践：PyTorch Lightning与Ignite框架的技术特性对比分析

【CMU博士论文】使用数据不确定解释的可信学习

通知 | 清华大学大数据能力提升项目“RONG”奖学金开始申请啦！

一文解读：时序基础模型的缩放定律

基于Liquid State Machine的时间序列预测:利用储备池计算实现高效建模

【NeurIPS2024】通过分解编码和条件控制增强文本到视频生成中的运动效果

原创 | 展望大语言模型在AGI时代的发展前景

10种数据预处理中的数据泄露模式解析:识别与避免策略

【阿姆斯特丹博士论文】缓解多任务学习中的偏差

清华软件论坛 | 樊文飞：AI = 逻辑推理 + 机器学习

勾股定理还能这样证明？高中生一连发现10种证明方法，陶哲轩点赞

基于PyTorch的大语言模型微调指南：Torchtune完整教程与代码示例

【CELL】用AI智能体推动生物医学发现

科普之旅｜大语言模型与量子计算的融合

Github上的十大RAG(信息检索增强生成)框架

【NeurIPS2024】将连续潜在变量模型扩展为概率积分电路

分类

时事

民生

政务

教育

文化

科技

财富

体娱

健康

情感

旅行

百科

职场

楼市

企业

乐活

学术

汽车

时尚

创业

美食

幽默

美体

文摘

原创标签

时事社会财经军事教育体育科技汽车科学房产搞笑综艺明星音乐动漫游戏时尚健康旅游美食生活摄影宠物职场育儿情感小说曲艺文化历史三农文学娱乐电影视频图片新闻宗教电视剧纪录片广告创意壁纸头像心灵鸡汤星座命理教育培训艺术文化金融财经健康医疗美妆时尚餐饮美食母婴育儿社会新闻工业农业时事政治星座占卜幽默笑话独立短篇连载作品文化历史科技互联网

发布位置

广东北京山东江苏河南浙江山西福建河北上海四川陕西湖南安徽湖北内蒙古江西云南广西甘肃辽宁黑龙江贵州新疆重庆吉林天津海南青海宁夏西藏香港澳门台湾美国加拿大澳大利亚日本新加坡英国西班牙新西兰韩国泰国法国德国意大利缅甸菲律宾马来西亚越南荷兰柬埔寨俄罗斯巴西智利卢森堡芬兰瑞典比利时瑞士土耳其斐济挪威朝鲜尼日利亚阿根廷匈牙利爱尔兰印度老挝葡萄牙乌克兰印度尼西亚哈萨克斯坦塔吉克斯坦希腊南非蒙古奥地利肯尼亚加纳丹麦津巴布韦埃及坦桑尼亚捷克阿联酋安哥拉