Salesforce推出Moirai-MoE，新视角设计下一代时序基础模型

科技 2024-11-02 09:47 北京

点关注，不迷路，用心整理每一篇算法干货~

后台留言”交流“，加入圆圆算法交流群~

👇🏻扫码👇🏻加入圆圆算法知识星球~

（已有900+同学加入学习，700+干货笔记）

时间序列预测是人类理解物理世界变化的重要一环。自去年底以来，时序预测领域正在经历重大转型，从传统的「单一数据集训练单一模型」的模式逐步转向「通用预测基础模型」。目前虽然有不少基础模型已经提出，但如何有效地在高度多样化的时序数据上训练基础模型仍是一个开放问题。

近期，来自Salesforce、新加坡国立大学、香港科技大学（广州）的研究者以模型专家化这一全新视角作为抓手，设计并提出了下一代时序预测基础模型Moirai-MoE。该模型将模型专业化设计在token这一细粒度运行，并且以完全自动的数据驱动模式对其赋能。模型性能方面，不同于仅在少量数据集上进行评估的已有时序基础模型，Moirai-MoE在一共39个数据集上进行了广泛评估，充分验证了其优越性。该工作的短文版本已被NeurIPS 2024 Workshop on Time Series in the Age of Large Models 接收。

论文标题：Moirai-MoE: Empowering Time Series Foundation Models with Sparse Mixture of Experts

论文地址：https://arxiv.org/abs/2410.10469

代码仓库：

https://github.com/SalesforceAIResearch/uni2ts/tree/main/project/moirai-moe-1

研究动机

训练通用基础模型的一大挑战在于适应时间序列数据的高度异质性，这种时序数据的独特特性凸显了设计专业化模块的必要性。现有的解决方案主要分为两种。第一种是通过基于语言的提示来识别数据源，从而实现非常粗粒度的数据集级别模型专业化。第二种方案利用了时序数据的频率这一元特征实现了更细粒度的专业化：该方法为特定频率设计单独的输入/输出投影层，从而实现特定频率的模型专业化。

作者认为，这种人为强加的频率级专业化缺乏普适性，并引入了一些局限性。（1）频率并不总是一个可靠的指标，无法有效地捕捉时序数据的真实结构。如下图所示，具有不同频率的时间序列可以表现出相似的模式，而具有相同频率的时间序列可能显示出多样且不相关的模式。这种人为强加的频率和模式之间的不匹配削弱了模型专业化的有效性，从而导致性能下降。（2）现实世界的时间序列本质上是非平稳的，即使在单个时间序列的短窗口内也会显示出不同的分布。显然，频率级专业化的粒度无法捕捉这种程度的多样性，这凸显了对更细粒度的建模方法的需求。

为了解决上述问题，作者提出了全新的时间序列统一训练解决方案Moirai-MoE，其核心思想是利用单个输入/输出投影层，同时将各种时间序列模式的建模委托给 Transformer层中的稀疏混合专家。通过这些设计，Moirai-MoE的专业化以数据驱动的方式实现，并在token级别运行。

基于稀疏混合专家的时序基础模型

Moirai-MoE构建在它的前序工作Moirai之上。虽然Moirai-MoE继承了Moirai的许多优点，但其主要改进在于：Moirai-MoE不使用多个启发式定义的输入/输出投影层来对具有不同频率的时间序列进行建模，而是使用单个输入/输出投影层，同时将捕获不同时间序列模式的任务委托给Transformer中的稀疏混合专家。此外，Moirai-MoE提出了一种新型的利用预训练模型中知识的门控函数，并采用自回归的训练目标来提高训练效率。下面简要介绍Moirai-MoE的模块。

时序Token构造

Moirai-MoE采用切块（patching）技术将时间序列输入切成没有重叠的小块，而后对小块进行标准化来缓解分布迁移的问题。为了在自回归模型中获取准确、鲁棒的标准化统计值，作者引入掩蔽率r作为超参数，它指定整个序列中专门用于正则化器计算的部分，不对这些patch计算预测损失。最后，一个输入投影层来负责把patch投影到和Transformer一样的维度，生成时序token。

稀疏混合专家Transformer

通过用MoE层替换Transformer的每个FFN来建立专家混合层。该MoE层由M个专家网络和一个门控函数G组成。每个token只激活一个专家子集，从而允许专家专注于不同模式的时间序列数据并确保计算效率。在Moirai-MoE中，作者探索了不同的门控函数。首先使用的是最流行的线性投影门控函数，它通过一个线性层来生成专家子集的分配结果。此外，作者提出了一种新的门控机制，利用从预训练模型的token表示中得出的聚类中心来指导专家分配。这一方法的动机是，与随机初始化的线性投影层相比，预训练token表示的聚类更接近数据的真实分布，可以更有效地实现模型专业化。

训练目标

为了同时支持点预测和概率预测两种预测模式，Moirai-MoE的训练目标设定为优化未来混合分布的对数似然函数。

实验效果

作者在39个数据集上的进行了广泛测试评估来验证Moirai-MoE的有效性。

上图展示了在Monash基准中29个数据集上进行的分布内预测评估。结果表明，Moirai-MoE击败了所有竞争对手。相比前序工作Moirai，Moirai-MoE的提升幅度达到了19%。与Moirai无法超越的基础模型Chronos相比，Moirai-MoE成功弥补了差距，并相比它少65倍激活参数，这带来了巨大的推理速度的优势。

上表展示了在零样本预测设定时，Moirai-MoE在10个数据集上的点预测和概率预测的表现。Moirai-MoE-Base取得了最佳的零样本性能，甚至超越了Google的TimesFM和Amazon的Chronos（他们在预训练语料库中已包含了部分评估数据，因此存在数据泄露）。与所有规模的Moirai相比，Moirai-MoE-Small在CRPS方面提高了3%-14%，在MASE方面提高了8%-16%。考虑到 Moirai-MoE-Small 只有11M激活参数（比Moirai-Large少28倍），这些进步是非常显著的。

在这篇研究中，作者还对时序MoE基础模型的内部工作机制进行了首次探索。上图是对Moirai-MoE的专家分配分布进行的可视化。基于此，作者总结了以下观点：

1.在浅层中，不同频率的数据在专家选择的分布上呈现多样化。随着层数的加深，模型将重点转移到更通用的时间依赖性，例如更广泛的趋势和长期模式，这些依赖性可以在不同频率之间共享。到最后一层（第6层），专家分配在所有频率上变得几乎相同，表明模型已将时间序列抽象为与频率基本无关的高级表示。这一证据表明 Moirai-MoE学习到了频率不变的隐层表示，这对于模型泛化至关重要。

2.随着层数增加专家选择逐渐收敛的行为与Large Language Models中观察到的模式完全相反。这种分歧可能源于时间序列token的动态和噪声特性，它们是由小时间窗口生成的，不像从固定词汇表中派生的语言token。我们的研究结果表明，随着层数增加，模型实际上是在进行逐步地去噪过程。这一观察结果与GPT4TS的结论一致：随着层深度增加，token会被投影到输入的低维顶部特征向量空间中。

END

后台留言”交流“，加入圆圆算法交流群~

后台留言”星球“，加入圆圆算法知识请星球~【时序预测专题课程持续更新中】

知识星球提供一文贯通笔记、经典代码解析、问答服务、新人入门，已有900+小伙伴加入，价格随人数增加和内容丰富上涨，感兴趣的同学尽早加入~

投稿&加交流群请加微信，备注机构+方向拉群~

【历史干货算法笔记】

生成式模型入门：一文讲懂3大类生成式模型

Sptial-Temporal时空预测总结：建模思路、优化方法梳理

时序预测顶会论文数据集、数据处理方法、训练方法汇总

时间序列预测实战方法概述：从数据到模型

Informer模型结构和代码解析

基于Transformer的时序预测模型TFT代码详解

时空预测经典模型STGCN原理和代码解读

一网打尽：14种预训练语言模型大汇总

Vision-Language多模态建模方法脉络梳理

花式Finetune方法大汇总

从ViT到Swin，10篇顶会论文看Transformer在CV领域的发展历程

如果觉得有帮助麻烦分享在看点赞~

http://mp.weixin.qq.com/s?__biz=MzIyOTUyMDIwNg==&mid=2247491422&idx=1&sn=e6da97b751fb13e245dd94a267adc432

圆圆的算法笔记

定期更新深度学习/算法干货笔记和世间万物学习记录~

最新文章

清华大学提出基于多模态大模型的时间序列异常检测方法

我发现了找顶会创新点的最强公式，真的不需要脑子

最全汇总！2024推荐系统大厂顶会工作整理

检索增强时序预测——大模型RAG建模思路在时序预测中的应用

今天面试了一个字节女生，当场想给她offer！

2024时序预测都有哪些经典工作——总结篇

针对长周期非平稳多元时间序列的异常检测方法

NeurIPS'24：针对时序预测中时间戳特征的研究

发一篇顶会真不难

高效的卷积+Attention多元时序预测模型结构，实现长短期&变量间关系建模

最后3天！双11星球特惠~

适用于各类结构&领域时序数据的通用时序预测模型

最后3天！双11星球特惠~

取代Mamba，超越Transformer！扩展LSTM到数十亿参数

Salesforce推出首个通用时序预测模型评测基准GIFT-Eval，助力时序通用基础模型研究

南大&阿里发布多模态大模型WINGS，解决基于LLM的多模态训练灾难遗忘问题

港科技&MIT&浙大联合发布通用时序特征机器TimeMixer++，多项任务取得SOTA效果

双11星球优惠券来啦~

Salesforce推出Moirai-MoE，新视角设计下一代时序基础模型

免费白皮书《从头训练大模型最佳实践》

清华大学NeurIPS'24：时序大模型AutoTimes，结合In-context Learning提升预测效果

时间序列模型深度解析知识库

NIPS 2024时间序列工作——公众号已更新文章汇总

多阶段对比学习+多专家CLIP实现细粒度多模态表征学习

FoundTS：时间序列预测基础模型的全面统一测评基准

剑桥大学时间序列对比学习新方法，缓解伪负样本影响

时间序列+深度学习干货笔记专栏

几篇KDD'24大厂推荐系统优化工作总结

华为诺亚方舟实验室与华东师范大学联合发布时序预测通用模型ROSE——轻量规模，SOTA效果！

（更新至27节）时间序列预测专题系列干货文章

清华大学最新发布：统一时序预测模型，上下文长度首次扩展至千级别，适用各类数据集

重磅！机器学习时间序列预测+Transformer，堪称顶会收割机！

阿里达摩院最新多模态大模型介绍，多项图文任务取得SOTA效果

20场kaggle时间序列比赛Top方案GrandMaster整理

时序预测数据处理新方法汇总：多粒度和频域的可逆归一化

腾讯KDD‘24公开最新广告推荐系统建模方案

近7年深度学习时序预测建模方法汇总

普林斯顿大学提出首个基于MoE的稀疏时序预测大模型，参数量扩展到2.4billion

15种金融时间序列预测方法总结

时序预测中的多类型模型组合建模方案

时间序列预测专题系列干货文章

KDD'24系列：统一时间序列预训练Transformer

Transformer手撕BP，当场拿了offer

不会捞“偏门”，这辈子别想发计算机顶会顶刊！

一文汇总：长周期时序预测有哪些优化点？

LSTM+transformer=金融时序预测超高精准度！

高维多变量下的Transformer时序预测建模方法

分类

时事

民生

政务

教育

文化

科技

财富

体娱

健康

情感

旅行

百科

职场

楼市

企业

乐活

学术

汽车

时尚

创业

美食

幽默

美体

文摘

原创标签

时事社会财经军事教育体育科技汽车科学房产搞笑综艺明星音乐动漫游戏时尚健康旅游美食生活摄影宠物职场育儿情感小说曲艺文化历史三农文学娱乐电影视频图片新闻宗教电视剧纪录片广告创意壁纸头像心灵鸡汤星座命理教育培训艺术文化金融财经健康医疗美妆时尚餐饮美食母婴育儿社会新闻工业农业时事政治星座占卜幽默笑话独立短篇连载作品文化历史科技互联网

发布位置

广东北京山东江苏河南浙江山西福建河北上海四川陕西湖南安徽湖北内蒙古江西云南广西甘肃辽宁黑龙江贵州新疆重庆吉林天津海南青海宁夏西藏香港澳门台湾美国加拿大澳大利亚日本新加坡英国西班牙新西兰韩国泰国法国德国意大利缅甸菲律宾马来西亚越南荷兰柬埔寨俄罗斯巴西智利卢森堡芬兰瑞典比利时瑞士土耳其斐济挪威朝鲜尼日利亚阿根廷匈牙利爱尔兰印度老挝葡萄牙乌克兰印度尼西亚哈萨克斯坦塔吉克斯坦希腊南非蒙古奥地利肯尼亚加纳丹麦津巴布韦埃及坦桑尼亚捷克阿联酋安哥拉