揭秘时间魔法！段类型特征驱动的时间序列聚类算法

文摘 2024-11-09 08:23 北京

点击上方蓝字关注我们

Time-Series Clustering Based on the Characterization of Segment Typologies

作者：

David Guijo-Rubio , Antonio Manuel Durán-Rosal, Pedro Antonio Gutiérrez , et al.

期刊：

IEEE Transactions on Cybernetics

论文链接：

https://ieeexplore.ieee.org/document/8960542

简介

提出了一种新的两阶段时间序列聚类算法：

第一阶段对每条时间序列：先使用swiftseg方法【基于最小二乘方法的多项式拟合】，将时间序列分割成不同长度的子序列；再对子序列进行特征提取【多项式拟合参数、方差、偏度、自相关系数】，统一子序列的投影长度；最后，根据子序列的投影序列，使用层次聚类算法进行子序列聚类；
第二阶段对数据集中的全部时间序列聚类：利用子序列的类别信息表征时间序列，将所有时间序列投影到同一个维度的空集中，再使用层次聚类算法对全部时间序列进行聚类。
重要参数：子序列分割时的误差阈值，通过聚类结果的内部评价指标 来动态调整该参数。
数据实验：选取84个UCR数据集，并与三种最先进的方法进行了比较，表明该方法的性能非常有前途，尤其是在较大的数据集上。

研究动机

时间序列聚类通常分为：

1）基于形状的聚类，通过尽可能地匹配不同时间序列的形状【一般是多项式拟合】，之后必须使用适用于时间序列的距离度量，最后采用传统的聚类算法。

2）基于特征的聚类，将时间序列转换为一组统计特征【例如，均值、方差、斜率等】，其中该向量的长度小于原始时间序列。将每个时间序列转换为相同长度的特征向量，计算标准距离度量，再采用经典聚类算法。

3）基于模型的聚类，将原始时间序列转换为一组模型参数【多为概率分布模型】，然后进行模型距离测量，并采用经典聚类算法。

但是，经典的方法往往采用【特定的距离测算】与【经典聚类算法】结合的方法，容易忽视时间序列间模式的差异。对于时间序列中特定模式的提取，可选择通过分割时间序列中不同模式的子序列来实现。并且可以通过提取子序列的特征，来简化表征高维时间序列，在尽可能保存聚类准确性的同时，降低计算复杂度。

论文贡献

提出一种新的时间序列特征提取方法，通过分割时间序列得到不同长度的子序列，利用子序列的特征进行原始时间序列的表征，有效降低原始时间序列的维度；
提出一个新的两阶段时间序列聚类模型（TS3C），更适用于高维时间序列聚类，且计算成本低于其他方法（如实验部分所示）
1）通过识别时间序列中特定模式，提高时间序列的聚类质量；
2）面向子序列和原始时间序列，分别设计不同的映射表征。
3）最终的聚类计算成本不取决于原始时间序列的长度，而是与映射表征的长度有关。对于维度较高的时间序列数据集，显示出更好的性能和计算时间；
4）分割误差阈值作为TS3C 的主要参数，根据评估聚类质量的内部准则自动调整。

TS3C 模型

第一阶段

TS3C的第一阶段包括：分割时间序列、子序列的映射及子序列的聚类，如图1所示。

对于一个给定的时间序列长度，分割在于通过分割点，将时间序列分为m个子序列。

使用SwiftSeg算法：通过不断扩展窗口，增加窗口内数据点的个数，并对该窗口内的时间序列片段进行多项式拟合，设置拟合值和真实值的误差平方和为目标函数，直到目标函数超过分割误差阈值【用户自定义的参数】。此时，将确定一个分割点 ()，重复该过程直到到达时间序列的末尾。

本文中考虑以SEP作为目标函数：

子序列的映射：在分割处理之后，将每个子序列映射为一个l维的数组(l=c+f)，其中 c 是多项式拟合的参数个数，f 是统计特征的数量（f=3），p_s(向量)是近似线段 s 的多项式近似的参数。

子序列的聚类：对所有具有相同长度(l=c+f)的时间序列片段，采用以ward距离进行凝聚式层次聚类。设置子序列的聚类数量 k = 2（研究表明两组片段足以表征序列内部特征信息）。

第二阶段

时间序列的映射、聚类及评估质量。如图2：

对于每个时间序列Y_i，通过第一阶段的子序列聚类，可以获取k个簇类。对于任意一个簇类，选取两个重要信息：

①簇类的质心( )

②簇类中方差最高的子序列，记为（极端子序列，即簇中最具特征的子序列）。

将子序列的簇类映射为一个向量w(长度=2l)：

若一个时间序列的子序列有k个簇类，则有k个长度为2l的向量。

除了每个簇类的表示之外，本文还考虑了时间序列的另外两个特征：

①与质心最不相似的片段和与其质心最相似的片段之间的误差差 ( )，通过使用相应多项式近似的均方误差（MSE）来评估分段的误差。

②时间序列的段数因此，时间序列的映射长度为，k 是簇的数量，v 是时间序列的额外信息的数量，在我们的例子中为 2（即和）。

时间序列聚类 对所有具有相同长度的时间序列，采用凝聚式层次聚类算法进行聚类。

参数调整TS3C 算法中仅涉及一个必须由用户调整的重要参数：分割错误阈值。建议考虑内部聚类评估指标来调整，提出两种不同的策略来选择最佳参数值：
①选择最佳 CH 指数的聚类结果对应的值，因为CH指数已被证明非常稳健；
②选择在多个内部评价指标上表现最佳的。

实验结果

数据集

84个UCR数据集，并按照时间序列的数量和时间序列的长度分为三组：

Group 1：序列个数>200，长度>300

Group 2：序列个数>200，长度<300

Group 3：其他

参数设置

多项式次数=1，分段聚类个数=2【一个序列分成两种模式】；

参数SEP_max考虑的范围为{10,20,30,...,100}；

结果展示

本文算法TS3C在Group 1的大规模数据集上表现更优。

致谢作者，感谢论文解读小沛同学！！转载请注明出处！关于论文的详细实施过程和具体解释请阅读论文原文哦～❤️❤️ /欢迎投稿

喜欢的话，请别忘记点赞👍➕关注哦

一文彻底搞懂多模态 - 多模态推理

大模型经典著作《大语言模型基础与前沿》

NeurIPS 2024|耦合Mamba：通过耦合状态空间模型增强多模态融合

腾讯&南大最新联合发布｜VITA：首个开源交互式全能多模态大模型！

一文彻底搞懂多模态 - 多模态学习

ICCV 2023｜CleanCLIP重磅登场！消除多模态对比学习中的数据中毒攻击

导师一个idea都没给，但也发了顶会AAAI，我摸索的这个方法绝了！

重磅3D多模态MSF框架发布！2D/3D语义分割双模态解析，重塑3D物体检测多语义融合框架

最新进展！全新特征学习框架，深度解析单模态与多模态对比学习泛化差异

揭秘时间魔法！段类型特征驱动的时间序列聚类算法

EMNLP 2024 多模态学习最新论文合集出炉！快速关注热点研究！

文末赠书｜深度揭秘！多模态大模型如何运作？一文读懂其核心原理！

NeurIPS 2024震撼发布：上交大&清华领衔创新，Diff-eRank大模型评估新指标，精准衡量LLM去噪实力！

CVPR投稿倒计时15天！Transformer还能卷出哪些新花样？

I 2025｜快手科技发布突破性EVLM！高效视觉语言模型，极大降低计算成本，实现全面视觉感知！

EMNLP 2024｜南京大学重磅推出EFUF：高效细粒度unlearning框架，全面破解多模态大语言模型“幻觉”难题！

NeurIPS 2024 | G3: 一种基于多模态大模型的高效自适应地理定位框架

港中文、UCL、武大联手攻关！NeurIPS 2024 全新多模态情绪分析模型，精准应对不完整数据挑战！

刷新多模态医学图像报告生成新高度｜AAAI 2023 山东大学&齐鲁医院推出多模态记忆Transformer！

NeurIPS 2024｜多模态学习重磅论文全览！最新研究集锦，不容错过！（下）

NeurIPS 2024｜多模态学习重磅论文全览！最新研究集锦，不容错过！（上）

突破了LLM极限，GPT-o1深度揭秘

港中文、上海AI Lab与浙大重磅推出PointLLM：大语言模型再升级，强势赋能点云理解！-ECCV 2024

NeurIPS 2024 | 像素级MLLM: Vitron, 实现图像视频的理解、生成、分割、编辑大一统

TPAMI 2024 | 基于时空结构对齐的视频-语言表示学习

ECCV 2024｜解锁多模态自监督学习！深度解耦常见与独特表示的创新突破

CVPR2023-基于交互式提示学习的多模态融合方法

CVPR 2024｜多模态大模型引爆！“因果推理”加持, 解锁链接上下文学习的无限潜能

CVPR 2023｜TransFusion震撼登场！突破性语义分割多模态融合网络，点云与图像直接融合！

TPAMI | SegNet:语义分割领域超经典轻量化模型

ECCV 2024｜多模态学习不鲁棒？表示解耦打造稳健多模态学习新纪元

NeurIPS 2021-如何利用知识图谱构建世界模型？！一种新的文本世界建模技术！

文末赠书｜《AI系统：原理与架构》于华为HC大会2024正式发布

又一本开源免费的大模型书来了，449页pdf！

CVPR 2024｜突破模态瓶颈！交替单模态适应引领多模态表示学习，攻克模态惰性与遗忘难题！

速来围观！多模态大型语言模型(MLLM)最新进展与实战应用全揭秘！

学术最前沿！2024最新深度多模态数据融合综述来袭！

AI大模型掀起效率革命！掌握ChatGPT等前沿技术，赋能企事业办公、科研与项目研发实战

ICML 2024｜浙大，NUS等高校联手推出多模态LLM革命性自动编码技术—Morph-Tokens

AAAI 2024｜重磅发布！多模态跟踪新范式：条件生成对抗网络与扩散模型的融合引爆技术革命！

ECCV 2024 | 破解多模态学习：单模态模型联合嵌入助力缺失模态预测新突破！

NeurIPS 2023｜浙大&上海AI Lab&华为联合发表--跨模态泛化的多模态统一表示

TPAMI 2024|打破边界！双向LiDAR相机语义分割中的单到多模态知识蒸馏革命

顶会NeurIPS‘24放榜！接收数量突破4千！8865高分被拒？

NeurIPS 2024|颠覆性发现！大型视觉-语言模型真的会“看”吗？MMStar基准揭示多模态评估误区与数据泄漏隐患

ECCV 2024 ｜中国人民大学、清华大学等提出平衡多模态学习的诊断和再学习方法

TPAMI 2024｜颠覆跨模态相似性学习的“游戏规则”！因果不变交互挖掘CIIM强势来袭：打破模态壁垒，精准捕捉跨模态信息！

分类

时事

民生

政务

教育

文化

科技

财富

体娱

健康

情感

旅行

百科

职场

楼市

企业

乐活

学术

汽车

时尚

创业

美食

幽默

美体

文摘

原创标签

时事社会财经军事教育体育科技汽车科学房产搞笑综艺明星音乐动漫游戏时尚健康旅游美食生活摄影宠物职场育儿情感小说曲艺文化历史三农文学娱乐电影视频图片新闻宗教电视剧纪录片广告创意壁纸头像心灵鸡汤星座命理教育培训艺术文化金融财经健康医疗美妆时尚餐饮美食母婴育儿社会新闻工业农业时事政治星座占卜幽默笑话独立短篇连载作品文化历史科技互联网

发布位置

广东北京山东江苏河南浙江山西福建河北上海四川陕西湖南安徽湖北内蒙古江西云南广西甘肃辽宁黑龙江贵州新疆重庆吉林天津海南青海宁夏西藏香港澳门台湾美国加拿大澳大利亚日本新加坡英国西班牙新西兰韩国泰国法国德国意大利缅甸菲律宾马来西亚越南荷兰柬埔寨俄罗斯巴西智利卢森堡芬兰瑞典比利时瑞士土耳其斐济挪威朝鲜尼日利亚阿根廷匈牙利爱尔兰印度老挝葡萄牙乌克兰印度尼西亚哈萨克斯坦塔吉克斯坦希腊南非蒙古奥地利肯尼亚加纳丹麦津巴布韦埃及坦桑尼亚捷克阿联酋安哥拉