文章地址:https://arxiv.org/abs/2503.09656

摘要:时间序列预测(TSF)在金融规划、健康监测等众多现实领域中至关重要。近期研究表明,大语言模型(LLMs)凭借其强大的上下文建模能力,在时间序列预测领域具有巨大潜力。然而,现有基于大语言模型的方法通常表现欠佳,因为它们忽视了时间序列数据的固有特征。与大语言模型预训练所用的文本数据不同,时间序列数据语义稀疏,且包含独特的时间模式。为解决这一问题,我们提出LLM-PS,通过从时间序列数据中学习基本模式(Patterns)和有意义的语义(Semantics),使大语言模型能够胜任时间序列预测任务。我们的LLM-PS集成了一种新型多尺度卷积神经网络,可精准捕捉时间序列中的短期波动和长期趋势。同时,我们引入了一个“时间转文本”模块,用于从连续时间区间而非孤立时间点提取有价值的语义。通过整合这些模式和语义,LLM-PS有效建模时间依赖关系,实现对时间序列的深度理解并输出精准预测。大量实验结果表明,LLM-PS在短期和长期预测任务中均取得了最先进的性能,在少样本和零样本场景下也表现出色。

PART 1:研究背景与意义

一、时间序列预测(TSF)的核心价值

  • 应用场景广泛:覆盖能源调度(如风电功率预测)、金融风控(股价趋势)、医疗监测(心电信号)、气象预报等关键领域,是支撑实时决策与资源优化的核心技术。

  • 实际需求迫切:精准预测可降低电网调度损耗(能源领域)、提升疾病早期预警能力(医疗领域)、减少金融市场风险(金融领域),具备显著经济与社会价值。

二、现有方法的局限性

  • 传统深度学习方法:依赖领域专家设计定制模型(如风电预测专属CNN),但时序数据跨域差异大(如金融高频波动vs气象缓慢变化),导致泛化能力弱;且训练需大量数据,易过拟合。

  • LLM-based方法:虽利用LLM的长程建模能力(如GPT4TS、TimeLLM),但忽略时序数据固有特性——与文本数据不同,时序数据存在语义稀疏性(需连续区间表达“骤升/骤降”)和独特时序模式(短周期波动+长期趋势),导致预测精度不足。

三、LLM-PS的研究意义

提出LLM-PS框架,通过提取时序数据的“模式(Patterns)”与“语义(Semantics)”增强LLM的TSF能力,填补现有方法在时序特性利用上的空白,实现全场景(短/长期、少/零样本)下的高精度预测。

PART 2:当前研究综述

一、TSF方法分类与进展

方法类别

代表技术

核心优势

主要不足

传统深度学习方法

LSTM、TCN、Transformer

捕捉局部/长程时序关联能力强

依赖刚性归纳偏置,跨域泛化差

LLM-based方法

GPT4TS、TimeLLM、CALF

长程建模与少样本泛化能力突出

忽略时序模式与语义,融合策略静态

时序模式学习方法

池化(平均/最大)、傅里叶变换

可提取短/长期模式

池化丢失细节,傅里叶仅频率域分解

语义增强方法

PromptCast(文本提示)

引入部分语义信息

语义提取依赖人工设计提示,未适配时序特性

二、研究现状总结

  • 现有方法聚焦“时序-文本对齐”或“单一模式提取”,但未系统解决时序数据的双核心特性

    • 模式层面:需同时捕捉短周期波动(如小时级用电峰谷)与长期趋势(如季节性能源消耗);

    • 语义层面:需将连续时序区间转化为LLM可理解的语义(如“早8-10点功率持续上升”)。

PART 3:研究现存挑战

一、时序数据特性被忽视

  • LLM预训练数据为文本(单个词含明确语义,如“快速”),而时序数据语义稀疏(需连续时间区间表达语义,如“连续3小时功率下降50%”)、模式复杂(短周期波动叠加长期趋势),现有LLM-based方法未针对性设计,导致语义理解与模式捕捉不足。

二、多尺度模式捕捉低效

  • 现有多尺度提取方法(如多窗口池化、傅里叶变换)存在缺陷:

    • 池化方法:需生成多尺度输入,计算成本高;

    • 傅里叶变换:仅在频率域分解,无法同时利用时域与频率域信息,模式分解精度低。

三、语义提取与LLM适配难

  • 时序语义需基于“时间区间”而非“孤立时间点”,但现有方法(如PromptCast)仅通过人工提示注入语义,未动态从时序数据中提取;且LLM原生擅长文本处理,难以直接理解时序数值的语义关联(如“功率0.2-0.3对应‘低负荷’”)。

PART 4:文章主旨与主要内容

一、核心主旨

提出LLM-PS(LLM with Temporal Patterns and Semantics) 框架,通过新增“多尺度卷积模块(MSCNN)”与“时间-文本语义提取模块(T2T)”,将时序数据的“模式”与“语义”融入LLM,解决现有方法在时序特性利用上的不足,实现全场景高精度TSF。

二、主要内容

  1. 模块设计

    1. MSCNN:通过多分支卷积+小波变换,高效捕捉短周期波动(如1小时级用电峰谷)与长期趋势(如季度能源消耗);

    2. T2T:通过掩码重建与语义过滤,将连续时序区间转化为LLM可理解的语义(如“9-12点功率从0.1升至0.4”对应“快速上升”)。

  2. 特征融合:将MSCNN提取的模式特征与T2T提取的语义特征通过“特征迁移”整合,输入经LoRA微调的LLM(GPT2),降低训练成本。

  3. 实验验证:在8个基准数据集(ETT、Weather、Traffic等)上验证“短/长期、少/零样本”预测性能,对比9类SOTA方法(如GPT4TS、iTransformer)。

  4. 消融分析:验证MSCNN、T2T模块的必要性,以及模型对噪声的鲁棒性。

PART 5:文章核心创新点

创新点1:MSCNN多尺度模式提取,精准捕捉时序动态

  • 设计逻辑:采用“并行分支卷积+小波变换”,解决传统方法“计算高效”与“分解精准”的矛盾:

    • 多分支卷积:通过不同 receptive field 的并行分支(小分支抓波动、大分支抓趋势),单前向传播生成多尺度特征,降低计算成本;

    • 小波变换分解:同时利用时域与频率域信息,将多尺度特征 decouple 为“短周期模式(高频)”与“长期趋势(低频)”,分解精度优于傅里叶变换与池化方法(可精准匹配原始时序的波动细节)。

创新点2:T2T语义提取,适配LLM文本理解能力

  • 核心机制:针对时序语义稀疏性,设计“掩码重建+TSF专属语义过滤”:

    • 掩码重建:将时序数据分割为补丁,75%随机掩码,通过编码器-解码器重建掩码补丁并预测语义标签(如“骤升”“平稳”);

    • 语义过滤:从LLM预训练词嵌入中筛选TSF相关语义(如“时间、趋势、周期”),过滤无关词(如“皮带、磁铁”),确保语义提取针对性。

创新点3:高效融合与训练,平衡精度与成本

  • 特征融合:通过“特征迁移”将模式特征与语义特征对齐,避免模态异质性导致的信息丢失;

  • 参数高效微调:采用LoRA(低秩适应)微调LLM,仅训练少量参数(GPT2的0.1%),降低计算成本(单RTX4090训练耗时比TimeLLM少90%)。

PART 6:技术路线与实验程序

一、技术路线

  1. 数据预处理:对时序数据归一化,分割为重叠补丁(用于T2T);

  2. 模式提取(MSCNN)

    1. 多分支卷积生成多尺度特征;

    2. 小波变换 decouple 为短/长期模式,经“局部-全局/全局-局部”组装增强;

  3. 语义提取(T2T)

    1. 掩码重建训练,预测补丁语义标签;

    2. 语义过滤得到TSF相关词嵌入,生成语义特征;

  4. 特征融合与预测:模式特征+语义特征通过特征迁移整合,输入LoRA微调的GPT2,输出预测结果;

  5. 损失优化:总损失=时序预测损失(MSE)+特征对齐损失(语义-模式特征相似度),平衡精度与模态一致性。

二、实验程序

实验要素

具体设置

数据集

8个基准数据集:ETT(电力)、Weather(气象)、Traffic(交通)、ILI(疾病)、ECG(医疗)等,覆盖短/长期、高/低频场景

对比方法

9类SOTA:LLM-based(GPT4TS、TimeLLM)、Transformer-based(iTransformer、PatchTST)、CNN-based(TimesNet)等

评估指标

长期预测:MSE、MAE;短期预测:SMAPE、MAE、OWA;少/零样本:MSE、MAE

实验环境

Python 3.9+PyTorch 2.0,单NVIDIA RTX 4090(24GB);LLM骨干为GPT2(前6层)

关键参数

LoRA秩=8、学习率=5e-4、T2T掩码率=75%、损失平衡参数λ=0.01

PART 7:实验结果与讨论

一、核心性能:全场景领先

  1. 长期预测(预测步长96-720)

    1. 在18个案例中15个排名第一,平均MSE比CALF(LLM-based SOTA)降6%、比TimeLLM降11%;

    2. 典型案例:ETTm1数据集MSE=0.354(GPT4TS为0.389),Weather数据集MAE=0.269(TimesNet为0.287)。

  2. 短期预测(M4数据集)

    1. 平均SMAPE=11.721、MAE=1.561、OWA=0.840,显著优于N-HiTS(SMAPE=16.965)与LSTM(SMAPE=160.031)。

  3. 少/零样本预测

    1. 10%训练数据:MSE比TimeLLM降17%,ETTm2数据集MAE=0.324(CALF为0.330);

    2. 零样本(跨数据集迁移):ETTh1→ETTm1任务MSE=0.721(GPT4TS为0.798),泛化能力突出。

二、消融实验:关键模块不可替代

消融场景

性能变化(ETTh1数据集MSE)

结论

移除T2T模块

0.426→0.418(上升2%)

T2T提取的语义可提升LLM理解能力

MSCNN替换为池化方法

0.418→0.443(上升6%)

MSCNN模式提取精度优于传统方法

移除LoRA微调

0.418→0.479(上升15%)

LoRA是LLM适配TSF的关键

三、鲁棒性:抗噪声能力强

在ETTh1数据集添加高斯噪声(噪声因子0.0-0.5),LLM-PS的MSE始终低于对比方法——噪声因子0.5时,MSE比GPT4TS低8%,证明其在实际噪声数据(如传感器误差)中的可靠性。

PART 8:文章结论与未来展望

一、核心结论

  1. 架构有效性:LLM-PS通过“MSCNN+T2T”模块,首次系统利用时序数据的“模式”与“语义”,在短/长期、少/零样本场景下均实现SOTA性能,验证了时序特性对LLM-TSF的增益价值。

  2. 模块价值:MSCNN高效捕捉多尺度时序模式,T2T解决时序语义与LLM的适配问题,LoRA平衡训练成本与精度,三者协同是性能突破的核心。

  3. 实用价值:模型抗噪声能力强、少样本泛化优,可适配数据稀缺场景(如新风电场、新医疗监测设备),工程落地潜力大。

二、未来展望

  1. 模态扩展:引入视觉模态(如风电场景的风机影像),构建“时序+模式+语义+视觉”四模态框架;

  2. 模型轻量化:通过模型剪枝、量化技术降低LLM参数量,适配边缘设备(如现场传感器);

  3. 任务扩展:将框架应用于时序异常检测(如电网故障预警)、多变量因果分析(如气象-风电关联);

  4. 语义深化:设计动态语义标签生成机制,替代人工定义(如自动生成“极端天气下功率骤降”等场景语义)。

Logo

中国智能体开发者社区,聚焦智能体与大模型开发,提供前沿资讯、实用工具链、开源项目及行业案例。通过技术沙龙、开发者大赛等活动,促进经验交流与协作,助力开发者快速构建创新智能应用。

更多推荐