LLM-PS:基于时序模式与语义增强的大语言模型时间序列预测框架
文章地址:https://arxiv.org/abs/2503.09656
摘要:时间序列预测(TSF)在金融规划、健康监测等众多现实领域中至关重要。近期研究表明,大语言模型(LLMs)凭借其强大的上下文建模能力,在时间序列预测领域具有巨大潜力。然而,现有基于大语言模型的方法通常表现欠佳,因为它们忽视了时间序列数据的固有特征。与大语言模型预训练所用的文本数据不同,时间序列数据语义稀疏,且包含独特的时间模式。为解决这一问题,我们提出LLM-PS,通过从时间序列数据中学习基本模式(Patterns)和有意义的语义(Semantics),使大语言模型能够胜任时间序列预测任务。我们的LLM-PS集成了一种新型多尺度卷积神经网络,可精准捕捉时间序列中的短期波动和长期趋势。同时,我们引入了一个“时间转文本”模块,用于从连续时间区间而非孤立时间点提取有价值的语义。通过整合这些模式和语义,LLM-PS有效建模时间依赖关系,实现对时间序列的深度理解并输出精准预测。大量实验结果表明,LLM-PS在短期和长期预测任务中均取得了最先进的性能,在少样本和零样本场景下也表现出色。
PART 1:研究背景与意义
一、时间序列预测(TSF)的核心价值
-
应用场景广泛:覆盖能源调度(如风电功率预测)、金融风控(股价趋势)、医疗监测(心电信号)、气象预报等关键领域,是支撑实时决策与资源优化的核心技术。
-
实际需求迫切:精准预测可降低电网调度损耗(能源领域)、提升疾病早期预警能力(医疗领域)、减少金融市场风险(金融领域),具备显著经济与社会价值。
二、现有方法的局限性
-
传统深度学习方法:依赖领域专家设计定制模型(如风电预测专属CNN),但时序数据跨域差异大(如金融高频波动vs气象缓慢变化),导致泛化能力弱;且训练需大量数据,易过拟合。
-
LLM-based方法:虽利用LLM的长程建模能力(如GPT4TS、TimeLLM),但忽略时序数据固有特性——与文本数据不同,时序数据存在语义稀疏性(需连续区间表达“骤升/骤降”)和独特时序模式(短周期波动+长期趋势),导致预测精度不足。
三、LLM-PS的研究意义
提出LLM-PS框架,通过提取时序数据的“模式(Patterns)”与“语义(Semantics)”增强LLM的TSF能力,填补现有方法在时序特性利用上的空白,实现全场景(短/长期、少/零样本)下的高精度预测。
PART 2:当前研究综述
一、TSF方法分类与进展
|
方法类别 |
代表技术 |
核心优势 |
主要不足 |
|
传统深度学习方法 |
LSTM、TCN、Transformer |
捕捉局部/长程时序关联能力强 |
依赖刚性归纳偏置,跨域泛化差 |
|
LLM-based方法 |
GPT4TS、TimeLLM、CALF |
长程建模与少样本泛化能力突出 |
忽略时序模式与语义,融合策略静态 |
|
时序模式学习方法 |
池化(平均/最大)、傅里叶变换 |
可提取短/长期模式 |
池化丢失细节,傅里叶仅频率域分解 |
|
语义增强方法 |
PromptCast(文本提示) |
引入部分语义信息 |
语义提取依赖人工设计提示,未适配时序特性 |
二、研究现状总结
-
现有方法聚焦“时序-文本对齐”或“单一模式提取”,但未系统解决时序数据的双核心特性:
-
模式层面:需同时捕捉短周期波动(如小时级用电峰谷)与长期趋势(如季节性能源消耗);
-
语义层面:需将连续时序区间转化为LLM可理解的语义(如“早8-10点功率持续上升”)。
-
PART 3:研究现存挑战
一、时序数据特性被忽视
-
LLM预训练数据为文本(单个词含明确语义,如“快速”),而时序数据语义稀疏(需连续时间区间表达语义,如“连续3小时功率下降50%”)、模式复杂(短周期波动叠加长期趋势),现有LLM-based方法未针对性设计,导致语义理解与模式捕捉不足。
二、多尺度模式捕捉低效
-
现有多尺度提取方法(如多窗口池化、傅里叶变换)存在缺陷:
-
池化方法:需生成多尺度输入,计算成本高;
-
傅里叶变换:仅在频率域分解,无法同时利用时域与频率域信息,模式分解精度低。
-
三、语义提取与LLM适配难
-
时序语义需基于“时间区间”而非“孤立时间点”,但现有方法(如PromptCast)仅通过人工提示注入语义,未动态从时序数据中提取;且LLM原生擅长文本处理,难以直接理解时序数值的语义关联(如“功率0.2-0.3对应‘低负荷’”)。
PART 4:文章主旨与主要内容
一、核心主旨
提出LLM-PS(LLM with Temporal Patterns and Semantics) 框架,通过新增“多尺度卷积模块(MSCNN)”与“时间-文本语义提取模块(T2T)”,将时序数据的“模式”与“语义”融入LLM,解决现有方法在时序特性利用上的不足,实现全场景高精度TSF。
二、主要内容
-
模块设计:
-
MSCNN:通过多分支卷积+小波变换,高效捕捉短周期波动(如1小时级用电峰谷)与长期趋势(如季度能源消耗);
-
T2T:通过掩码重建与语义过滤,将连续时序区间转化为LLM可理解的语义(如“9-12点功率从0.1升至0.4”对应“快速上升”)。
-
-
特征融合:将MSCNN提取的模式特征与T2T提取的语义特征通过“特征迁移”整合,输入经LoRA微调的LLM(GPT2),降低训练成本。
-
实验验证:在8个基准数据集(ETT、Weather、Traffic等)上验证“短/长期、少/零样本”预测性能,对比9类SOTA方法(如GPT4TS、iTransformer)。
-
消融分析:验证MSCNN、T2T模块的必要性,以及模型对噪声的鲁棒性。
PART 5:文章核心创新点
创新点1:MSCNN多尺度模式提取,精准捕捉时序动态
-
设计逻辑:采用“并行分支卷积+小波变换”,解决传统方法“计算高效”与“分解精准”的矛盾:
-
多分支卷积:通过不同 receptive field 的并行分支(小分支抓波动、大分支抓趋势),单前向传播生成多尺度特征,降低计算成本;
-
小波变换分解:同时利用时域与频率域信息,将多尺度特征 decouple 为“短周期模式(高频)”与“长期趋势(低频)”,分解精度优于傅里叶变换与池化方法(可精准匹配原始时序的波动细节)。
-
创新点2:T2T语义提取,适配LLM文本理解能力
-
核心机制:针对时序语义稀疏性,设计“掩码重建+TSF专属语义过滤”:
-
掩码重建:将时序数据分割为补丁,75%随机掩码,通过编码器-解码器重建掩码补丁并预测语义标签(如“骤升”“平稳”);
-
语义过滤:从LLM预训练词嵌入中筛选TSF相关语义(如“时间、趋势、周期”),过滤无关词(如“皮带、磁铁”),确保语义提取针对性。
-
创新点3:高效融合与训练,平衡精度与成本
-
特征融合:通过“特征迁移”将模式特征与语义特征对齐,避免模态异质性导致的信息丢失;
-
参数高效微调:采用LoRA(低秩适应)微调LLM,仅训练少量参数(GPT2的0.1%),降低计算成本(单RTX4090训练耗时比TimeLLM少90%)。
PART 6:技术路线与实验程序
一、技术路线
-
数据预处理:对时序数据归一化,分割为重叠补丁(用于T2T);
-
模式提取(MSCNN):

-
多分支卷积生成多尺度特征;
-
小波变换 decouple 为短/长期模式,经“局部-全局/全局-局部”组装增强;
-
-
语义提取(T2T):
-
掩码重建训练,预测补丁语义标签;
-
语义过滤得到TSF相关词嵌入,生成语义特征;
-
-
特征融合与预测:模式特征+语义特征通过特征迁移整合,输入LoRA微调的GPT2,输出预测结果;
-
损失优化:总损失=时序预测损失(MSE)+特征对齐损失(语义-模式特征相似度),平衡精度与模态一致性。
二、实验程序
|
实验要素 |
具体设置 |
|
数据集 |
8个基准数据集:ETT(电力)、Weather(气象)、Traffic(交通)、ILI(疾病)、ECG(医疗)等,覆盖短/长期、高/低频场景 |
|
对比方法 |
9类SOTA:LLM-based(GPT4TS、TimeLLM)、Transformer-based(iTransformer、PatchTST)、CNN-based(TimesNet)等 |
|
评估指标 |
长期预测:MSE、MAE;短期预测:SMAPE、MAE、OWA;少/零样本:MSE、MAE |
|
实验环境 |
Python 3.9+PyTorch 2.0,单NVIDIA RTX 4090(24GB);LLM骨干为GPT2(前6层) |
|
关键参数 |
LoRA秩=8、学习率=5e-4、T2T掩码率=75%、损失平衡参数λ=0.01 |
PART 7:实验结果与讨论
一、核心性能:全场景领先
-
长期预测(预测步长96-720):
-
在18个案例中15个排名第一,平均MSE比CALF(LLM-based SOTA)降6%、比TimeLLM降11%;
-
典型案例:ETTm1数据集MSE=0.354(GPT4TS为0.389),Weather数据集MAE=0.269(TimesNet为0.287)。
-
-
短期预测(M4数据集):
-
平均SMAPE=11.721、MAE=1.561、OWA=0.840,显著优于N-HiTS(SMAPE=16.965)与LSTM(SMAPE=160.031)。
-
-
少/零样本预测:
-
10%训练数据:MSE比TimeLLM降17%,ETTm2数据集MAE=0.324(CALF为0.330);
-
零样本(跨数据集迁移):ETTh1→ETTm1任务MSE=0.721(GPT4TS为0.798),泛化能力突出。
-
二、消融实验:关键模块不可替代
|
消融场景 |
性能变化(ETTh1数据集MSE) |
结论 |
|
移除T2T模块 |
0.426→0.418(上升2%) |
T2T提取的语义可提升LLM理解能力 |
|
MSCNN替换为池化方法 |
0.418→0.443(上升6%) |
MSCNN模式提取精度优于传统方法 |
|
移除LoRA微调 |
0.418→0.479(上升15%) |
LoRA是LLM适配TSF的关键 |
三、鲁棒性:抗噪声能力强
在ETTh1数据集添加高斯噪声(噪声因子0.0-0.5),LLM-PS的MSE始终低于对比方法——噪声因子0.5时,MSE比GPT4TS低8%,证明其在实际噪声数据(如传感器误差)中的可靠性。
PART 8:文章结论与未来展望
一、核心结论
-
架构有效性:LLM-PS通过“MSCNN+T2T”模块,首次系统利用时序数据的“模式”与“语义”,在短/长期、少/零样本场景下均实现SOTA性能,验证了时序特性对LLM-TSF的增益价值。
-
模块价值:MSCNN高效捕捉多尺度时序模式,T2T解决时序语义与LLM的适配问题,LoRA平衡训练成本与精度,三者协同是性能突破的核心。
-
实用价值:模型抗噪声能力强、少样本泛化优,可适配数据稀缺场景(如新风电场、新医疗监测设备),工程落地潜力大。
二、未来展望
-
模态扩展:引入视觉模态(如风电场景的风机影像),构建“时序+模式+语义+视觉”四模态框架;
-
模型轻量化:通过模型剪枝、量化技术降低LLM参数量,适配边缘设备(如现场传感器);
-
任务扩展:将框架应用于时序异常检测(如电网故障预警)、多变量因果分析(如气象-风电关联);
-
语义深化:设计动态语义标签生成机制,替代人工定义(如自动生成“极端天气下功率骤降”等场景语义)。
更多推荐




所有评论(0)