只有曲线形状才重要:通过下一曲线形状预测训练基础模型进行零样本多元时间序列预测

💡 原文中文,约2200字,阅读约需6分钟。
📝

内容提要

该文综述时间序列基础模型进展:TimeGPT零样本预测接近最优监督模型;TSFT存在过拟合,GBT两阶段框架可缓解;FourierGNN以超变量图统一时空动态;PatchTST提升长期预测;LLM可零样本外推时间序列,但GPT-4因分词与校准问题可能逊于GPT-3。

🔎

延伸解读

零样本预测的实用价值

文章指出,TimeGPT等基础模型在零样本设置下,开箱即用的预测准确度已接近各数据集的最先进监督模型。这意味着对于缺乏标注数据或需要快速部署的场景,基础模型能显著降低训练成本,提供可用的预测结果。但需注意,其性能仍受限于预训练语料与目标领域的匹配程度。

TSFT过拟合与GBT的改进

文章提到,时间序列预测转换器(TSFT)存在严重过拟合,主要源于解码器输入初始化不当,尤其在非平稳序列上。GBT通过两阶段框架(自回归和自身回归)分解预测过程,缓解了输入与预测序列统计特性不同的问题。这提示读者,直接套用Transformer可能不稳定,需关注模型对非平稳性的处理机制。

LLM预测的潜力与局限

文章发现,GPT-3等大语言模型能零样本外推时间序列,性能可与专用模型媲美,且能自然处理缺失值和文本边信息。但GPT-4可能因分词方式和不确定性校准较差而表现不如GPT-3,这很可能与RLHF等对齐干预有关。因此,模型升级不一定带来预测提升,需谨慎评估。

❓

Q&A

TimeGPT是什么?它在时间序列预测中有什么特点?

TimeGPT是时间序列的首个基础模型,基于对大型时间序列语料库预训练的修补解码器样式注意力模型,能够生成准确的预测结果。其开箱即用的零样本预测性能接近各个数据集的最先进的监督预测模型准确度,并且可以适用于不同的预测历史长度、预测长度和时间粒度。

TSFT存在什么问题?GBT框架是如何解决这个问题的?

TSFT(时间序列预测转换器)存在严重的过拟合问题,这是由于未知解码器输入的不当初始化方法引起的,特别是在处理非平稳时间序列时。GBT是一种新的两阶段Transformer框架,将TSFT的预测过程分解为自回归阶段和自身回归阶段,以解决输入序列和预测序列之间不同统计特性的问题。大量实验表明GBT具有预测能力,并可以与其他模型竞争。

FourierGNN是如何处理多元时间序列预测的?

FourierGNN从纯图的角度重新审视多元时间序列预测,定义了一种新的数据结构——超变量图,以滑动窗口作为时空全连接图,统一考虑时空动态并将经典MTS预测重构为在超变量图上的预测。通过在傅里叶空间执行矩阵乘法的傅里叶图神经网络架构,实现了更低的复杂性、更高的效率和较少参数,从而取得了卓越的预测性能。

PatchTST模型有哪些关键设计?它在长期预测中表现如何?

PatchTST基于两个关键组件:时间序列划分为子序列级别的片段作为输入标记传递给Transformer;通道独立性,其中每个通道包含一个单变量时间序列,在所有系列中共享相同的嵌入和Transformer权重。PatchTST可以显著提高长期预测准确性,超越SOTA Transformer-based models,并在自我监督预训练任务中实现出色的微调性能。

大型语言模型(如GPT-3)如何用于时间序列预测?GPT-4为什么可能表现更差?

通过将时间序列编码为数字字符串,可以将时间序列预测视为文本中的下一个标记预测。大型语言模型如GPT-3和LLaMA-2可以意外地在零样本外推时间序列,其性能与或超过在下游任务上训练的专用时间序列模型相当。LLMs的成功源于它们能够自然地表示多模态分布,结合了对简洁性和重复性的偏好,这与许多时间序列的显著特征(如重复季节性趋势)相一致。然而,由于GPT-4如何令牌化数字以及较差的不确定性校准,它可能比GPT-3表现更差,这很可能是因为诸如RLHF之类的对齐干预的结果。

除了TimeGPT和PatchTST,还有哪些时间序列预测模型被提及?它们各自有什么特点?

文章还提到了多个模型:TTS-GAN扩展了基于Transformer的时间序列生成对抗网络,通过引入编码上下文并在条件生成对抗网络中使用,可以拟合具有多个子组件的混合分布;一个面向多变量时间序列数据的图神经网络框架,采用图学习模块提取变量关系,并运用混合传递和膨胀创新层捕捉时空相关性;一个基于Transformer的无监督多元时间序列表示学习框架,可应用于回归、分类、预测和缺失值插补等下游任务;Conformer采用编码器-解码器架构和正则化流派生的模块,显式建模互系列相关性和时间动态,在长期时间序列预测中优于现有方法。

🏷️

标签

➡️

继续阅读