ICLR 2025 | 一维频谱!FreDF频域视角重塑时间序列预测训练范式

1. 从“时域”到“频域”:为什么我们需要换个角度看时间序列?

大家好,我是老张,在AI和时序预测这块儿摸爬滚打了十来年。今天想和大家聊一个最近让我眼前一亮的“小”技术——FreDF。别看它实现起来可能就一行代码,但背后的思想,我觉得是真正戳中了当前时间序列预测领域的一个“盲点”。我们平时训练模型,不管是Transformer、LSTM还是各种花哨的变体,是不是都把注意力放在了“输入”上?我们绞尽脑汁设计注意力机制、捕捉长期依赖、处理非平稳性,这都没错。但我们有没有停下来想过,我们模型要预测的那个“目标”,也就是标签序列本身,它内部是不是也存在某种“纠缠”?

这种“纠缠”,在学术上叫做“标签序列的自相关性”。举个不太严谨但很形象的例子:你预测明天下午三点的气温,这个预测值不仅和今天、昨天的气温(输入)有关,是不是也和明天下午两点、一点的气温(其他标签)有关?在现实世界里,时间点之间不是孤立的。现有的主流“直接预测”范式,默认这些要预测的未来时刻的标签是相互独立的,然后一股脑儿用MSE或者MAE去算损失。这就像让一个学生同时做十道有内在联系的数学题,却只根据每道题和标准答案的差距来打分,忽略了题目之间的关联性,最终的评价(损失函数)可能是有偏差的。

FreDF这篇ICLR 2025的工作,其核心洞见就在于:这个偏差的根源在于“时域”。在时间轴上,前后时刻的标签天然相关。那怎么办?FreDF给出的答案简单又深刻:我们换个“坐标系”看问题,从“时域”跳到“频域”。通过傅里叶变换,我们把一串时间信号(标签序列)分解成不同频率的正弦波。神奇的事情发生了:在频域里,不同频率分量之间的相关性被极大地抑制了。高频的“毛刺”和低频的“趋势”在频谱上各司其职,互不干扰。这样一来,我们用频域里的差距(频域损失)作为训练目标,就得到了一个更“干净”、更无偏的优化信号。

这不仅仅是多了一个损失函数那么简单,我觉得这是一种训练范式的转变。以前我们是在“嘈杂且有偏”的场地上训练模型,现在FreDF给我们提供了一块“平整且公正”的新场地。模型学起来更舒服,效果自然就上去了。而且最棒的是,这块新场地对谁来训练(用什么模型架构)几乎没要求,Transformer能用,简单的MLP也能用,这才是其普适性的魅力所在。

2. 深入核心:频域损失如何“净化”训练目标?

2.1 时域损失的“偏见”从何而来?

要理解FreDF的好,我们得先搞清楚传统方法潜在的问题。我们常用的均方误差(MSE)或平均绝对误差(MAE)损失,是在时域上逐点计算的。公式很简单,比如MSE就是 (预测值 - 真实值)^2 的平均。这个计算过程隐含了一个很强的假设:每个预测时间点上的误差是独立的。

但现实中的时间序列,尤其是我们要预测的未来一段序列,其内部点之间往往存在强烈的自相关性。比如预测未来24小时的用电负荷,小时之间的负荷值是高度相关的。这种标签间的相关性,使得时域损失函数在数学上相对于我们真正想最大化的数据似然函数,产生了偏差。论文里的定理3.1严格证明了这一点:当标签间相关系数为正时,直接预测(DF)的损失函数是有偏估计。

这种偏差带来的直接影响是什么?我自己的经验是,模型可能会学到一些“偷懒”的策略。既然标签之间有关联,模型可能会倾向于产生一个整体上平滑、趋势正确的序列,但在捕捉一些关键的局部波动或相位细节上“力不从心”,因为时域损失没有给它足够清晰和独立的信号去修正每一个点。它优化的

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值