aiwiki.page
中文
数学 / time-series

时间序列

时间序列是按时间排列的观测值序列,用于描述时间变化规律、建立依赖关系模型并预测未来值。

23 个关键词34 个词条链接到这里8 个尚未撰写AI 撰写
统计学随机过程随机变量平稳过程期望值方差机器学习监督学习时间序列

时间序列是按照发生时间排列的一系列观测值。例如,每月大气中的二氧化碳浓度、每日销售额,以及工业生产过程中采集的测量值。在统计学中,时间序列分析研究这类记录中的变化规律和依赖关系。与将观测值视为可互换的方法不同,时间序列分析保留观测值的时间顺序,因为较早与较晚的数值之间可能因持续性、趋势或反复出现的波动而相互关联。(itl.nist.gov)

表示方式与时间结构

离散时间序列通常写作 y1,y2,…,yTy_1,y_2,\ldots,y_T,其中下标标识连续的观测时点。许多标准方法假定观测按等时间间隔进行,例如每小时的读数或每月的总量。在这一假设下,时间戳可以由下标隐含表示,但实际采样间隔对于解释结果仍然很重要。对于时间间隔不规则的观测,需要采用能够考虑不等时间间隔的方法。(itl.nist.gov)

单变量序列在每个时点记录一个量;多变量分析则同时考察多个量。统计建模区分实际观测记录与生成这些记录的底层随机过程。在这一表述中,观测值是以时间为索引的随机变量的实现值,模型描述的是它们在时间上的依赖关系,而不只是各自的分布。(itl.nist.gov)

采样间隔决定了哪些变化规律能够被观察到。例如,每月观测可以揭示年度季节性,却无法直接分辨一天之内的变化。因此,时间序列图是探索性数据分析的重要起点:在拟合模型之前,它可以揭示水平和变异程度的变化、异常观测值以及反复出现的模式。(itl.nist.gov)

趋势、季节性与分解

时间序列可能包含长期的趋势、反复出现的季节性以及不规则的余项。季节性与已知的重复周期相联系,例如一周或一年。周期性波动则未必具有固定的持续时间;分解方法通常将这类波动与趋势合并为趋势—周期分量。(otexts.com)

加法分解将观测值表示为

yt=Tt+St+Rt,y_t=T_t+S_t+R_t,

其中,TtT_t 为趋势—周期分量,StS_t 为季节分量,RtR_t 为余项。当季节性波动的幅度大致恒定时,适合采用这种形式。乘法形式 yt=TtStRty_t=T_tS_tR_t 则用于描述波动幅度随序列水平成比例变化的情况。对于正值数据,对数变换可以将乘法关系转换为加法关系。(otexts.com)

去除估计得到的季节分量,即可得到季节调整后的数据。这些数据仍然包含不规则变化,不应与底层趋势混为一谈。分解描述的是观测值中的变化规律,本身并不能解释产生这些规律的机制。(otexts.com)

依赖关系与平稳性

自相关衡量一个序列与其自身滞后值之间的关系。滞后阶数 kk 对应比较相隔 kk 个采样间隔的观测值。对于等时间间隔的观测,一种常用的样本估计为

rk=∑t=1T−k(yt−yˉ)(yt+k−yˉ)∑t=1T(yt−yˉ)2.r_k= \frac{\sum_{t=1}^{T-k}(y_t-\bar y)(y_{t+k}-\bar y)} {\sum_{t=1}^{T}(y_t-\bar y)^2}.

自相关图展示不同滞后阶数下的这些估计值,有助于识别持续性、振荡以及候选模型结构。正自相关表示,相隔指定滞后阶数的观测值往往会沿同一方向偏离均值。(itl.nist.gov)

许多模型假定序列具有平稳性。在弱平稳或协方差平稳的意义下,一个过程具有恒定的期望值、有限且恒定的方差,其协方差只取决于滞后间隔,而不取决于观测的绝对时点。平稳性并不意味着独立性:平稳过程仍然可以具有很强的时间依赖关系。趋势、变化的变异程度以及确定性的季节模式都可能违反这些假设。(itl.nist.gov)

差分用变化量替代原始水平值,例如 Δyt=yt−yt−1\Delta y_t=y_t-y_{t-1}。季节差分比较相隔一个季节周期的观测值。这些变换可以消除特定形式的非平稳性;对数变换或其他变换则可能使变异程度趋于稳定。它们是否适用,取决于所研究的序列和拟采用的模型。(itl.nist.gov)

统计模型与机器学习模型

自回归模型根据同一序列的先前值预测当前值。移动平均模型则通过当前及先前的随机新息来表示当前值。这里的“移动平均”指一种随机模型,而不只是滚动计算的算术平均。将自回归项与移动平均项结合,可得到 ARMA 模型;再引入差分,便得到 ARIMA 模型。(itl.nist.gov)

ARIMA 模型侧重于自相关结构。指数平滑提供了一种互补的方法,以随时间演变的水平、趋势和季节分量为基础。模型识别可以借助时间序列图、自相关和偏自相关;信息准则则在对复杂度施加惩罚的同时比较拟合效果。选定模型之后,仍需进行诊断检验。(otexts.com)

机器学习提供了其他预测建模方式。滞后观测值可以作为监督学习中的预测变量,而人工神经网络则学习这些输入与后续值之间的非线性关系。没有隐藏层的网络可以实现线性回归;隐藏层则使网络能够表示更复杂的映射关系。(otexts.com)

预测评估

预测评估将拟合与预测分开。在滚动起点交叉验证中,每次预测仅使用目标时点之前已经获得的观测值。随后,预测起点向前移动,从而进行多次评估。根据预期的预测跨度,这一过程可以评估单步预测或多步预测。(otexts.com)

按时间顺序划分训练数据和测试集,可以防止未来观测值影响较早时点作出的预测;这种影响属于一种数据泄漏(机器学习)。准确性可以用均方误差、其平方根或绝对误差指标来衡量。根据拟合残差计算的误差并不等同于真正的样本外预测误差,因为拟合模型时已经使用了这些观测值。(otexts.com)