回归是一项随处可见的自然现象,人们最初开始关注回归正是从人类身高的遗传数据开始的。回归也是一种用于描述变量之间关系的统计模型,比如描述收入和食品支出关系的回归模型。回归更是一项预测未来资产价格和投资决策的有力的量化工具,比如人们曾经利用太阳耀斑数量来预测证券市场的收益(效果还不错)。

我们关注线性回归是因为可以利用它进行统计推断,细说起来就是可以

  1. 测试变量间是否存在线性关系(β=0?\beta =0?
  2. 衡量变量间关系的不确定性(β\beta的置信区间)
  3. 检测线性关系的假设和意外值
  4. 寻找针对自变量和因变量的合适的转化方式

人类身高数据与均值回归

image-20211215171835536 image-20211215171915540

这两张图是Galton当时使用人类父子的身高数据所生成的散点图,我们可以看到不论选取儿子身高还是父亲身高去回归到另一组变量,最终形成的回归模型都是向均值靠拢的。

线性回归模型:变量,公式和推导

一个线性回归模型的变量包括:

  • 随机变量Y:又称为响应变量,因变量,被预测变量,被解释变量,被回归量等。
  • 变量X(不一定随机):又称为控制变量,自变量,预测变量,解释变量,回归量等。

我们需要(Y,X)(Y,X)的观测值(y1,x1),...,(yn,xn)(y_1,x_1),...,(y_n, x_n),是样本大小。如果X和Y只有一类变量可控,那么收集观测值的实验被称为控制实验,例如大豆产出和施肥量。如果X和Y两类变量均可控,那么回归模型可以进一步分为:描述性模型,例如收入vs食品支出;预测性模型,例如SPY明天的收益vs昨天的收益。

提到线性回归模型,一个简单(但错误的)的公式是:Y=α+βX+U,UN(0,σ2)Y=\alpha +\beta X+U, U\sim N(0, \sigma^2)。上述公式中需要被求取的是截距参数α\alpha和斜率参数β\beta。这之中关键的假设是误差项UUXX相互独立

一个更精确的公式是:YX=xN(α+βx,σ2)Y|X=x \sim N(\alpha+\beta x, \sigma^2)。其中概率密度函数是f(Y=yX=x)=12πσexp((yαβx)2σ2)f(Y=y|X=x)=\frac{1}{\sqrt{2\pi}\sigma}\exp(-\frac{(y-\alpha-\beta x)^2}{\sigma^2})。上述公式的简洁形式是:E(YX)=α+βXE(Y|X)=\alpha+\beta X

当误差项满足之前公式所示的正态分布,使用最大似然估计(MLE)等同于使用最小二乘法(OLS)对线性回归模型进行估计。两者达成的目标都是最小化i=1nui2\sum_{i=1}^nu_i^2,其中误差项ui=yiαβxiu_i=y_i-\alpha-\beta x_i。为了求取目标函数的最小值,我们将目标函数分别对截距参数α\alpha和斜率参数β\beta求偏导,并令编导数同时为零。此时我们得到如下公式:

  • I=1nui=0α^=yˉβ^xˉ\sum_{I=1}^nu_i=0 \to \hat \alpha = \bar y-\hat \beta \bar x
  • I=1nxiui=0拟合值y^i=α^+β^xi正交于ui\sum_{I=1}^nx_iu_i=0 \to 拟合值\hat y_i=\hat \alpha + \hat \beta x_i 正交于u_i

推导出线性回归模型的参数后,我们将得到误差项U=YE(YX)Cov(X,U)=0U=Y-E(Y|X) \to Cov(X, U)=0这一关系成立的唯一假设是变量之间存在线性关系E(YX)=α+βXE(Y|X)=\alpha + \beta X,而对于误差项的分布没有任何要求。

我们常常对X和Y作中心化处理y~i=yiyˉ,x~i=xixˉ\tilde y_i=y_i- \bar y, \tilde x_i=x_i- \bar x,此时α^=0\hat \alpha=0,这样对于求取回归模型更加容易,因为我们可以忽略截距项α\alpha。我们可以把斜率项β\beta看成局部斜率的加权平均β^=i=1ny~ix~ii=1nx~i2=i=1n(x~i2i=1nx~i2)(y~ix~i)=i=1nwibi\hat \beta=\frac{\sum_{i=1}^n\tilde y_i\tilde x_i}{\sum_{i=1}^n\tilde x_i^2}=\sum_{i=1}^n(\frac{\tilde x_i^2}{\sum_{i=1}^n\tilde x_i^2})(\frac{\tilde y_i}{\tilde x_i})=\sum_{i=1}^nw_ib_i,其中权重wiw_i正比于x~i2\tilde x_i^2,同时i=1nwi=1\sum_{i=1}^nw_i=1。每一对观测值的局部斜率是:bi=y~ix~i=yiyˉxixˉb_i=\frac{\tilde y_i}{\tilde x_i}=\frac{y_i- \bar y}{x_i- \bar x}

虽然我们在估计α\alphaβ\beta的期望时的唯一前提就是变量之间的线性关系,然而我们在衡量参数的期望估计的不确定性是需要额外假设。我们将这些假设总述如下

  • 线性:E(UX)=0,U=YαβXE(U|X)=0, U=Y-\alpha-\beta X。反例是Y=X3,Y=eXY=X^3,Y=e^X
  • 随机取样:YiY_i在给定每个XiX_i下条件独立。反例是日照时长与温度的(时间序列)关系,或者Galton实验中多子女家庭的身高数据。
  • 同方差性:Var(YX)=Var(UX)=σ2Var(Y|X)=Var(U|X)=\sigma^2。反例是收入与食品支出的关系。
  • 正态性:Y在给定X下的条件分布是高斯(正态)分布。如果我们是随机地大量采样,且没有异常值的情况下一般样本是符合正态分布的(根据中心极限定理)。

依据上文的推导,β\beta的最小二乘(OLS)估计是β^(Y1,...,Yn)=i=1n(YiYˉ)(XiXˉ)i=1n(XiXˉ)2=i=1nYi(XiXˉ)i=1n(XiXˉ)2\hat \beta(Y_1,...,Y_n)=\frac{\sum_{i=1}^n(Y_i-\bar Y)(X_i-\bar X)}{\sum_{i=1}^n(X_i-\bar X)^2}=\frac{\sum_{i=1}^nY_i(X_i-\bar X)}{\sum_{i=1}^n(X_i-\bar X)^2}。这里公式左侧是基于自变量X的条件推断。而且我们假设YiY_i 是条件独立分布的且有着相同的条件方差σ2\sigma^2β\beta估计值的方差是Var(β^)=σ2i=1n(XiXˉ)2=σ2SSTXVar(\hat \beta)=\frac{\sigma^2}{\sum_{i=1}^n(X_i-\bar X)^2}=\frac{\sigma^2}{SST_X},这里的条件方差(误差项方差)σ2=Var(YX)\sigma^2=Var(Y|X)是未知的。

我们知道误差项ui=Yiα^β^Xiu_i=Y_i-\hat \alpha-\hat \beta X_i,误差项方差σ2\sigma^2的最大似然估计(MLE)是σ^2=1/ni=1nui2=SSR/n\hat \sigma^2=1/n\sum_{i=1}^nu_i^2=SSR/n。然而这个方差估计σ^2\hat \sigma^2是有偏的,因为误差项uiu_i满足两类限制I=1nui=0,I=1nxiui=0\sum_{I=1}^nu_i=0,\sum_{I=1}^nx_iu_i=0,我们在对其进行简单的线性回归分析自由度是n-2。误差项方差的无偏估计是σ^2=1/(n2)i=1nui2=SSR/(n2)\hat \sigma^2=1/(n-2)\sum_{i=1}^nu_i^2=SSR/(n-2)

将上述误差项方差估计带入β^\hat \beta的方差公式,我们得到β^\hat \beta标准误为s.e.(β^)=σ~i=1n(XiXˉ)=1n2SSRSSTXs.e.(\hat \beta)=\frac{\tilde \sigma}{\sqrt{\sum_{i=1}^n(X_i-\bar X)}}=\frac{1}{\sqrt{n-2}}\sqrt{\frac{SSR}{SST_X}}。测试零假设H0:β=0H_0:\beta =0的统计量为T=β^s.e.(β^)tn2,T2=SSESSR/(n2)F1,n2T=\frac{\hat \beta}{s.e.(\hat \beta)} \sim t_{n-2}, T^2=\frac{SSE}{SSR/(n-2)}\sim F_{1, n-2}。95%的置信区间为[β^Qs.e.(β^),β^+Qs.e.(β^)][\hat \beta-Q*s.e.(\hat \beta),\hat \beta+Q*s.e.(\hat \beta)],其中Q=tn2(1.025)2Q=t_{n-2}(1-.025) \approx 2

拟合程度:R方和相关系数

最为人熟知的度量拟合程度的统计量就是R方:R2=SSE/SSTY=1SSR/SSTYR^2=SSE/SST_Y=1-SSR/SST_Y。其中SSTY=i=1n(yiyˉ)2=i=1ny~i2,SSE=i=1n(y^iyˉ)2=i=1n(β^x~i)2SST_Y=\sum_{i=1}^n(y_i-\bar y)^2=\sum_{i=1}^n\tilde y_i^2, SSE=\sum_{i=1}^n(\hat y_i-\bar y)^2=\sum_{i=1}^n(\hat \beta \tilde x_i)^2,而SSR=SSTYSSE=i=1nui2=i=1n(y~iβ^x~i)2SSR=SST_Y-SSE=\sum_{i=1}^nu_i^2=\sum_{i=1}^n(\tilde y_i-\hat \beta \tilde x_i)^2。R方的范围在0到1之间。

我们之前提到的β\beta是否显著的T测试可以用来测试变量间的线性关系。T2=SSESSR/(n2)=(n2)R21R2F1,n2T^2=\frac{SSE}{SSR/(n-2)}=(n-2)\frac{R^2}{1-R^2}\sim F_{1, n-2}s.e.(β^)=1n2SSRSSTX=SSTYSSTX1R2n2s.e.(\hat \beta)=\frac{1}{\sqrt{n-2}}\sqrt{\frac{SSR}{SST_X}}=\sqrt{\frac{SST_Y}{SST_X}}\sqrt{\frac{1-R^2}{n-2}}。**我们发现斜率参数β\beta的T统计量(平方)和R方之间只隔着样本数量这样一个乘数。**因此如下图所示,我们在观察T统计量时一定要考虑到样本数量的大小:

image-20211228133751621 image-20211228133810739

X与Y样本间的相关系数rr也能用于衡量拟合程度,r=i=1ny~ix~i/nσ^xσ^y,其中σ^x2=1/ni=1nx~i2,σ^y2=1/ni=1ny~i2r=\frac{\sum_{i=1}^n\tilde y_i\tilde x_i/n}{\hat \sigma_x\hat \sigma_y}, 其中\hat \sigma_x^2=1/n\sum_{i=1}^n\tilde x_i^2, \hat \sigma_y^2=1/n\sum_{i=1}^n\tilde y_i^2。而我们注意到R方其实就等于X和Y相关系数的平方R2=r2R^2=r^2,两者在衡量线性关系时是等价的

image-20211216142819301

上述几张图是各种线性回归模型以及他们的R方。第一张图是描述物理现象的,第二张图是描述生物现象的,第三张图是关于金融市场建模的(其实已经是很不错的预测信号了),第四张图则不存在线性关系。

当然,仅凭R方,相关系数或T统计量并不足以衡量变量间的线性关系,著名的Anscombe四重奏就列举出了四个样本数量,均值,方差和相关性(包括R方,回归线,T统计量等)完全相同的数据集可以有多么不一样的实际样本。

image-20211228134425104

模型诊断与变量转换

为了解决类似Anscombe的问题,我们通常诉诸于集中模型诊断图表。其中的代表是残差图和分位(Q-Q)图。残差图的横纵坐标分别表示拟合值Y^i=α^+β^Xi\hat Y_i=\hat \alpha+\hat \beta X_i和残差ui=YiY^iu_i=Y_i-\hat Y_i,可用于检测异常值,拟合结果的(非线性)模式,异方差性(残差的方差不恒定)。分位图可用于检测残差的正态分布(分布中是否有厚尾)。

image-20211228135318191 image-20211228135358301

如果我们通过模型诊断图表发现异常值的话,我们可以去掉某个自变量或自变量的某个维度或特征(这在自变量维度越高的情况下影响越小),也可以去掉带来异常值的数据点(包括对应的应变量值,但我们必须多加谨慎)。

image-20211229134616115

如果我们通过模型诊断图表发现非线性关系时,我们可以通过观察(Y的)直方图,将应变量作适当的转化。

image-20211229135403694 image-20211229135429078 image-20211229135459245 image-20211229135543127

我们也可以对自变量作转化:使用包括离散化以及哑变量化;局部加权回归散点平滑法(LOESS);回归样条法(类似分段回归)等。

所谓哑变量也即自变量只能取0或1两个值。我们可以利用哑变量将自变量X分化成若干个区间。比如在回归模型中加入哑变量I(X0)I(X\ge 0)Y=α+βI(X0)+UY=\alpha + \beta I(X \ge 0)+U

分段回归指的是对于每个自变量取值区间用不同的回归线去拟合。Y=α1+β1X+U1,X<BP(breakpoint)Y=\alpha_1 + \beta_1 X+U_1, X<BP(breakpoint)Y=α2+β2X+U2,XBP(breakpoint)Y=\alpha_2 + \beta_2 X+U_2, X\ge BP(breakpoint),接下来的问题时如何选取breakpoints呢?

当模型诊断出异方差性时,我们可以使用加权最小二乘法化解。我们通常讲数据的权重设置为正比于 1/σi21/\sigma^2_i(假如方差已知)。加权最小二乘法试图最小化目标函数i=1nwi(yiαβxi)2,wi=1/σ2\sum_{i=1}^nw_i(y_i-\alpha-\beta x_i)^2, w_i=1/\sigma^2,而其参数估计为β^w=iwi(yiyˉw)(xixˉw)iwi(xixˉw)2\hat \beta _w=\frac{\sum_iw_i(y_i-\bar y_w)(x_i-\bar x_w)}{\sum_iw_i(x_i-\bar x_w)^2},以及α^w=yˉwβ^xˉw\hat \alpha_w=\bar y_w-\hat \beta \bar x_w。其中yˉw=i(wiyi)/iwi\bar y_w=\sum_i(w_iy_i)/\sum_iw_ixˉw=i(wixi)/iwi\bar x_w=\sum_i(w_ix_i)/\sum_iw_i。我们可以用非参数的方法(比如最近邻和核平滑法)来估计方差函数σi2=σ2(xi)\sigma_i^2=\sigma^2(x_i)

一些例子

假设我们有一组观测值(xi,yi)(x_i, y_i),其中xˉ=0,yˉ=0\bar x=0, \bar y=0。我们将Y回归到X上:Y=αyx+βyxX+UY=\alpha_{yx}+\beta_{yx}X+U。我们假定α^yx=0,β^yx=1,Ryx2=0.1\hat \alpha_{yx}=0,\hat \beta_{yx}=1,R^2_{yx}=0.1。那么如果我们将X回归到Y上:X=αxy+βxyY+VX=\alpha_{xy}+\beta_{xy}Y+V。和直觉不同的是,此时α^yx=0,β^yx=0.1,Ryx2=0.1\hat \alpha_{yx}=0,\hat \beta_{yx}=0.1,R^2_{yx}=0.1

我们可以推导出β^yx\hat \beta_{yx}rr的关系:β^yx=i=1ny~ix~ii=1nx~i2=rσ^xσ^yσ^x2=rσ^yσ^x\hat \beta_{yx}=\frac{\sum_{i=1}^n\tilde y_i\tilde x_i}{\sum_{i=1}^n\tilde x_i^2}=\frac{r\hat \sigma_x\hat \sigma_y}{\hat \sigma_x^2}=r\frac{\hat \sigma_y}{\hat \sigma_x}。由此易得:β^yxβ^xy=r2=R21\hat \beta_{yx}\hat \beta_{xy}=r^2=R^2\le 1,这个性质和Stein悖论直接相关

假设我们有一组观测值(xi,yi)(x_i, y_i),其中xˉ=0,yˉ=0\bar x=0, \bar y=0。我们将Y回归到X上:Y=α+βX+UY=\alpha +\beta X+U。我们假定α^=0,β^=1,R2=0.1,tstat=2\hat \alpha =0,\hat \beta =1,R^2=0.1, t-stat=2。如果我们将观测值重复使之加倍,此时根据公式α^=0,β^=1\hat \alpha =0,\hat \beta =1保持不变,而R2=r2=0.1R^2=r^2=0.1也保持不变。但T统计量随样本量增加而变大,T2=(n2)R21R2,TnR=22T^2=(n-2)\frac{R^2}{1-R^2}, T \approx \sqrt{n}R=2\sqrt{2} 。我们同时可以推导出原来的样本量,n=2+T2(1R2)/R2=38n=2+T^2(1-R^2)/R^2=38

在金融领域中,线性回归最常被用来来进行时间序列分析和横截面分析。假设我们有股票i在时间t时的价格序列Pt,iP_{t,i}。我们定义股票i在时间t时的超前收益Tt,iT_{t,i}Yt,i=Pt+1,iPt,iPt,ilog(Pt+1,i)log(Pt,i)Y_{t,i}=\frac{P_{t+1,i}-P_{t,i}}{P_{t,i}}\approx log(P_{t+1,i})-log(P_{t,i})。我们同时有股票i在时间t时的预测值Xt,iX_{t,i}(该值在时间t时已知)。横截面分析指的是在特定时间点t分析一系列股票数据。时间序列分析指的是在特定股票i上分析它的时序数据。面板分析则是指在不同股票不同时间点上分析数据。

截距项的意义

如果我们考虑一个面板回归E(Yt,iXt,i=α+βXt,i)E(Y_{t,i}|X_{t,i}=\alpha+\beta X_{t,i}),按照惯例我们通常会移除横截面Xt,iX_{t,i}的平均值从而使得iXt,i=0\sum_iX_{t,i}=0。那么我们可以得到,α^=Yˉ\hat \alpha=\bar Y。此时我们能否假设Yˉ=0\bar Y=0?答案是可以,因为现实意义中我们可以使用市场中性收益作为应变量从而使得Yˉ=0\bar Y=0,毕竟作为对冲基金我们能够“对冲”掉投资组合中的市场风险。当我们用市场中性收益Yt,iYˉtY_{t,i}-\bar Y_t和横截面居中化的Xt,iXˉtX_{t,i}-\bar X_t做回归分析时,截距项就可以被忽略了,也即α=0\alpha = 0

回归权重和有效样本数目

调整回归权重的主要原因在于不同样本可能有着不同的经济学价值。比如不同州在大选中有不同的选举人数量,不同股票有不同的波动率和流动性,我们使用权重来刻画不同样本的“重要性”。

我们在前文提到过,已知一列权重向量[wi][w_i],加权最小二乘法最小化目标函数i=1nwi(yiαβxi)2\sum_{i=1}^nw_i(y_i-\alpha-\beta x_i)^2,而其参数估计为β^w=iwi(yiyˉw)(xixˉw)iwi(xixˉw)2\hat \beta _w=\frac{\sum_iw_i(y_i-\bar y_w)(x_i-\bar x_w)}{\sum_iw_i(x_i-\bar x_w)^2},以及α^w=yˉwβ^xˉw\hat \alpha_w=\bar y_w-\hat \beta \bar x_w。其中yˉw=i(wiyi)/iwi\bar y_w=\sum_i(w_iy_i)/\sum_iw_ixˉw=i(wixi)/iwi\bar x_w=\sum_i(w_ix_i)/\sum_iw_i

有侧重的权重可以体现样本中不同的经济学价值,也会导致自变量的统计功效的降低。我们定义有效样本数目ESS=(i=1nWi)2i=1nWi2=μw2σ22nESS=\frac{(\sum_{i=1}^nW_i)^2}{\sum_{i=1}^nW_i^2}=\frac{\mu_w^2}{\sigma_2^2}\le n,注意到Var(Xi)=σ2,Var(Xˉ)=σ2/nVar(X_i)=\sigma^2,Var(\bar X)=\sigma^2/n,因此Var(Xˉw)=σ2/ESSVar(Xˉ)Var(\bar X_w)=\sigma^2/ESS\ge Var(\bar X)

关于使用场景,简单来说我们会使用等权回归模型来估计参数,使用加权回归模型来计算预测值。

极值处理与稳定性

我们通常需要对自变量作转化处理来减小其极值带来的影响。比如裁剪掉某些自变量(这在自变量维度越高的情况下影响越小),使用横截面的排名(或百分位标准化值)来替代实际数值,移除极端值或裁剪掉对应的应变量值(但我们在运用清理后的回归模型进行预测时必须多加谨慎)。

我们在处理回归模型时总会面临效率性和稳定性的权衡。在极端情况下,我们只会在回归模型左侧使用应变量的正负号,同时我们仍然能得到无偏的估计值。此类过程取得了相当的稳定性,但在样本数量较小时不够有效率。

具体来说,若Y=βX+UY=\beta X+U,其中XN(0,σx2),UN(0,σ2)X \sim N(0, \sigma_x^2), U \sim N(0, \sigma^2)。我们用Z表示Y的(正负)符号,然后用Z对X作回归:Z=a+bX+VZ=a+bX+V。参数估计量b^\hat b 以及β\beta 的关系是E(b^)=2πβσYE(\hat b)=\sqrt{\frac{2}{\pi}}\frac{\beta}{\sigma_Y},其中σY2=β2σX2+σ2\sigma_Y^2=\beta^2\sigma_X^2+\sigma^2是Y的方差。同理我们也可从b^\hat b得到β\beta的无偏估计。

残差化

假设我们在模型中加入一个新的预测变量Z到我们原先整合过的预测变量X,如何选取Z的系数呢?现在我们有多重线性回归模型Y=β1X+β2Z+UY=\beta_1X+\beta_2Z+U,其中关键的假设是随机误差U和X还有Z是线性不相关的。我们可以通过两步简单线性回归来估计β2\beta_2

  1. 将Z对X进行残差化,Z=γX+U1Z=\gamma X+U_1
  2. 将Y对残差U1=Zγ^XU_1=Z-\hat \gamma X作回归来得到β^2\hat \beta_2

现简略证明如下:我们对多重线性回归模型作适当变换Y=β1X+β2Z+U=(β1+β2γ^)X+β2(Zγ^X)+UY=\beta_1X+\beta_2Z+U=(\beta_1 + \beta_2 \hat \gamma)X+\beta_2(Z-\hat \gamma X)+U 而从最初的多重线性回归我们知道UX,UZU(Zγ^X)U \bot X, U\bot Z \to U \bot (Z-\hat \gamma X), 由Z的残差化定义我们知道Zγ^X=U1XZ-\hat \gamma X=U_1 \bot X,因此我们得出Zγ^XZ-\hat \gamma X(β1+β2γ^)X,U(\beta_1 + \beta_2 \hat \gamma)X, U均线性无关,因此β^2\hat \beta_2正是Y对残差U1=Zγ^XU_1=Z-\hat \gamma X作回归之后的斜率系数。再进一步说,如果我们从回归模型Y=βX+U2Y=\beta X+U_2中得到β^\hat \beta,那么β^1=β^γ^β^2\hat \beta_1=\hat \beta-\hat \gamma \hat \beta_2

贝叶斯回归与正则化

贝叶斯回归简单来说就是在线性回归Y=βX+U,UN(0,σ2)Y=\beta X+U, U\sim N(0, \sigma^2)的基础上对参数加上一个先验分布βN(μ0,σ2/λ0)\beta \sim N(\mu_0, \sigma^2/\lambda_0)β\beta的后验分布是一个高斯分布,其期望是E(βY,X,σ2,μ0,σ02)=iXi2iXi2+λ0β^OLS+λ0iXi2+λ0μ0E(\beta|Y, X, \sigma^2, \mu_0, \sigma_0^2)=\frac{\sum_iX_i^2}{\sum_iX_i^2+\lambda_0}\hat \beta^{OLS}+\frac{\lambda_0}{\sum_iX_i^2+\lambda_0}\mu_0,方差是Var(βY,X,σ2,μ0,σ02)=σ2iXi2+λ0Var(\beta|Y, X, \sigma^2, \mu_0, \sigma_0^2)=\frac{\sigma^2}{\sum_iX_i^2+\lambda_0}。当μ0=0\mu_0=0时我们发现贝叶斯估计就等价于岭回归(也称Tikhonov回归)。

我们可以将贝叶斯回归理解成对于简单线性回归进行了某种正则化,正则化最小二乘法式图最小化(假定α=0\alpha =0):i=1n(YiβXi)2+λ0P(β),λ0>0\sum_{i=1}^n(Y_i-\beta X_i)^2+\lambda_0P(\beta), \lambda_0>0

  • P(β)=β2P(\beta)=\beta^2时,我们得到了岭回归(β\beta的先验为期望为0的高斯分布)。其中岭回归的参数估计β^ridge=iXi2iXi2+λ0β^OLS\hat \beta^{ridge}=\frac{\sum_iX_i^2}{\sum_iX_i^2+\lambda_0}\hat \beta^{OLS},这相当于将OLS的估计值β^\hat \beta“缩减”向零
  • P(β)=βP(\beta)=|\beta|时,我们得到了套索回归(β\beta的先验为拉普拉斯分布)。其中套索回归的参数估计β^lasso=max(0,β^OLSλ0sign(β^OLS))\hat \beta^{lasso}=max(0, \hat \beta^{OLS}-\lambda_0 sign(\hat \beta^{OLS})),相当于β^OLS<λ0|\hat \beta^{OLS}|<\lambda_0时为零,否则缩减向零。这也被称为软阈值。

那么如何选取先验分布的惩罚系数?一般我们是通过已有的经验,亦或是依据测试样本的表现从优选取(即交叉验证法)。我们为什么要使用正则化呢?这就要提到机器学习中常说的偏见方差权衡(尤其在样本数量小的情况下),同时我们希望取得更优异的样本外预测能力(尤其是当我们在研究多种预测变量时)。既然提到了样本外预测,我们接下来讨论一下斯坦因悖论(Stein’s paradox)。

斯坦因悖论

假如我们想要预测m个独立模型[θk,k=1,...,m][\theta_k,k=1,...,m]所产生的日收益,我们可以观察每个模型在n天里的收益并计算每个模型的日均收益Zk=θk+U,UN(0,σn2=σ2/n)Z_k=\theta_k+U, U\sim N(0, \sigma_n^2=\sigma^2/n),那么我们能否用ZkZ_k来估计θk\theta_k

如果θk\theta_k的估计值采用βZk\beta Z_k的形式,那么β\beta的最佳值是多少?当m=2m=2时,β\beta最佳值=1=1。当m>2m>2时,我们需要最小化k=1m(θkβZk)2\sum_{k=1}^m(\theta_k-\beta Z_k)^2,这其实就是将θk\theta_k回归到ZkZ_k上。由前文的推导,当m=2m=2时我们有β^1=R2<1\hat \beta *1=R^2<1,其中R2R^2θk\theta_k回归到ZkZ_k的R方,当然我们无法实际测算出该R方,因为θk\theta_k并不可被直接观测。

James和Stein在1961年提出以下β\beta的估计值:β^JS=1(m2)σn2k=1mZk2<1\hat \beta^{JS}=1-\frac{(m-2)\sigma_n^2}{\sum_{k=1}^mZ_k^2}<1,同时θ^JS=β^JSZk\hat \theta^{JS} = \hat \beta^{JS}Z_k。Stein估计值的优越性是显而易见的,当m>2m>2时,对于任意[θk,k=1,...,m][\theta_k,k=1,...,m],我们有E[k=1m(θkβ^JSZk)2]<E[k=1m(θkZk)2]E[\sum_{k=1}^m(\theta_k-\hat \beta^{JS}Z_k)^2]<E[\sum_{k=1}^m(\theta_k-Z_k)^2]。该估计值可以进一步优化为(0,β^JS)(0, \hat \beta^{JS})

辛普森悖论和抽样偏差

辛普森悖论(Simpson‘s paradox)指的是在数据的不同部分中表现出的趋势在将它们整合后该趋势消失甚至反转的现象。

image-20211230132531706

如果整合标记Z可以被观察到,我们可以对于不同部分的观察数据拟合出不同的模型,然后利用整合标记将不同模型组合成一个系数可变的模型Y=(β0+β1Z)X+U=β0X+β1ZX+UY=(\beta_0+\beta_1Z)X+U=\beta_0X+\beta_1ZX+U。其中,同时U与X,ZX相互独立。

如果整合标记是隐藏的且无法观测。我们可以对这一不可观测的标记进行建模,将其包装成一个混合模型中的隐藏(离散)随机变量或者随机效应模型中的连续隐藏变量。

image-20211230132607546

抽样偏差的问题也值得我们保持谨慎,我们必须对数据收集过程时时关注,提防诸如幸存者偏差,数据遗失这样的现象。

回归谬误

那么回到我们最开始提出的一个问题,为什么人类身高会出现“均值回归”的现象呢?这是因为人类不同代际间的身高数据的方差是相对恒定的:σ^xσ^yβ^r<1\hat \sigma_x \approx \hat \sigma_y \to \hat \beta \approx r < 1,那么将父子两组身高数据进行回归后,因变量相比于自变量会更收敛,所以我们得出的回归模型会向均值靠拢。如果β^=1\hat \beta=1,那么几代人之后我们会发现高大的人的后辈变得更加高大,矮小的人的后辈更加矮小,最终人类将分化为巨人和侏儒。

均值回归等类似现象引出的回归谬误其实比比皆是:

  • 赞扬有时会反噬:是否有时批评比赞扬更有效?有时候优异的表现只是运气使然,过度赞扬只会让人们归因于不存在的实力或经验。
  • NBA的“新秀墙”:比如当年的林疯狂Linsanity,其实只是新秀年的超常发挥后自然的均值回归。
  • 在某个路段安装超速摄像头后事故频率降低了,因此超速摄像头有助于提升道路安全。其实也有可能是,这个路段之所以被撞上摄像头是因为之前一段时间的事故率非常高,而装上摄像头后路段的事故率自然下降到均值,和摄像头本身并无关系。