从词根上看,统计一词在拉丁语中用于词组statisticum collegium,意为国务委员会;在意大利语中拼作statista,意为国会议员或者政治家;在德语中拼作statistik,意味国家数据的分析。总之是一个宏观政治意味很浓的词汇。

显然统计学作为一门严谨的学科,和最初统计一词已有较大差别。关于统计学的历史,早期的重要人物是:贝叶斯,高尔顿(达尔文表弟,遗传统计学鼻祖),高斯;近代的关键词是:皮尔逊,费雪,内曼,Wald,Tukey;当代的领军人物是:科克斯(Cox),斯坦因(Stein)和Efron。

何为统计

统计和概率的联系在于,他们都在描述XP(Xθ)X\sim P(X|\theta)的模型,两者的区别在于,概率的目标是在给定P(Xθ)P(X|\theta)的情况下,我们对于XX的判断,典型例子是求取E(X),P(X2σ)E(X),P(X\ge 2\sigma)等。而统计则是在给定实际数据XiX_i的情况下,我们对于P(Xθ)P(X|\theta)的判断,典型例子是求取μ=E(X)中的估计值μ^,参数估计值θ^,或更一般的概率累积函数估计形式P^\mu=E(X)中的估计值\hat \mu,参数估计值\hat \theta, 或更一般的概率累积函数估计形式\hat P。正如费雪在关于理论统计学的数学基础一文中所言,统计是哲学的一部分。

统计中的基本概念

总体和样本是统计中最基础的概念,在有限群体(离散)的模型中,总体是X1,...,XNX_1,...,X_N,样本是x1,...,xnx_1,...,x_n。在无限群体(连续)模型中,总体是P(Xθ)P(X|\theta),样本是X1,,XnP(Xθ)X_1,…,X_n\sim P(X|\theta)

参数是总体的某些计量,比如总体期望μ=E(X)\mu=E(X)。参数化是指用某些参数来描述一个总体,比如XN(μ,σ2)X\sim N(\mu, \sigma^2)。(这不是唯一的参数化形式,也可以写成N(θ1/(2θ2),1/(2θ2))N(-\theta_1/(2\theta_2),-1/(2\theta_2))

我们可以把统计理解为样本的函数。比如样本期望是μ^=Xˉ\hat \mu=\bar X。统计推断值的是基于样本(统计量)去推断总体(参数)。

我们用一个简单的正态模型的例子来说明上述概念,在正态模型中,总体表示成N(μ,σ2)N(\mu, \sigma^2),其中的参数是μ=E(X),σ2=Var(X)\mu = E(X),\sigma^2=Var(X)。样本则为X1,,XnN(μ,σ2)X_1,…,X_n\sim N(\mu, \sigma^2)。我们可以根据模型X1,,Xn(μ,σ2,(X1μ^/σ^),...,(Xnμ^/σ^))X_1,…,X_n\sim (\mu, \sigma^2,(X_1-\hat \mu/\hat \sigma),...,(X_n-\hat \mu/\hat \sigma))来推算出样本的统计量μ^=1/nΣi=1nXi,σ^2=1/(n1)Σi=1n(XiXˉ)2\hat \mu=1/n\Sigma_{i=1}^nX_i,\hat \sigma^2=1/(n-1)\Sigma_{i=1}^n(X_i-\bar X)^2

充分统计量是指这样一种统计量,没有任何其他可以从同一样本得到的统计量可以提供任何关于未知参数的额外信息,数学上讲是统计量S(X)S(\vec X),若数据X\vec X的条件分布p(XS)p(\vec X|S)不依赖于参数θ\theta,那么其就是关于参数θ\theta的充分统计量。

与之相关的是费雪分解定理,若一个统计模型具有似然函数p(Xθ)p(\vec X|\theta),则S(X)S(\vec X)θ\theta的充分统计量当且仅当存在非负函数gh,使得p(Xθ)=h(x)g(S(X),θ)p(\vec X|\theta)=h(\vec x)g(S(\vec X),\theta)。例子是正态分布N(μ,1)N(\mu, 1)中如果均值未知,方差固定为1,那么样本均值S=XˉS=\bar X是充分统计量。如果正态分布N(μ,σ2)N(\mu, \sigma^2)中均值方差都未知,那么样本均值和样本方差S=(Xˉ,Σi=1n(XiXˉ)2/(n1))S=(\bar X, \Sigma_{i=1}^n(X_i-\bar X)^2/(n-1))是充分统计量。

似然,贝叶斯学派,频率学派

一般情况下(实际观测数据相互独立的前提下),似然函数L(θX)L(\theta |\vec X)正比于特定参数条件下的统计模型中概率密度函数乘积i=1nf(xiθ)\prod_{i=1}^nf(x_i|\theta)。我们通常对似然函数取对数l(θX)l(\theta|\vec X),这样可以将乘积转换为加和。例如正态分布XiN(μ,σ2)X_i \sim N(\mu, \sigma^2)中,l(θX)=i=1n(Xiμ)22σ2nlog(σ)l(\theta|\vec X)=-\sum_{i=1}^n\frac{(X_i-\mu)^2}{2\sigma^2}-n\log(\sigma)。更一般地概率密度函数f(x)=h(x)exp(η(θ)T(x)A(θ))f(x)=h(x)\exp(\eta(\theta)T(x)-A(\theta))中,l(θX)=(i=1nT(Xi))η(θ)nA(θ)l(\theta|\vec X)=(\sum_{i=1}^nT(X_i))\eta(\theta)-nA(\theta)。有意思的是,似然函数是一个(最小的)充分统计量。

提到似然函数就不得不提最大似然估计,本质就是在似然函数中找最(大)值θ^MLE=argmaxθL(θX)=argmaxθi=1nf(xiθ)\hat \theta_{MLE}=\arg\max_\theta L(\theta |\vec X)=\arg\max_\theta \prod_{i=1}^nf(x_i|\theta)。最大似然估计值有着如下性质:

  • 一致性:θ^MLEθn\hat\theta_{MLE} \to \theta当 n\to \infin时
  • 无偏性:E(θ^MLE)θnE(\hat \theta_{MLE}) \to \theta 当n\to \infin时
  • 有效(最优)性:Var(θ^MLE)Var(θ^any)nVar(\hat\theta_{MLE}) \le Var(\hat\theta_{any}) 当n\to \infin时

贝叶斯学派,也即似然学派,他的原则就是在似然函数决定了我们对于真实概率的推断。比如在推断一枚硬币是否公平时,如果我们掷六次硬币而得到五次头部向上时,二项分布的似然函数是l(θX)C65θ5(1θ)l(\theta|X) \propto C_6^5\theta^5(1-\theta)。如果我们掷六次硬币才第一次得到尾部向上时,二项分布的似然函数是l(θX)θ5(1θ)l(\theta|X) \propto \theta^5(1-\theta)

似然学派或者贝叶斯学派的对手自然就是频率学派了。频率学派进行统计推断的原则是使用计数或频率来解读真实概率,他们认为某一次实验的结果应当被视为(假想中)无数重复实验结果中的一个。频率推断的性质有:

  • 无偏:E(θ^)=θE(\hat \theta)=\theta
  • 一类错误:P(rejection)=P(T(X)q0.95)=0.05P(rejection)=P(T(\vec X)\ge q_{0.95})=0.05
  • 覆盖率:P(θ[θ^L,θ^H])=0.95P(\theta \in [\hat \theta_L,\hat \theta_H])=0.95

频率推断存在着很多缺陷,比如在其基本原则也即计数原则上的争议,进行重复实验的复杂度和可行性,以及所推断出的概率在定义上的模糊性。比如Cox提出的一个双变量的例子,如果硬币出现头部的随机变量属于正态分布XN(μ,1)X \sim N(\mu, 1),出现尾部的随机变量属于正态分布XN(μ,100)X \sim N(\mu, 100),那么每个人的置信区间应该是H[X1.96,X+1.96],T[X19.6,X+19.6]H \to [X-1.96, X+1.96],T \to [X-19.6, X+19.6],然而一个“最优”的频率学派的置信区间则是H[X5.00,X+5.00],T[X16.4,X+16.4]H \to [X-5.00, X+5.00],T \to [X-16.4, X+16.4]

统计中的条件

辅助统计量的定义是这样一个统计量A(X)A(\vec X),他的分布不取决于参数θ\theta。条件推断是指控制了辅助统计量的条件下进行的推断,条件贝叶斯推断和原先相比没有变化,因为p(Xθ)p(XA,θ)p(\vec X|\theta )\propto p(\vec X|A,\theta)。但条件频率推断和原先相比会有变化,而且需要更复杂的实验。进行控制辅助统计量的条件推断的意义在于他定义了满足何种条件的重复实验才和我们想要推断的问题直接“相关”。

我们手中刚完成的实验是最直接相关的重复实验,但如果我们控制当前实验结果来进行所谓重复实验,那这样的重复实验将没有任何随机性可言。但如果我们将参数θ\theta视为随机呢?如此一来我们的重复实验将会在(X,θ)(X,\theta)展开而不是仅仅在试验结果XX上。之后我们只需在控制XX的观测值的条件下基于p(θX)p(\theta |X)进行推断。需要注意的是,这时我们需要假定θ\theta的概率分布,也即先验分布。这样的先验分布并不一致而需要我们去指定一个分布,这让这个推断过程变得主观(虽然有人在研究所谓的“客观”先验)。

点估计,假设检验,置信区间

最后来简单介绍统计中的三大概念:点估计,假设检验,置信区间

点估计

点估计的目标是找到未知参数的一个或一组“最佳”估计值。可采用的方法通常有1)似然法:最大似然估计值;2)频率法:比如均匀最小方差无偏估计(UMVUE),均匀最小风险等变估计(UMRE),极小化极大估计(minimax),容许估计(admissibility)等;3)贝叶斯法:后验均值/中位数/众数。

假设检验

假设检验用于测试参数θ\theta是否在统计上(并非数值上)显著区别于某个给定(零)值θ0\theta_0H0:θ=θ0H_0:\theta =\theta_0

假设检验的经典方法是:

  1. 找到一个在零假设H0:θ=θ0H_0:\theta =\theta_0下“表现良好”的检验统计量T(X)T(\vec X),该统计量在违背零假设时会偏离预定值。通常似然率统计量就是一个好的检验统计量。
  2. 找到这样一个T(X)T(\vec X)的阈值,使得在零假设H0H_0满足时,只有在极小概率下统计量才会超过该阈值,比如P(T(X)T0.05)=0.05P(T(\vec X)\ge T_{0.05})=0.05
  3. 观察现有数据下的统计量是否超过了该阈值,即检测是否有T(XobsT0.05)T(\vec X_{obs}\ge T_{0.05})
  4. 如果没有超过阈值,则无法拒绝零假设,否则拒绝零假设。

然而这么多年来,假设检验的问题也一直存在:

  • 为什么阈值被定为0.05?
  • 怎么去解读0.05(并不是表面上看着那么直白)
  • 统计上显著VS现实中显著
  • 拒绝不是仅仅意味着拒绝零假设
  • 重复度问题

人们也提出了更先进的假设检验方法,比如贝叶斯因子,错误发现率(FDR),大范围推断(经验性贝叶斯)等等。

置信区间

置信区间用于建立这样一个区间,它能够以高概率覆盖(未知)参数的取值。置信区间构建的经典方法有:1)似然法:最大似然估计是逐渐逼近正态的,θ^MLEN(θ,σ2),σ2=E(l(θX)θ)2\hat \theta_{MLE}\sim N(\theta, \sigma^2),\sigma^2=E(\frac{ l(\theta|X)}{\theta})^2;2)频率法:进一步分为精确法和渐进法;3)贝叶斯法:构建后验区间。需要注意的是,置信区间和假设检验是一一对应的。