呃啊,马上要期(末)考试了,紧急整理一波……(主要摘录茆书的习题+补充题)

统计量及其分布

设离散总体的分布列为

P(X=k)=1N,k=1,2,,N. P(X = k) = \frac{1}{N}, \quad k = 1, 2, \cdots, N.

现进行不放回抽样,x1,x2,,xnx_1, x_2, \cdots, x_n为样本,x=1ni=1nxi\displaystyle\overline{x} = \frac{1}{n} \sum_{i=1}^n x_i为样本均值,求 E(x)\mathbb{E}(\overline{x})Var(x)\text{Var}(\overline{x})(表示成 NN的函数)。

点击查看答案

注意:本题的样本由于来自不放回抽样,所以不是简单随机样本,不具有独立同分布性质。

先计算样本的期望、方差和协方差:

E(xi)=k=1Nk1N=N+12,Var(xi)=E(xi2)(E(xi))2=k=1Nk21N(N+12)2=N(N+1)(2N+1)6N(N+1)24=N2112,Cov(xi,xj)=E(xixj)E(xi)E(xj)=klNklN(N1)(N+12)2=(i=1Ni)2(i=1Ni2)N(N1)(N+12)2=N(N+1)(N1)(3N+2)12N(N1)(N+12)2=N+112,1ijN \begin{aligned} \mathbb{E}(x_i)&=\sum_{k=1}^Nk\cdot\frac{1}{N}=\frac{N+1}{2},\\ \text{Var}(x_i)&=\mathbb{E}(x_i^2)-(\mathbb{E}(x_i))^2\\ &=\sum_{k=1}^Nk^2\cdot\frac{1}{N}-\left(\frac{N+1}{2}\right)^2\\ &=\frac{N(N+1)(2N+1)}{6N}-\frac{(N+1)^2}{4}=\frac{N^2-1}{12},\\ \text{Cov}(x_i,x_j)&=\mathbb{E}(x_ix_j)-\mathbb{E}(x_i)\mathbb{E}(x_j)\\ &=\sum_{k\neq l}^N\frac{kl}{N(N-1)}-\left(\frac{N+1}{2}\right)^2\\ &=\frac{\left(\sum_{i=1}^Ni\right)^2-\left(\sum_{i=1}^Ni^2\right)}{N(N-1)}-\left(\frac{N+1}{2}\right)^2\\ &=\frac{N(N+1)(N-1)(3N+2)}{12N(N-1)}-\left(\frac{N+1}{2}\right)^2\\ &=-\frac{N+1}{12},\quad 1\leq i\neq j\leq N \end{aligned}

所以

E(x)=1ni=1NE(xi)=N+12,Var(x)=1n2[i=1nVar(xi)+ijnCov(xi,xj)]=N2112nn(n1)(N+1)12n2=(N+1)(Nn)12n. \begin{aligned} \mathbb{E}(\overline{x})&=\frac{1}{n}\sum_{i=1}^N \mathbb{E}(x_i)=\frac{N+1}{2},\\ \text{Var}(\overline{x})&=\frac{1}{n^2}\left[\sum_{i=1}^n\text{Var}(x_i)+\sum_{i\neq j}^n\text{Cov}(x_i,x_j)\right]\\ &=\frac{N^2-1}{12n}-\frac{n(n-1)(N+1)}{12n^2}\\ &=\frac{(N+1)(N-n)}{12n}. \end{aligned}

设总体XX的分布函数为F(x)F(x),经验分布函数为Fn(x)F_n(x),试证

E[Fn(x)]=F(x),Var[Fn(x)]=1nF(x)[1F(x)]. \mathbb{E}[F_n(x)] = F(x), \quad \text{Var}[F_n(x)] = \frac{1}{n} F(x)[1 - F(x)].
点击查看答案

证明:设x1,x2,,xnx_1, x_2, \cdots, x_n是取自总体分布函数为F(x)F(x)的样本,则经验分布函数为

Fn(x)={0,当 x<x(1),k/n,当 x(k)x<x(k+1),k=1,2,,n1,1,当 xx(n). F_n(x) = \begin{cases} 0, & \text{当 } x < x_{(1)}, \\ k/n, & \text{当 } x_{(k)} \leq x < x_{(k+1)}, \quad k = 1, 2, \cdots, n-1, \\ 1, & \text{当 } x \geq x_{(n)}. \end{cases}

若令yi=I{xix}, i=1,2,,ny_i = I_{\{x_i \leq x\}}, \ i = 1, 2, \cdots, n,则y1,y2,,yny_1, y_2, \cdots, y_n是独立同分布的随机变量,且

E(y1)=P(X1x)=F(x),E(y12)=P(X1x)=F(x), \mathbb{E}(y_1) = P(X_1 \leq x) = F(x), \quad \mathbb{E}(y_1^2) = P(X_1 \leq x) = F(x),

于是

Var(y1)=F(x)[F(x)]2=F(x)[1F(x)]. \text{Var}(y_1) = F(x) - [F(x)]^2 = F(x)[1 - F(x)].

Fn(x)F_n(x)可写为Fn(x)=1ni=1nyi\displaystyle F_n(x) = \frac{1}{n} \sum_{i=1}^n y_i,故有

E[Fn(x)]=E(y1)=F(x),Var[Fn(x)]=1nVar(y1)=1nF(x)[1F(x)]. \mathbb{E}[F_n(x)] = \mathbb{E}(y_1) = F(x), \quad \text{Var}[F_n(x)] = \frac{1}{n} \text{Var}(y_1) = \frac{1}{n} F(x)[1 - F(x)].

设总体的四阶中心矩ν4=E{XE(X)}4\nu_4 = \mathbb{E}\{X - \mathbb{E}(X)\}^4存在,总体方差记为σ2\sigma^2。求证:样本方差

s2=1n1i=1n(xix)2 s^2 = \frac{1}{n-1} \sum_{i=1}^n (x_i - \overline{x})^2

的方差是

Var(s2)=n(ν4σ4)(n1)22(ν42σ4)(n1)2+ν43σ4n(n1)2. \text{Var}(s^2) = \frac{n(\nu_4 - \sigma^4)}{(n-1)^2} - \frac{2(\nu_4 - 2\sigma^4)}{(n-1)^2} + \frac{\nu_4 - 3\sigma^4}{n(n-1)^2}.
点击查看答案

证明:设

Ak=1ni=1n{(xiμ)kE[(xiμ)k]} A_k=\frac{1}{n}\sum_{i=1}^n\left\{(x_i-\mu)^k-\mathbb{E}\left[(x_i-\mu)^k\right]\right\}

即样本kk阶中心矩和总体kk阶中心矩之差。那么

A1=1ni=1n(xiμ)=xμ,A2=1ni=1n(xiμ)2σ2,s2=1n1i=1n(xiμ+μx)2=1n1{i=1n(xiμ)2n(xμ)2}=nn1(σ2+A2A12), \begin{aligned} A_1&=\frac{1}{n}\sum_{i=1}^n(x_i-\mu)=\overline{x}-\mu,\\ A_2&=\frac{1}{n}\sum_{i=1}^n(x_i-\mu)^2-\sigma^2,\\ s^2 &=\frac{1}{n-1} \sum_{i=1}^n (x_i - \mu+\mu-\overline{x})^2\\ &= \frac{1}{n-1} \left\{ \sum_{i=1}^n (x_i - \mu)^2 - n(\overline{x} - \mu)^2 \right\}\\ &= \frac{n}{n-1} \left(\sigma^2 + A_2 - A_1^2\right), \end{aligned}

又因为σ2\sigma^2为定值,而

E(A2A12)=EA12=VarA1=Var(x)=σ2n \mathbb{E}\left(A_2 - A_1^2\right)=-\mathbb{E}A_1^2=-\text{Var}A_1=-\text{Var}(\overline{x})=-\frac{\sigma^2}{n}

所以

Var(s2)=n2(n1)2Var(A2A12)=n2(n1)2{E[(A2A12)2][E(A2A12)]2}=n2(n1)2{EA222EA2A12+EA14(σ2n)2} \begin{aligned} \text{Var}(s^2)&=\frac{n^2}{(n-1)^2}\text{Var}\left( A_2 - A_1^2\right)\\ &=\frac{n^2}{(n-1)^2}\left\{\mathbb{E}\left[(A_2 - A_1^2)^2\right]-\left[\mathbb{E}(A_2 - A_1^2)\right]^2\right\}\\ &=\frac{n^2}{(n-1)^2}\left\{\mathbb{E}A_2^2-2\mathbb{E}A_2A_1^2+\mathbb{E}A_1^4-\left(\frac{\sigma^2}{n}\right)^2\right\} \end{aligned}

又经过计算,

E(A22)=Var(A2)=Var[(x1μ)2]n=ν4σ4n,E(A2A12)=E{[(xiμ)2σ2](xiμ)2]}n2=ν4σ4n2,E(A14)=1n4{nE(x1μ)4+6(n2)E[(x1μ)2(x2μ)2]}=1n3E(xiμ)4+3(n1)n3E[(x1μ)2(x2μ)2]=ν4n3+3(n1)σ4n3=3σ4n2+ν43σ4n3. \begin{aligned} \mathbb{E}(A_2^2) &=\text{Var}(A_2)=\frac{\mathrm{Var}[(x_1 - \mu)^2]}{n} = \frac{\nu_4 - \sigma^4}{n},\\ \mathbb{E}(A_2 A_1^2) &= \frac{\mathbb{E}\left\{\left[(x_i - \mu)^2 - \sigma^2\right](x_i - \mu)^2]\right\}}{n^2} = \frac{\nu_4 - \sigma^4}{n^2},\\ \mathbb{E}(A_1^4) &=\frac{1}{n^4}\left\{n\mathbb{E}(x_1-\mu)^4+6\binom{n}{2}\mathbb{E}\left[(x_1-\mu)^2(x_2-\mu)^2\right]\right\}\\ &=\frac{1}{n^3} \mathbb{E}(x_i - \mu)^4+\frac{3(n-1)}{n^3} \mathbb{E}[(x_1 - \mu)^2 (x_2 - \mu)^2]\\ &=\frac{\nu_4}{n^3}+\frac{3(n-1)\sigma^4}{n^3}=\frac{3\sigma_4}{n^2}+\frac{\nu_4-3\sigma^4}{n^3}. \end{aligned}

因此

Var(s2)=n(ν4σ4)(n1)22(ν42σ4)(n1)2+ν43σ4n(n1)2. \text{Var}(s^2) = \frac{n(\nu_4 - \sigma^4)}{(n-1)^2} - \frac{2(\nu_4 - 2\sigma^4)}{(n-1)^2} + \frac{\nu_4 - 3\sigma^4}{n(n-1)^2}.

这个式子的含义:方差的方差 = 二阶波动 - 均值修正 + 二者耦合;由此可得渐近正态分布:n(s2σ2)dN(0,ν4σ4)\sqrt n(s^2-\sigma^2)\xrightarrow{d}N\left(0,\nu_4-\sigma^4\right)

设总体XX33阶中心矩ν3=E{XE(X)}3\nu_3=\mathbb{E}\{X-\mathbb{E}(X)\}^3存在。若x1,,xnx_1,\ldots,x_n是来自该总体的样本,样本均值和样本方差分别记作x\overline{x}s2s^2,求证:

Cov(x,s2)=ν3n. \text{Cov}(\overline{x},s^2)=\frac{\nu_3}n.
点击查看答案

沿用上一题对AkA_k的定义,则x=A1+μ,s2=nn1(σ2+A2A12)\overline{x}=A_1+\mu,s^2=\dfrac{n}{n-1}\left(\sigma^2 + A_2 - A_1^2\right),所以

Cov(x,s2)=Cov(A1+μ,nn1(σ2+A2A12))=nn1Cov(A1,A2A12)=nn1E(A1A2A13) \begin{aligned} \text{Cov}(\overline{x},s^2)&=\text{Cov}\left(A_1+\mu,\frac{n}{n-1}\left(\sigma^2 + A_2 - A_1^2\right)\right)\\ &=\frac{n}{n-1}\text{Cov}(A_1,A_2 - A_1^2)\\ &=\frac{n}{n-1}\mathbb{E}(A_1A_2-A_1^3) \end{aligned}

又因为E(A1A2)=ν3n,E(A13)=ν3n2\mathbb{E}(A_1A_2)=\dfrac{\nu_3}{n},\mathbb{E}(A_1^3)=\dfrac{\nu_3}{n^2},故

Cov(x,s2)=nn1E(A1A2A13)=nn1(ν3nν3n2)=ν3n. \begin{aligned} \text{Cov}(\overline{x},s^2)&=\frac{n}{n-1}\mathbb{E}(A_1A_2-A_1^3)\\ &=\frac{n}{n-1}\left(\frac{\nu_3}{n}-\frac{\nu_3}{n^2}\right)\\ &=\frac{\nu_3}{n}. \end{aligned}

补充:关于AkA_k的相关数字特征:E(Ak)=0,Var(Ak)=1n(ν2k(νk)2),Cov(AkAl)=1n(νk+lνkνl)(kl)\mathbb{E}(A_k)=0,\quad\text{Var}(A_k)=\dfrac{1}{n}{\left(\nu_{2k}-(\nu_k)^2\right)},\quad\text{Cov}(A_kA_l)=\dfrac{1}{n}(\nu_{k+l}-\nu_k\nu_l)\quad (k\neq l)

设总体XX服从双参数指数分布,其分布函数为

F(x)={1exp{xμσ},x>μ,0,xμ, F(x) = \begin{cases} 1 - \exp\left\{-\dfrac{x - \mu}{\sigma}\right\}, & x > \mu, \\ 0, & x \leq \mu, \end{cases}

其中<μ<,σ>0-\infty < \mu < \infty, \sigma > 0x(1)x(2)x(n)x_{(1)} \leq x_{(2)} \leq \cdots \leq x_{(n)}为样本的次序统计量。试证明,

(ni+1)2σ(x(i)x(i1)) (n-i+1)\frac{2}{\sigma}(x_{(i)} - x_{(i-1)})

服从自由度为22χ2\chi^2分布(i=2,3,,n)(i = 2, 3, \cdots, n).

点击查看答案

证明: 令 yi=xiμσExp(1)y_i = \dfrac{x_i - \mu}{\sigma} \sim \text{Exp}(1),则 y(1),y(2),,y(n)y_{(1)}, y_{(2)}, \cdots, y_{(n)}的联合密度为

p(y1,y2,,yn)=n!exp{i=1nyi} p(y_1, y_2, \cdots, y_n) = n! \exp\left\{-\sum_{i=1}^n y_i\right\}

作变换

{t1=ny(1),t2=(n1)(y(2)y(1)),ti=(ni+1)(y(i)y(i1)),tn=y(n)y(n1),{y(1)=t1ny(2)=t1n+t2n1y(i)=j=1itjnj+1 \begin{cases} t_1 = n y_{(1)}, \\ t_2 = (n-1)(y_{(2)} - y_{(1)}), \\ \vdots \\ t_i = (n-i+1)(y_{(i)} - y_{(i-1)}), \\ \vdots \\ t_n = y_{(n)} - y_{(n-1)}, \end{cases}\Longrightarrow \begin{cases} y_{(1)} = \dfrac{t_1}{n} \\[10pt] y_{(2)} = \dfrac{t_1}{n} + \dfrac{t_2}{n-1} \\[10pt] \vdots \\ y_{(i)} = \displaystyle\sum_{j=1}^{i} \frac{t_j}{n-j+1} \end{cases}

其雅可比行列式为 J=1n!|J| = \dfrac{1}{n!}。又因为

i=1ny(i)=i=1nj=1itjnj+1=j=1n(nj+1)tjnj+1=j=1ntj \begin{aligned} \sum_{i=1}^n y_{(i)} &= \sum_{i=1}^n \sum_{j=1}^i \frac{t_j}{n - j + 1} \\ &= \sum_{j=1}^n(n - j + 1)\cdot\frac{t_j}{n - j + 1} = \sum_{j=1}^n t_j \end{aligned}

所以t1,t2,,tnt_1, t_2, \cdots, t_n的联合密度为

f(t1,t2,,tn)=exp{i=1nti}. f(t_1, t_2, \cdots, t_n) = \exp\left\{-\sum_{i=1}^n t_i\right\}.

由此可得 T1,T2,,Tni.i.dExp(1)T_1, T_2, \cdots, T_n\stackrel{i.i.d}{\sim}\text{Exp}(1),从而

P((ni+1)2σ(x(i)x(i1))x)=P(2(ni+1)(y(i)y(i1))x)=P(2Tix)=P(Tix2)=1ex2. \begin{aligned} P\left((n-i+1)\frac{2}{\sigma}(x_{(i)} - x_{(i-1)}) \leq x\right) &= P\left(2(n-i+1)(y_{(i)} - y_{(i-1)}) \leq x\right) \\ &= P(2T_i \leq x) = P\left(T_i \leq\frac{x}{2}\right) = 1 - e^{-\frac{x}{2}}. \end{aligned}

这正是指数分布Exp(12)\text{Exp}\left(\frac{1}{2}\right),即χ2(2)\chi^2(2)的分布函数,故命题得证。

x(1)x_{(1)}x(n)x_{(n)}分别为容量nn的样本的最小和最大次序统计量,
(1)证明极差Rn=x(n)x(1)R_n = x_{(n)} - x_{(1)}的分布函数

FRn(x)=nx[F(y+x)F(y)]n1p(y)dy, F_{R_n}(x) = n \int_{-\infty}^x [F(y + x) - F(y)]^{n-1} p(y) \, dy,

其中F(y)F(y)p(y)p(y)分别为总体的分布函数与密度函数;
(2) 利用(1)的结论,求总体为指数分布Exp(λ)\text{Exp}(\lambda)时,样本极差RnR_n的分布。

点击查看答案

证明:
(1)根据次序统计量的密度函数的表达式,x(1)x_{(1)}x(n)x_{(n)}的联合密度是

n!(n2)!p(x){F(y)F(x)}n2p(y),x<y \frac{n!}{(n-2)!} p(x) \{ F(y) - F(x) \}^{n-2} p(y), \quad x < y

那么,极差Rn=x(n)x(1)R_n = x_{(n)} - x_{(1)}的分布是

FRn(t)=P(x(n)x(1)<t)=n(n1)0<yx<tp(x){F(y)F(x)}n2p(y)dxdy=n(n1){xx+t{F(y)F(x)}n2dF(y)}p(x)dx=n{F(x+t)F(x)}n1p(x)dx \begin{aligned} F_{R_n}(t) &= P(x_{(n)} - x_{(1)} < t)\\ &= n(n-1) \iint_{0 < y-x < t} p(x) \{ F(y) - F(x) \}^{n-2} p(y) dx dy\\ &= n(n-1) \int_{-\infty}^{\infty} \left\{ \int_{x}^{x+t} \{ F(y) - F(x) \}^{n-2} dF(y) \right\} p(x) dx\\ &= n \int_{-\infty}^{\infty} \{ F(x+t) - F(x) \}^{n-1} p(x) dx \end{aligned}

命题得证。
(2)当总体是指数分布Exp(λ)\text{Exp}(\lambda)时,p(x)=λeλxp(x) = \lambda e^{-\lambda x}F(x)=1eλxF(x) = 1 - e^{-\lambda x},所以样本极差RnR_n的分布是

FRn(t)=n0(eλxeλ(x+t))1λeλxdx=(1eλt)n1. \begin{aligned} F_{R_n}(t) &= n \int_{0}^{\infty} (e^{-\lambda x} - e^{-\lambda(x+t)})^{-1} \lambda e^{-\lambda x} dx\\ &= (1 - e^{-\lambda t})^{n-1}. \end{aligned}

这说明指数分布下RnR_nn1n-1个样本的最大次序统计量同分布。
另外,均匀分布U(a,b)U(a,b)Rnba\dfrac{R_n}{b-a}的分布为Be(n1,2)\mathrm{Be}(n-1,2).

x1,x2,,xnx_1, x_2, \cdots, x_n是来自分布函数为F(x)F(x),密度函数为p(x)p(x)的一个样本。x(1)x_{(1)}x(2),,x(n)x_{(2)}, \cdots, x_{(n)}是其次序统计量,试求在x(r+1),,x(n)x_{(r+1)}, \cdots, x_{(n)}给定时,x(1),,x(r)x_{(1)}, \cdots, x_{(r)}的联合条件密度函数。

点击查看答案

次序统计量x(1),x(2),,x(n)x_{(1)}, x_{(2)}, \cdots, x_{(n)}联合密度函数为

p(x(1),x(2),,x(n))=n!i=1np(x(i)) p(x_{(1)}, x_{(2)}, \cdots, x_{(n)}) = n! \prod_{i=1}^n p(x_{(i)})

而后nrn-r个次序统计量x(r+1),,x(n)x_{(r+1)}, \cdots, x_{(n)}的联合密度函数为

p(x(r+1),,x(n))=n!r![F(x(r+1))]ri=r+1np(x(i)), p(x_{(r+1)}, \cdots, x_{(n)}) = \frac{n!}{r!} [F(x_{(r+1)})]^r \prod_{i=r+1}^n p(x_{(i)}),

故所求的联合条件密度函数为

p(x(1),,x(r)x(r+1),,x(n))=p(x(1),x(2),,x(n))p(x(r+1),,x(n))=r!i=1rp(x(i))[F(x(r+1))]r. \begin{aligned} p(x_{(1)}, \cdots, x_{(r)} \mid x_{(r+1)}, \cdots, x_{(n)}) &= \frac{p(x_{(1)}, x_{(2)}, \cdots, x_{(n)})}{p(x_{(r+1)}, \cdots, x_{(n)})} \\ &= r! \prod_{i=1}^r \frac{p(x_{(i)})}{[F(x_{(r+1)})]^r}. \end{aligned}

最后结果表明:所求条件密度函数只与x(1),,x(r),x(r+1)x_{(1)}, \cdots, x_{(r)}, x_{(r+1)}有关,而与x(r+2),,x(n)x_{(r+2)}, \cdots, x_{(n)}的取值无关。从而,其分布也仅依赖于X(r+1)X_{(r+1)}的给定值x(r+1)x_{(r+1)}
这样一来,条件密度函数p(x(1),,x(r)x(r+1),,x(n))p(x_{(1)}, \cdots, x_{(r)} \mid x_{(r+1)}, \cdots, x_{(n)})完全可以写成p(x(1),,x(r)x(r+1))p(x_{(1)}, \cdots, x_{(r)} \mid x_{(r+1)})。【类似“马尔可夫性”】
实际上,如果总体分布为Exp(λ)\mathrm{Exp}(\lambda),将x(1),,x(r)x_{(1)},\cdots,x_{(r)}看作到达时间的话,那么其在x(r+1)=tx_{(r+1)}=t的条件下就是均匀分布的次序统计量。【可结合泊松过程理解】

证明:若Uχ2(n)U \sim \chi^2(n),Vχ2(m)V \sim \chi^2(m),且UUVV相互独立,则

UU+VBe(n2,m2). \frac{U}{U+V} \sim \text{Be}\left(\frac{n}{2}, \frac{m}{2}\right).
点击查看答案

证明:由题得UGa(n2,12),VGa(m2,12)U\sim \mathrm{Ga}\left(\frac{n}{2}, \frac{1}{2}\right),V \sim \mathrm{Ga}\left(\frac{m}{2}, \frac{1}{2}\right),其密度函数分别为:

pU(u)=1Γ(n2)2n2un21eu2,u>0,pV(v)=1Γ(m2)2m2vm21ev2,v>0. \begin{aligned} p_U(u) &= \frac{1}{\Gamma\left(\frac{n}{2}\right) 2^{\frac{n}{2}}} u^{\frac{n}{2}-1} e^{-\frac{u}{2}}, \quad u > 0,\\ p_V(v) &= \frac{1}{\Gamma\left(\frac{m}{2}\right) 2^{\frac{m}{2}}} v^{\frac{m}{2}-1} e^{-\frac{v}{2}}, \quad v > 0. \end{aligned}

考虑变换:

{Z=UU+VW=U+V{U=ZWV=(1Z)W \begin{cases} Z = \dfrac{U}{U+V} \\[10pt] W = U+V \end{cases}\Longrightarrow \begin{cases} U = ZW \\ V = (1-Z)W \end{cases}

则其雅可比行列式为:

J=(U,V)(Z,W)=WZW1Z=W. |J| = \left| \frac{\partial(U,V)}{\partial(Z,W)} \right| = \left|\begin{array}{cc} W & Z \\ -W & 1-Z \end{array} \right| = W.

于是联合密度函数为:

pZ,W(z,w)=1Γ(n2)2n2(zw)n21ezw21Γ(m2)2m2[(1z)w]m21e(1z)w2w=1Γ(n2)Γ(m2)2n+m2zn21(1z)m21wn+m21ew2. \begin{aligned} p_{Z,W}(z,w) &= \frac{1}{\Gamma\left(\frac{n}{2}\right) 2^{\frac{n}{2}}} (zw)^{\frac{n}{2}-1} e^{-\frac{zw}{2}} \cdot \frac{1}{\Gamma\left(\frac{m}{2}\right) 2^{\frac{m}{2}}} [(1-z)w]^{\frac{m}{2}-1} e^{-\frac{(1-z)w}{2}} \cdot w\\ &=\frac{1}{\Gamma\left(\frac{n}{2}\right) \Gamma\left(\frac{m}{2}\right) 2^{\frac{n+m}{2}}} z^{\frac{n}{2}-1} (1-z)^{\frac{m}{2}-1} w^{\frac{n+m}{2}-1} e^{-\frac{w}{2}}. \end{aligned}

ww积分得ZZ的边际密度:

pZ(z)=0pZ,W(z,w)dw=zn21(1z)m21Γ(n2)Γ(m2)2n+m20wn+m21ew2dw=zn21(1z)m21Γ(n2)Γ(m2)2n+m2Γ(n+m2)2n+m2=Γ(n+m2)Γ(n2)Γ(m2)zn21(1z)m21(0<z<1). \begin{aligned} p_Z(z) &= \int_0^\infty p_{Z,W}(z,w) \, dw \\ &= \frac{z^{\frac{n}{2}-1} (1-z)^{\frac{m}{2}-1}}{\Gamma\left(\frac{n}{2}\right) \Gamma\left(\frac{m}{2}\right) 2^{\frac{n+m}{2}}} \int_0^\infty w^{\frac{n+m}{2}-1} e^{-\frac{w}{2}} \, dw\\ &=\frac{z^{\frac{n}{2}-1} (1-z)^{\frac{m}{2}-1}}{\Gamma\left(\frac{n}{2}\right) \Gamma\left(\frac{m}{2}\right) 2^{\frac{n+m}{2}}}\Gamma\left(\frac{n+m}{2}\right) 2^{\frac{n+m}{2}}\\ &=\frac{\Gamma\left(\frac{n+m}{2}\right)}{\Gamma\left(\frac{n}{2}\right) \Gamma\left(\frac{m}{2}\right)} z^{\frac{n}{2}-1} (1-z)^{\frac{m}{2}-1} \quad (0 < z < 1). \end{aligned}

这正是Beta分布Be(n2,m2)\mathrm{Be}\left(\frac{n}{2}, \frac{m}{2}\right)的密度函数,故

UU+VBe(n2,m2). \frac{U}{U+V} \sim \text{Be}\left(\frac{n}{2}, \frac{m}{2}\right).

推论:设X=UnVmF(n,m)X=\dfrac{\frac{U}{n}}{\frac{V}{m}}\sim F(n,m),则Z=nmX1+nmXBe(n2,m2)Z=\dfrac{\frac{n}{m}X}{1+\frac{n}{m}X}\sim\text{Be}\left(\dfrac{n}{2}, \dfrac{m}{2}\right).

X1,,Xn,Xn+1X_1, \ldots, X_n, X_{n+1}是来自N(μ,σ2)N(\mu, \sigma^2)的样本,记

Xn=1ni=1nXi,Sn2=1n1i=1n(XiXn)2 \overline{X}_n = \frac{1}{n} \sum_{i=1}^n X_i,\quad S_n^2 = \frac{1}{n-1} \sum_{i=1}^n (X_i - \overline{X}_n)^2

计算E(Sn3)\mathbb{E}(S_n^3)

点击查看答案

Y=(n1)Sn2σ2Y=\dfrac{(n-1)S_n^2}{\sigma^2},则Yχ2(n1)Y\sim\chi^2(n-1),那么

E(Sn3)=E[(σ2Yn1)32]=σ3(n1)32E[Y32] \mathbb{E}(S_n^3)=\mathbb{E}\left[\left(\frac{\sigma^2 Y}{n-1}\right)^\frac{3}{2}\right]=\frac{\sigma^3}{(n-1)^{\frac{3}{2}}}\mathbb{E}[Y^{\frac{3}{2}}]

又因为YGa(n12,12)\displaystyle Y\sim\mathrm{Ga}\left(\dfrac{n-1}{2},\dfrac{1}{2}\right),所以

E[Y32]=012n12Γ(n12)yn2ey2dy=232Γ(n+22)Γ(n12). \begin{aligned} \mathbb{E}[Y^{\frac{3}{2}}]&=\int_{0}^\infty\frac{1}{2^{\frac{n-1}{2}}\Gamma\left(\dfrac{n-1}{2}\right)}y^{\frac{n}{2}}e^{-\frac{y}{2}}dy\\ &=\frac{2^{\frac{3}{2}}\Gamma\left(\dfrac{n+2}{2}\right)}{\Gamma\left(\dfrac{n-1}{2}\right)}. \end{aligned}

E(Sn3)=σ3(n1)32232Γ(n+22)Γ(n12).\displaystyle \mathbb{E}(S_n^3)=\frac{\sigma^3}{(n-1)^{\frac{3}{2}}}\cdot\frac{2^{\frac{3}{2}}\Gamma\left(\frac{n+2}{2}\right)}{\Gamma\left(\frac{n-1}{2}\right)}.

x1,x2,,xni.i.dN(μ,σ2),x=1ni=1nxi,s2=1n1i=1n(xix)2\displaystyle x_1, x_2, \cdots, x_n\stackrel{i.i.d}{\sim}N(\mu, \sigma^2),\overline{x} = \frac{1}{n} \sum_{i=1}^n x_i,s^2 = \frac{1}{n-1} \sum_{i=1}^n (x_i - \overline{x})^2
ξ=x1xs\xi = \dfrac{x_1 - \overline{x}}{s},试找出ξ\xitt分布的联系(提示:作正交变换y1=nx,y2=nn1(x1x),yi=j=1ncijxj,i=3,4,,n\displaystyle y_1 = \sqrt{n} \overline{x},y_2 = \sqrt{\frac{n}{n-1}} (x_1 - \overline{x}),y_i = \sum_{j=1}^n c_{ij}x_j, i = 3, 4, \cdots, n)。

点击查看答案

基于上述正交变换可知,y1,,yny_1,\cdots,y_n相互独立且

y1N(nμ,σ2),yiN(0,σ2)(i2) y_1\sim N(\sqrt{n}\mu,\sigma^2),\quad y_i\sim N(0,\sigma^2)\quad (i\geq 2)

又有i=1nxi2=i=1nyi2\displaystyle\sum_{i=1}^nx_i^2=\sum_{i=1}^ny_i^2,所以

ξ=x1xs=nn1(x1x)nn11n1[i=1nxi2n(x)2]=(n1)y2n(i=1nyi2y12)=n1ny2y22+(n2)i=3nyi2n2 \begin{aligned} \xi &= \frac{x_1 - \overline{x}}{s}\\ &= \frac{\sqrt{\dfrac{n}{n-1}}(x_1 - \overline{x})}{\displaystyle \sqrt{\frac{n}{n-1}\cdot \frac{1}{n-1} \left[ \sum_{i=1}^n x_i^2 - n(\overline{x})^2 \right]} }\\ &= \frac{(n-1)y_2}{\displaystyle\sqrt{n\left(\sum_{i=1}^n y_i^2 - y_1^2\right)}} \\ &= \frac{n-1}{\sqrt{n}} \cdot \frac{y_2}{\displaystyle\sqrt{y_2^2 + (n-2) \cdot \sum_{i=3}^n\frac{y_i^2}{n-2}}} \end{aligned}

T=y2i=3nyi2n2t(n2)T =\dfrac{y_2}{\displaystyle\sqrt{\sum_{i=3}^n\frac{y_i^2}{n-2}}} \sim t(n-2),那么

ξ=n1ny2i=3nyi2n2y22i=3nyi2n2+(n2)=n1nTT2+(n2) \begin{aligned} \xi &= \frac{n-1}{\sqrt{n}} \cdot \frac{\displaystyle\frac{y_2}{\sqrt{\sum_{i=3}^n\frac{y_i^2}{n-2}}}}{\displaystyle\sqrt{\frac{y_2^2}{\sum_{i=3}^n\frac{y_i^2}{n-2}}+ (n-2)}} \\ &= \frac{n-1}{\sqrt{n}} \cdot \frac{T}{\sqrt{T^2 + (n-2)}} \end{aligned}统计量和三大分布这一块似乎有不少这样的大开大合计算题,吓哭了……

参数估计

设简单样本X1,,XnFX_1, \ldots, X_n \sim F。对给定常数x0x_0,令

Fn(x0)=1ni=1nI(Xix0) F_n(x_0) = \frac{1}{n} \sum_{i=1}^n I(X_i \leq x_0)

回答以下问题:
(1)证明Fn(x0)F_n(x_0)F(x0)F(x_0)的无偏估计;
(2)证明Fn(x0)F_n(x_0)F(x0)F(x_0)的相合估计;
(3)证明Fn(x0)F_n(x_0)的渐近正态性。

点击查看答案

(1)证明:

E(Fn(x0))=1nE[i=1nI(Xix0)]=1ni=1nP(Xix0)=1ni=1nF(x0)=F(x0) \begin{aligned} \mathbb{E}(F_n(x_0))&=\frac{1}{n}\mathbb{E}\left[\sum_{i=1}^nI(X_i\leq x_0)\right]\\ &=\frac{1}{n}\sum_{i=1}^nP(X_i\leq x_0)\\ &=\frac{1}{n}\sum_{i=1}^nF(x_0)\\ &=F(x_0) \end{aligned}

所以Fn(x0)F_n(x_0)F(x0)F(x_0)的无偏估计。
(2)设随机变量Ii=I(Xix0)I_i=I(X_i \leq x_0),则I1,,InI_1,\cdots,I_n独立同分布且E(Ij)=F(x0)(1jn)\mathbb{E}(I_j)=F(x_0)(1\leq j\leq n),所以由辛钦大数定律,

Fn(x0)=1nj=1nIipF(x0) F_n(x_0)=\frac{1}{n}\sum_{j=1}^nI_i\stackrel{p}{\longrightarrow}F(x_0)

Fn(x0)F_n(x_0)F(x0)F(x_0)的相合估计。
(3)因为{Ij}\{I_j\}独立同分布且Var(Ij)=F(x0)(1F(x0))\mathrm{Var}(I_j)=F(x_0)(1-F(x_0))有限,所以由Lindeberg-Lévy中心极限定理,

i=1nIinE[I1]nVar(I1)dN(0,1) \frac{\sum_{i=1}^n I_i - n\mathbb{E}[I_1]}{\sqrt{n\mathrm{Var}(I_1)}} \stackrel{d}{\longrightarrow} N(0, 1)

1nj=1nIjE[I1]Var(I1)n=Fn(x0)F(x0)F(x0)(1F(x0))ndN(0,1) \frac{\frac{1}{n} \sum_{j=1}^n I_j - \mathbb{E}[I_1]}{\sqrt{\frac{Var(I_1)}{n}}} = \frac{F_n(x_0) - F(x_0)}{\sqrt{\frac{F(x_0)(1-F(x_0))}{n}}} \xrightarrow{d} N(0, 1)

Fn(x0)F_n(x_0)具有渐近正态性,n(Fn(x0)F(x0))dN(0,F(x0)(1F(x0)))\sqrt{n}(F_n(x_0) - F(x_0)) \xrightarrow{d} N(0, F(x_0)(1 - F(x_0)))

设随机变量Y1,,YnY_1, \ldots, Y_n满足

Yi=xiβ+εi,i=1,,n Y_i = x_i \beta + \varepsilon_i, \, i = 1, \ldots, n

其中x1,,xnx_1, \ldots, x_n是固定常数,ε1,,εn\varepsilon_1, \ldots, \varepsilon_n独立同分布于N(0,σ2)N(0, \sigma^2),其中σ2\sigma^2未知。回答以下问题:
(1)求关于(β,σ2)(\beta, \sigma^2)的一个二维充分统计量;
(2)求β\beta的 MLE 并证明它是β\beta的一个无偏估计;
(3)求β\beta的 MLE 的分布。

点击查看答案

(1)因为ε1,,εni.i.dN(0,σ2)\varepsilon_1, \ldots, \varepsilon_n\stackrel{i.i.d}{\sim}N(0,\sigma^2),所以YiN(xiβ,σ2)Y_i\sim N(x_i\beta,\sigma^2),那么(Y1,,Yn)(Y_1,\cdots,Y_n)的联合概率密度函数为

p(y1,,yn;β,σ2)=i=1n12πσ2exp((yixiβ)22σ2)=(2πσ2)n/2exp(12σ2i=1n(yi22βxiyi+β2xi2))=(2πσ2)n/2exp(12σ2[i=1nyi22βi=1nxiyi+β2i=1nxi2]) \begin{aligned} p(y_1,\cdots,y_n;\beta,\sigma^2) &= \prod_{i=1}^n \frac{1}{\sqrt{2\pi\sigma^2}} \exp\left(-\frac{(y_i - x_i\beta)^2}{2\sigma^2}\right)\\ &=(2\pi\sigma^2)^{-n/2} \exp\left(-\frac{1}{2\sigma^2} \sum_{i=1}^n (y_i^2 - 2\beta x_i y_i + \beta^2 x_i^2)\right)\\ &=(2\pi\sigma^2)^{-n/2} \exp\left(-\frac{1}{2\sigma^2} \left[\sum_{i=1}^n y_i^2 - 2\beta \sum_{i=1}^n x_i y_i + \beta^2 \sum_{i=1}^n x_i^2\right]\right) \end{aligned}

由因子分解定理,可取T(y)=(i=1nyi2,  i=1nxiyi)\displaystyle T(\mathbf{y})=\left( \sum_{i=1}^n y_i^2,\; \sum_{i=1}^n x_i y_i \right),则

p(y1,,yn;β,σ2)=g(T(y),β,σ2)h(y)=1 p(y_1,\cdots,y_n;\beta,\sigma^2)=g(T(\mathbf{y}),\beta,\sigma^2)\cdot\underbrace{h(\mathbf{y})}_{=1}

所以T(y)T(\mathbf{y})(β,σ2)(\beta, \sigma^2)的一个二维充分统计量。
(2)取对数似然函数

(β,σ2)=lnp(y1,,yn;β,σ2)=n2ln(2π)n2ln(σ2)12σ2i=1n(yixiβ)2 \begin{aligned} \ell(\beta,\sigma^2)&=\ln p(y_1,\cdots,y_n;\beta,\sigma^2)\\ &=-\frac{n}{2} \ln(2\pi) - \frac{n}{2} \ln(\sigma^2) - \frac{1}{2\sigma^2} \sum_{i=1}^n (y_i - x_i\beta)^2 \end{aligned}

β\beta求偏导,使其为00

lβ=12σ2i=1n2(yixiβ)(xi)=1σ2i=1n(xiyixi2β)=0 \begin{aligned} \frac{\partial l}{\partial \beta} &= -\frac{1}{2\sigma^2} \sum_{i=1}^n 2(y_i - x_i\beta)(-x_i) \\ &= \frac{1}{\sigma^2} \sum_{i=1}^n (x_iy_i - x_i^2\beta) = 0 \end{aligned}

解得

β^=i=1nxiYii=1nxi2. \hat{\beta}=\frac{\sum_{i=1}^nx_iY_i}{\sum_{i=1}^nx_i^2}.

下证其无偏性:

E[β^]=E[i=1nxiYii=1nxi2]=1i=1nxi2i=1nxiE[Yi]=1i=1nxi2i=1nxi(xiβ)=βi=1nxi2i=1nxi2=β. \begin{aligned} \mathbb{E}[\hat{\beta}] &= \mathbb{E}\left[ \frac{\sum_{i=1}^n x_i Y_i}{\sum_{i=1}^n x_i^2} \right]\\ &= \frac{1}{\sum_{i=1}^n x_i^2} \sum_{i=1}^n x_i \mathbb{E}[Y_i]\\ &=\frac{1}{\sum_{i=1}^n x_i^2} \sum_{i=1}^n x_i (x_i \beta) \\ &= \frac{\beta\sum_{i=1}^n x_i^2}{\sum_{i=1}^n x_i^2}= \beta. \end{aligned}

所以β^\hat{\beta}β\beta的一个无偏估计。
(3)因为β^\hat{\beta}YiY_i的线性组合,所以β^\hat{\beta}也服从正态分布。
又因为

E[β^]=β,Var(β^)=Var(i=1nxiYii=1nxi2)=1(i=1nxi2)2i=1nVar(xiYi)=1(i=1nxi2)2i=1nxi2σ2=σ2i=1nxi2(i=1nxi2)2=σ2i=1nxi2. \begin{aligned} \mathbb{E}[\hat{\beta}]&=\beta,\\ \mathrm{Var}(\hat{\beta})&=\mathrm{Var}\left(\frac{\sum_{i=1}^n x_i Y_i}{\sum_{i=1}^n x_i^2}\right)\\ &= \frac{1}{(\sum_{i=1}^n x_i^2)^2} \sum_{i=1}^n \mathrm{Var}(x_i Y_i)\\ &=\frac{1}{(\sum_{i=1}^n x_i^2)^2} \sum_{i=1}^n x_i^2 \sigma^2 \\ &= \frac{\sigma^2\sum_{i=1}^n x_i^2}{(\sum_{i=1}^n x_i^2)^2} = \frac{\sigma^2}{\sum_{i=1}^n x_i^2}. \end{aligned}

所以β^N(β,σ2i=1nxi2)\hat{\beta}\sim N\left(\beta,\dfrac{\sigma^2}{\sum_{i=1}^n x_i^2}\right)

一个零膨胀泊松分布的概率函数是

f(x;λ,π)={(1π)+πeλx=0πeλλxx!x=1,2, f(x; \lambda, \pi) = \begin{cases} (1 - \pi) + \pi e^{-\lambda} & x = 0 \\ \pi \dfrac{e^{-\lambda} \lambda^x}{x!} & x = 1, 2, \dots \end{cases}

其中π[0,1],λ>0\pi \in [0, 1],\lambda > 0都是未知参数。设X1,,XnX_1, \cdots, X_n是来自f(x;λ,π)f(x; \lambda, \pi)的一组简单随机样本,其中θ(0,1)\theta \in (0, 1)
(1)求参数(λ,π)(\lambda, \pi)的矩估计;
(2)请写出参数(λ,π)(\lambda, \pi)的对数似然函数;
(3)请写出计算参数(λ,π)(\lambda, \pi)的最大似然估计的EM算法。

点击查看答案

(1)因为

EX=i=1πieλλii!=πeλi=1λi(i1)!=πλeλeλ=πλ,EX2=i=1πi2eλλii!=πeλi=1(i1+1)λi(i1)!=πeλ(i=2λi(i2)!+i=1λi(i1)!)=πeλ(λ2j=0λjj!+λk=0λkk!)=π(λ2+λ). \begin{aligned} \mathbb{E}X&=\sum_{i=1}^\infty\pi\frac{ie^{-\lambda}\lambda^{i}}{i!}=\pi e^{-\lambda}\sum_{i=1}^\infty\frac{\lambda^{i}}{(i-1)!}\\ &=\pi\lambda e^{-\lambda}e^{\lambda}\\ &=\pi\lambda,\\[10pt] \mathbb{E}X^2&=\sum_{i=1}^\infty\pi\frac{i^2e^{-\lambda}\lambda^{i}}{i!}\\ &=\pi e^{-\lambda}\sum_{i=1}^\infty\frac{(i-1+1)\lambda^{i}}{(i-1)!}\\ &=\pi e^{-\lambda}\left(\sum_{i=2}^\infty\frac{\lambda^{i}}{(i-2)!}+\sum_{i=1}^\infty\frac{\lambda^{i}}{(i-1)!}\right)\\ &=\pi e^{-\lambda}\left(\lambda^2\sum_{j=0}^\infty\frac{\lambda^{j}}{j!}+\lambda\sum_{k=0}^\infty\frac{\lambda^{k}}{k!}\right)\\ &=\pi (\lambda^2+\lambda). \end{aligned}

所以λ^=x+sn2x1=sn2x\hat{\lambda}=\dfrac{\overline{x}+s_n^2}{\overline{x}}-1=\dfrac{s_n^2}{\overline{x}}π^=xλ^=x2sn2\hat{\pi}=\dfrac{\overline{x}}{\hat{\lambda}}=\dfrac{\overline{x}^2}{s_n^2}.
(2)因为

L(λ,π)=i=1nf(xi;λ,π)=i=1n{[(1π)+πeλ]1{xi=0}+[πeλλxixi!]1{xi>0}} \begin{aligned} \mathcal{L}(\lambda,\pi)&=\prod_{i=1}^nf(x_i;\lambda,\pi)\\ &=\prod_{i=1}^n\left\{[(1 - \pi) + \pi e^{-\lambda}]\cdot\mathbf{1}_{\{x_i=0\}}+\left[\pi \dfrac{e^{-\lambda} \lambda^{x_i}}{x_i!}\right]\cdot\mathbf{1}_{\{x_i> 0\}}\right\} \end{aligned}

所以

(λ,π)=i=1n{ln(1π+πeλ)1{xi=0}+[lnπλ+xilnλln(xi!)]1{xi>0}} \ell(\lambda,\pi)=\sum_{i=1}^n\left\{\ln(1 - \pi+\pi e^{-\lambda})\cdot\mathbf{1}_{\{x_i=0\}}+\left[\ln\pi-\lambda+x_i\ln\lambda-\ln(x_i!)\right]\cdot\mathbf{1}_{\{x_i> 0\}}\right\}

若设n0=i=11{xi=0},n1=nn0\displaystyle n_0=\sum_{i=1}^\infty\mathbf{1}_{\{x_i=0\}},n_1=n-n_0,则

(λ,π)=n0(ln(1π+πeλ))+n1(lnπλ+xilnλln(xi!)). \ell(\lambda,\pi)=n_0(\ln(1 - \pi+\pi e^{-\lambda}))+n_1(\ln\pi-\lambda+x_i\ln\lambda-\ln(x_i!)).

(3)算法步骤如下:

  1. 引入潜变量ZiZ_i,定义
XiZi=1P(λ),XiZi=00 X_i\mid Z_i=1\sim P(\lambda),\quad X_i\mid Z_i=0\equiv 0

Zib(1,π)Z_i\sim b(1,\pi)
2. 构造完全数据分布:因为

P(Xi=xi,Zi=zi)={1π,zi=xi=0πeλλxixi!,zi=1 P(X_i=x_i,Z_i=z_i)=\begin{cases} 1-\pi,&z_i=x_i=0\\ \pi \dfrac{e^{-\lambda} \lambda^{x_i}}{x_i!},&z_i=1 \end{cases}

所以

P(xi,zi)=[(1π)]1zi+[πeλλxixi!]zi. P(x_i,z_i)=[(1-\pi)]^{1-z_i}+\left[\pi \dfrac{e^{-\lambda} \lambda^{x_i}}{x_i!}\right]^{z_i}.
  1. 取完全数据对数似然
(λ,π)=i=1n[(1zi)ln(1π)+zilnπ+zi(λ+xilnλlnxi!const)] \ell(\lambda, \pi) = \sum_{i=1}^n \left[ (1 - z_i) \ln(1 - \pi) + z_i \ln \pi + z_i(-\lambda + x_i \ln \lambda-\underbrace{\ln x_i!}_{\text{const}}) \right]
  1. E步:计算
Ez[(λ,π)x,λ(t),π(t)]=i=1nzi=01[(1zi)ln(1π)+zilnπziλ+zixilnλ]P(zixi,θ(t))=i=1n[(1τi(t))ln(1π)+τi(t)(lnπλ+xilnλ)] \begin{aligned} &\mathbb{E}_z[\ell(\lambda,\pi)|x,\lambda^{(t)},\pi^{(t)}]\\ =&\sum_{i=1}^n\sum_{z_i=0}^{1} \left[ (1 - z_i) \ln(1 - \pi) + z_i \ln \pi - z_i \lambda + z_i x_i \ln \lambda \right] \cdot P(z_i \mid x_i, \theta^{(t)})\\ =&\sum_{i=1}^n[(1 - \tau_i^{(t)}) \ln(1 - \pi) + \tau_i^{(t)} \left( \ln \pi - \lambda + x_i \ln \lambda \right)] \end{aligned}

其中

τi(t)=P(zi=1xi,λ(t),π(t))=P(zi=1,xiλ(t),π(t))P(xiλ(t),π(t))={π(t)eλ(t)(1π(t))+π(t)eλ(t),xi=01,xi>0 \begin{aligned} \tau_i^{(t)}&=P(z_i=1 \mid x_i, \lambda^{(t)},\pi^{(t)})\\ &=\frac{P(z_i=1,x_i\mid\lambda^{(t)},\pi^{(t)})}{P(x_i\mid \lambda^{(t)},\pi^{(t)})}\\ &=\begin{cases} \dfrac{\pi^{(t)} e^{-\lambda^{(t)}}}{(1 - \pi^{(t)}) + \pi^{(t)} e^{-\lambda^{(t)}}},&x_i=0\\ 1,&x_i>0 \end{cases} \end{aligned}
  1. M步:最大化
Q(λ,π)=i=1n[(1τi)ln(1π)+τilnπτiλ+τixilnλ] Q(\lambda, \pi) = \sum_{i=1}^n \left[ (1 - \tau_i) \ln(1 - \pi) + \tau_i \ln \pi - \tau_i \lambda + \tau_i x_i \ln \lambda\right]

分别对λ,π\lambda,\pi求偏导,取极值,得到

π(t+1)=1ni=1nτi(t),λ(t+1)=i=1nxii=1nτi(t). \begin{aligned} \pi^{(t+1)} &= \frac{1}{n} \sum_{i=1}^n \tau_i^{(t)},\\ \lambda^{(t+1)} &= \frac{\sum_{i=1}^n x_i}{\sum_{i=1}^n \tau_i^{(t)}}. \end{aligned}

x1,,xnx_1, \ldots, x_n是独立同分布随机变量,0<θ<10 < \theta < 1,

P(x1=1)=1θ2,P(x1=0)=12,P(x1=1)=θ2. P(x_1 = -1) = \frac{1 - \theta}{2}, \quad P(x_1 = 0) = \frac{1}{2}, \quad P(x_1 = 1) = \frac{\theta}{2}.

(1)求θ\theta的MLE θ^1\hat{\theta}_1,并问θ^1\hat{\theta}_1是否无偏;
(2)求θ\theta的矩估计θ^2\hat{\theta}_2
(3)求θ\theta的无偏估计的方差的C-R下界。

点击查看答案

(1)设x1,,xnx_1,\cdots,x_n中取值1,0,1-1,0,1的随机变量分别有n1,n2,n3n_1,n_2,n_3个(n1+n2+n3=1n_1+n_2+n_3=1),那么

(θ)=n1ln(1θ2)+n2ln12+n3lnθ2(θ)θ=n11θ+n3θ=0. \begin{aligned} \ell(\theta)&=n_1\ln\left(\frac{1 - \theta}{2}\right)+n_2\ln\frac{1}{2}+n_3\ln\frac{\theta}{2}\\ \frac{\partial\ell(\theta)}{\partial\theta}&=-\frac{n_1}{1-\theta}+\frac{n_3}{\theta}=0. \end{aligned}

所以

θ^1={n3n1+n3,n1+n300,n1+n3=0 \hat{\theta}_1=\begin{cases} \dfrac{n_3}{n_1+n_3},&n_1+n_3\neq 0\\ 0,&n_1+n_3= 0 \end{cases}

下面计算E(θ^1)\mathbb{E}(\hat{\theta}_1)

E(θ^1)=E(E(θ^1n1+n3))=P(n1+n3=0)0+m=1P(n1+n3=m)E(θ^1n1+n3=m)=(1(12)n)E(n3mn1+n3=m)=(1(12)n)θ=θ(1(12)n) \begin{aligned} \mathbb{E}(\hat{\theta}_1)&=\mathbb{E}(\mathbb{E}(\hat{\theta}_1|n_1+n_3))\\ &=P(n_1+n_3=0)\cdot 0+\sum_{m=1}^\infty P(n_1+n_3=m)\cdot \mathbb{E}(\hat{\theta}_1|n_1+n_3=m)\\ &=\left(1-\left(\frac{1}{2}\right)^n\right)\cdot \mathbb{E}\left(\frac{n_3}{m} \mid n_1+n_3 = m\right)\\ &=\left(1-\left(\frac{1}{2}\right)^n\right)\cdot\theta = \theta\left(1-\left(\frac{1}{2}\right)^n\right) \end{aligned}

所以θ^1\hat{\theta}_1不是θ\theta的无偏估计,而是渐近无偏估计。
(2)因为

E(x1)=1(1θ2)+1θ2=θ12 \mathbb{E}(x_1)=-1\cdot\left(\frac{1-\theta}{2}\right)+1\cdot\frac{\theta}{2}=\theta-\frac{1}{2}

所以θ^2=x+12\displaystyle\hat{\theta}_2=\overline{x}+\frac{1}{2}.
(3)计算

lnp(x;θ)=12(x2x)ln(1θ2)(1x2)ln2+12(x2+x)ln(θ2),dlnp(x;θ)dθ=12(x2x)11θ+12(x2+x)1θ, \begin{aligned} \ln p(x; \theta) &= \frac{1}{2} (x^2 - x) \ln\left(\frac{1 - \theta}{2}\right) - (1 - x^2) \ln 2 + \frac{1}{2} (x^2 + x) \ln\left(\frac{\theta}{2}\right),\\ \frac{d \ln p(x; \theta)}{d\theta} &= -\frac{1}{2} (x^2 - x) \frac{1}{1 - \theta} + \frac{1}{2} (x^2 + x) \frac{1}{\theta}, \end{aligned}

所以Fisher信息量

I(θ)=E(dlnp(x;θ)dθ)2=(11θ)21θ2+(1θ)2θ2=12(11θ+1θ)=12θ(1θ), \begin{aligned} I(\theta) &= \mathbb{E}\left(\frac{d \ln p(x; \theta)}{d\theta}\right)^2 = \left(-\frac{1}{1 - \theta}\right)^2\cdot\frac{1 - \theta}{2}+\left(\frac{1}{\theta}\right)^2\cdot\frac{\theta}{2} &= \frac{1}{2} \left(\frac{1}{1 - \theta} + \frac{1}{\theta}\right) = \frac{1}{2\theta(1 - \theta)}, \end{aligned}

所以,θ\theta的无偏估计的方差的 C-R 下界为2θ(1θ)n\dfrac{2\theta(1 - \theta)}{n}.

X1,,XnX_1, \ldots, X_n是来自正态分布N(μ,σ2)N(\mu, \sigma^2)的一组简单随机样本,其中μ\muσ2\sigma^2都未知。记

Xn=1ni=1nXi,Sn2=1ni=1n(XiXn)2. \overline{X}_n = \frac{1}{n} \sum_{i=1}^n X_i, \quad S_n^2 = \frac{1}{n} \sum_{i=1}^n (X_i - \overline{X}_n)^2.

回答以下问题:
(1)计算Var(Sn2)\text{Var}(S_n^2)
(2)构造μ3+σ4\mu^3 + \sigma^4的UMVUE。

点击查看答案

(1)因为样本服从正态分布,故

nSn2σ2=(n1)S2σ2χ2(n1) \frac{nS_n^2}{\sigma^2}=\frac{(n-1)S^2}{\sigma^2}\sim\chi^2(n-1)

所以

Var(nSn2σ2)=2(n1)Var(Sn2)=2(n1)σ4n2. \mathrm{Var}\left(\frac{nS_n^2}{\sigma^2}\right)=2(n-1)\Longrightarrow\mathrm{Var}\left(S_n^2\right)=\frac{2(n-1)\sigma^4}{n^2}.

(2)考虑到似然函数不易求导,故考虑矩估计:

E[Xn3]=1n3E[i=1nxi3]=1n3[n(μ3+3μσ2)+3n(n1)μ(μ2+σ2)+n(n1)(n2)μ3]=μ3+3μσ2n \begin{aligned} \mathbb{E}\left[\overline{X}_n^3\right]&=\frac{1}{n^3}\mathbb{E}\left[\sum_{i=1}^nx_i^3\right]\\ &=\frac{1}{n^3}[n(\mu^3 + 3\mu\sigma^2) + 3n(n-1)\mu(\mu^2 + \sigma^2) + n(n-1)(n-2)\mu^3]\\ &=\mu^3+3\mu\frac{\sigma^2}{n} \end{aligned}

又因为E(XnSn2)=n1nμσ2\mathbb{E}(\overline{X}_nS_n^2)=\dfrac{n-1}{n}\mu\sigma^2,所以

μ^3=Xn33n1XnSn2 \hat{\mu}^3=\overline{X}_n^3-\frac{3}{n-1}\overline{X}_nS_n^2

下面再求σ^4\hat{\sigma}^4。利用第一问的结果:

E[(Sn2)2]=Var(Sn2)+[E(Sn2)]2=2(n1)σ4n2+(n1n)2σ4=n21n2σ4 \begin{aligned} \mathbb{E}[(S_n^2)^2]&=\text{Var}(S_n^2)+[\mathbb{E}(S_n^2)]^2\\ &=\frac{2(n-1)\sigma^4}{n^2}+\left(\frac{n-1}{n}\right)^2\sigma^4\\ &=\frac{n^2-1}{n^2}\sigma^4 \end{aligned}

所以σ^4=n2n21(Sn2)2\displaystyle\hat{\sigma}^4=\frac{n^2}{n^2-1}(S_n^2)^2。综上

μ^3+σ^4=Xn33n1XnSn2+n2n21(Sn2)2. \hat{\mu}^3+\hat{\sigma}^4=\overline{X}_n^3-\frac{3}{n-1}\overline{X}_nS_n^2+\frac{n^2}{n^2-1}(S_n^2)^2.

又因为估计量是(i=1nXi,i=1nXi2)\displaystyle\left(\sum_{i=1}^n X_i,\sum_{i=1}^nX_i^2\right)(充分完备统计量)的函数,所以是UMVUE。

X1,X2,,XnX_1, X_2, \ldots, X_n是来自N(μ,1)N(\mu, 1)的简单随机样本,其中μ\mu未知。用X\overline{X}表示样本均值。令p=P(X10)p = P(X_1 \geq 0)。回答以下问题:
(1)求pp的最大似然估计p^\hat{p}
(2)求n(p^p)\sqrt{n}(\hat{p} - p)的极限分布;
(3)求pp的UMVUE.

点击查看答案

(1)因为X1N(μ,1)X_1\sim N(\mu,1),所以

p=P(X10)=P(X1μ10μ1)=P(Zμ)=1Φ(μ)=Φ(μ) p = P(X_1 \geq 0) = P\left(\frac{X_1 - \mu}{1} \geq \frac{0 - \mu}{1}\right) = P(Z \geq -\mu) = 1 - \Phi(-\mu) = \Phi(\mu)

其中Φ()\Phi(\cdot)为标准正态分布的分布函数。又因为X\overline{X}μ\mu的最大似然估计,根据MLE的不变性原理,

p=Φ(μ)p^=Φ(X). p=\Phi(\mu)\Longrightarrow \hat{p}=\Phi(\overline{X}).

(2)根据中心极限定理,

n(Xμ)N(0,1) \sqrt{n}(\overline{X}-\mu)\sim N(0,1)

则利用Delta方法,令g(μ)=Φ(μ)g(\mu)=\Phi(\mu),则

g(μ)=ϕ(μ)=12πeμ22 g'(\mu)=\phi(\mu)=\frac{1}{\sqrt{2\pi}}e^{-\frac{\mu^2}{2}}

所以

n(g(X)g(μ))dN(0,[g(μ)]2)n(p^p)dN(0,12πeμ2). \sqrt{n}(g(\overline{X})-g(\mu))\stackrel{d}{\longrightarrow} N(0,[g'(\mu)]^2)\Longrightarrow \sqrt{n}(\hat{p}-p)\stackrel{d}{\longrightarrow}N\left(0,\frac{1}{2\pi}e^{-\mu^2}\right).

(3)先找一个无偏估计量:p^1=I(X10)\hat{p}_1=I(X_1\geq 0)E(p^1)=P(X10)=p\mathbb{E}(\hat{p}_1)=P(X_1\geq 0)=p),又因为X\overline{X}是充分完备统计量,所以只需要求E[p^1X]=P(X10X)\mathbb{E}[\hat{p}_1|\overline{X}]=P(X_1\geq 0|\overline{X})即可。
因为在正态总体下,(X1,X)(X_1, \overline{X})服从二元正态分布。其均值均为μ\mu

Var(X1)=1,Var(X)=1n,Cov(X1,X)=1n \text{Var}(X_1) = 1,\text{Var}(\overline{X}) = \frac{1}{n},\text{Cov}(X_1, \overline{X}) = \frac{1}{n}

由此可得 X1X_1在给定 X=a\overline{X} = a条件下的分布仍为正态分布,且

E[X1X]=μ+1n1n(Xμ)=X,Var(X1X)=Var(X1)Cov(X1,X)2Var(X)=1(1n)21n=11n=n1n. \begin{aligned} \mathbb{E}[X_1 | \overline{X}] &= \mu + \frac{\frac{1}{n}}{\frac{1}{n}} (\overline{X} - \mu) = \overline{X},\\ \text{Var}(X_1 | \overline{X}) &= \text{Var}(X_1) - \frac{\text{Cov}(X_1, \overline{X})^2}{\text{Var}(\overline{X})} \\ &= 1 - \frac{(\frac{1}{n})^2}{\frac{1}{n}} = 1 - \frac{1}{n} = \frac{n-1}{n}. \end{aligned}

所以X1XN(X,n1n)X_1|\overline{X}\sim N\left(\overline{X},\dfrac{n-1}{n}\right),故

P(X10X)=P(X1Xn1n0Xn1n)=Φ(Xn1n) \begin{aligned} P(X_1 \geq 0 \mid \overline{X}) &= P\left(\frac{X_1 - \overline{X}}{\sqrt{\frac{n-1}{n}}} \geq \frac{0 - \overline{X}}{\sqrt{\frac{n-1}{n}}}\right) \\ &= \Phi\left(\frac{\overline{X}}{\sqrt{\frac{n-1}{n}}}\right) \end{aligned}

pp的UMVUE为Φ(Xnn1)\displaystyle\Phi\left(\overline{X}\sqrt{\frac{n}{n-1}}\right)

X1,X2,,XnX_1, X_2, \ldots, X_n是来自U(θ12,θ+12)\displaystyle U\left(\theta - \frac{1}{2}, \theta + \frac{1}{2}\right)的样本,求θ\theta的置信水平为1α1 - \alpha的置信区间。

点击查看答案

Yi=Xiθ,i=1,2,,nY_i=X_i-\theta,\,i=1,2,\cdots,n,则有

Y1,,Yni.i.dU(12,12) Y_1,\cdots,Y_n\overset{i.i.d}{\sim}U\left(-\frac{1}{2},\frac{1}{2}\right)

Y(1)=X(1)θ,Y(n)=X(n)θY_{(1)}=X_{(1)}-\theta,Y_{(n)}=X_{(n)}-\theta。因此

T=X(1)+X(n)2θ=Y(1)+Y(n)2 T=\frac{X_{(1)}+X_{(n)}}{2}-\theta=\frac{Y_{(1)}+Y_{(n)}}{2}

分布与θ\theta无关,即TT为枢轴量。下面求TT的分布:
因为(Y(1),Y(n))(Y_{(1)},Y_{(n)})的联合概率密度函数为

f(u,v)=n(n1)(vu)n2,12<u<v<12 f(u,v)=n(n-1)(v-u)^{n-2},\quad -\frac{1}{2}< u< v< \frac{1}{2}

所以令T=u+v2,R=vuT=\dfrac{u+v}{2},R=v-u,则根据换元公式,(T,R)(T,R)的联合概率密度函数为

f(t,r)=n(n1)rn2,0<r<12t f(t,r)=n(n-1)r^{n-2},\quad 0< r < 1-2|t|

因此TT的概率密度函数为

fT(t)=n(12t)n11{12<t<12} f_T(t)=n(1-2|t|)^{n-1}\cdot\mathbf{1}_{\{-\frac{1}{2}< t < \frac{1}{2}\}}

接下来构造置信区间。可设置信区间形式为[c,c][-c,c]0<c<120< c< \frac{1}{2}),则

P(Tc)=ccn(12t)n1=1(12c)n=1αc=1α1n2. P(|T|\leq c)=\int_{-c}^cn(1-2|t|)^{n-1}=1-(1-2c)^n=1-\alpha\Longrightarrow c=\frac{1-\alpha^{\frac{1}{n}}}{2}.

由此得到

P(T1α1n2)=P{X(1)+X(n)2cθX(1)+X(n)2+c}=1α, P\left(|T|\leq \frac{1-\alpha^{\frac{1}{n}}}{2}\right)=P \left\{ \frac{X_{(1)} + X_{(n)}}{2} - c \leq \theta \leq \frac{X_{(1)} + X_{(n)}}{2} + c \right\}=1-\alpha,

θ\theta的一个置信水平为1α1 - \alpha的置信区间为

[X(1)+X(n)21α1n2,X(1)+X(n)2+1α1n2]. \left[ \frac{X_{(1)} + X_{(n)}}{2} - \frac{1 - \alpha^{\frac{1}{n}}}{2}, \frac{X_{(1)} + X_{(n)}}{2} + \frac{1 - \alpha^{\frac{1}{n}}}{2} \right].

假设检验

其实这一章涉及具体数据的计算题解题套路都差不多,就是遵循假设检验的那套流程即可。可能唯一需要思考的就是一些带理论或证明性质的题目。

设正态总体的方差σ2\sigma^2已知值,均值μ\mu只能取μ0\mu_0μ1\mu_1μ1<μ0\mu_1 < \mu_0)两值之一,x\overline{x}为总体的容量为nn的样本均值,考虑检验问题

H0:μ=μ0vsH1:μ=μ1, H_0: \mu = \mu_0 \quad \text{vs} \quad H_1: \mu = \mu_1,

若检验拒绝域取为W={xμ0+uασn}\displaystyle W = \left\{ \overline{x} \leq \mu_0 + u_\alpha\frac{\sigma}{\sqrt{n}} \right\},试验证:检验犯第二类错误的概率为

β=Φ(u1α+μ1μ0σ/n), \beta = \Phi\left(u_{1-\alpha} + \frac{\mu_1 - \mu_0}{\sigma / \sqrt{n}}\right),

从而在α,β\alpha, \beta给定时,有n=(u1α+u1β)2σ2(μ1μ0)2\displaystyle n = (u_{1-\alpha} + u_{1-\beta})^2 \frac{\sigma^2}{(\mu_1 - \mu_0)^2}

点击查看答案

由于xN(μ,σ2n)\displaystyle\overline{x} \sim N\left(\mu, \frac{\sigma^2}{n}\right),故检验犯第二类错误的概率为

β=Pμ1(xμ1>μ0+uασnμ1)=Pμ1(xμ1σ/n>uα+μ0μ1σ/n)=1Φ(uα+μ0μ1σ/n)=Φ(uαμ0μ1σ/n)=Φ(u1α+μ1μ0σ/n), \begin{aligned} \beta &= P_{\mu_1}\left(\overline{x} - \mu_1 > \mu_0 + u_\alpha\frac{\sigma}{\sqrt{n}} - \mu_1\right)\\ &= P_{\mu_1} \left( \frac{\overline{x} - \mu_1}{\sigma / \sqrt{n}} > u_{\alpha} + \frac{\mu_0 - \mu_1}{\sigma / \sqrt{n}} \right)\\ &= 1 - \Phi \left( u_{\alpha} + \frac{\mu_0 - \mu_1}{\sigma / \sqrt{n}} \right) = \Phi \left( -u_{\alpha} - \frac{\mu_0 - \mu_1}{\sigma / \sqrt{n}} \right)\\ &= \Phi \left( u_{1-\alpha} + \frac{\mu_1 - \mu_0}{\sigma / \sqrt{n}} \right), \end{aligned}

由此得到

u1α+μ1μ0σ/n=uβ, u_{1-\alpha} + \frac{\mu_1 - \mu_0}{\sigma / \sqrt{n}} = u_{\beta},

u1α+u1β=μ1μ0σ/n\displaystyle u_{1-\alpha} + u_{1-\beta} = -\frac{\mu_1 - \mu_0}{\sigma / \sqrt{n}},从而在α,β\alpha, \beta给定时,有

n=(u1α+u1β)2σ2(μ1μ0)2. n = (u_{1-\alpha} + u_{1-\beta})^2 \frac{\sigma^2}{(\mu_1 - \mu_0)^2}.

若在猜硬币正反面游戏中,某人在100100次试猜中,共猜中6060次,你认为他是否有诀窍(取α=0.05\alpha = 0.05)?

点击查看答案

pp为该人猜中概率,则该问题可以归结为如下假设检验问题:

H0:p=12vsH1:p>12 H_0: p = \frac{1}{2} \quad \text{vs} \quad H_1: p > \frac{1}{2}

XX记 100 次中猜中的次数,则在原假设成立下,Xb(100,0.5)X \sim b(100, 0.5),由于样本量相当大,检验统计量可取为

u=X100×0.5100×0.5×0.5 u = \frac{X - 100 \times 0.5}{\sqrt{100 \times 0.5 \times 0.5}}

在原假设下,该统计量近似服从正态分布N(0,1)N(0, 1),故检验拒绝域为

W={uu1α}={u1.645} W = \{u \geq u_{1-\alpha}\} = \{u \geq 1.645\}

检验的pp值近似为

p=P{x60}=P{u60100×0.5100×0.5×0.5}=P{u2}=0.0228 p = P\{x \geq 60\} = P\left\{u \geq \frac{60 - 100 \times 0.5}{\sqrt{100 \times 0.5 \times 0.5}}\right\} = P\{u \geq 2\} = 0.0228

因此应拒绝原假设。看来此人猜硬币有某种诀窍。

由此可进一步得到,如果要在α=0.05\alpha = 0.05的条件下认为他是否有诀窍,则至少需要他在100100次试猜中,共猜中(1.645+10)×5+1=59\lfloor(1.645+10)\times 5\rfloor+1=59次即可。这说明当样本足够大时,只需要样本比率稍微极端一些,就可以拒绝原假设。

某建筑公司宣称其座下建筑工地平均每天发生事故次数不超过0.60.6起,现记录了该建筑工地200200天的安全生产情况,事故数据记录如下:

一天的事故数 00 11 22 33 44 55 6\geq 6 合计
天数 102102 5959 3030 88 00 11 00 200200

α=0.05\alpha = 0.05下检验该建筑公司的宣称是否成立。

点击查看答案

XX表示该建筑工地一天所发生的事故数,可认为XX服从泊松分布P(λ)P(\lambda)λ\lambda表示平均每天发生事故次数。要检验的假设是

H0:λ0.6vsH1:λ>0.6. H_0: \lambda \leq 0.6 \quad \text{vs} \quad H_1: \lambda > 0.6.

采用大样本检验。记λ0=0.6\lambda_0 = 0.6,由于总体均值和方差都是λ\lambda,检验统计量是u=Xλ0λ/nu = \dfrac{\overline{X} - \lambda_0}{\sqrt{\lambda / n}},拒绝域是W={u>u1α}W = \{u > u_{1-\alpha}\}
因为n=200,λ^=X=0.74n = 200, \hat{\lambda} = \overline{X} = 0.74,所以u=2.302u_* = 2.302。当α=0.05\alpha = 0.05时,u0.95=1.645u_{0.95} = 1.645
2.302>1.6452.302 > 1.645,表明样本落入了拒绝域,拒绝原假设。相应的pp值是

1Φ(2.302)=0.0107<0.05 1 - \Phi(2.302) = 0.0107 < 0.05

0.050.05的显著性水平下也拒绝原假设。即认为该建筑公司的宣称不成立。

注:这里检验统计量用u=Xλ0λ^/nu = \dfrac{\overline{X} - \lambda_0}{\sqrt{\hat{\lambda}/ n}}λ^\hat{\lambda}表示样本得到的λ\lambda估计值)也可以,与上述检验的唯一区别是功效函数不同。

x1,x2,,xnx_1, x_2, \cdots, x_n为来自正态总体N(μ,σ2)N(\mu, \sigma^2)的 i.i.d 样本,其中μ,σ2\mu, \sigma^2未知。证明关于检验问题H0:μμ0vsH1:μ>μ0H_0: \mu \leq \mu_0\quad\text{vs}\quad H_1: \mu > \mu_0的单侧tt检验是似然比检验(显著性水平α<12\alpha < \dfrac{1}{2})。

点击查看答案

证明:记θ=(μ,σ2)\theta = (\mu, \sigma^2),样本的联合密度函数为

p(x1,x2,,xn;θ)=(2πσ2)n/2exp{12σ2i=1n(xiμ)2} p(x_1, x_2, \cdots, x_n; \theta) = (2\pi\sigma^2)^{-n/2} \exp\left\{-\frac{1}{2\sigma^2} \sum_{i=1}^n (x_i - \mu)^2\right\}

两个参数空间分别为

Θ0={(μ,σ2)μμ0,σ2>0},Θ={(μ,σ2)μR,σ2>0}. \Theta_0 = \{(\mu, \sigma^2) \mid \mu \leq \mu_0, \sigma^2 > 0\}, \quad \Theta = \{(\mu, \sigma^2) \mid \mu \in \mathbb{R}, \sigma^2 > 0\}.

又因为在Θ\Thetaμ^=x,σ^2=1ni=1n(xix)2\displaystyle\hat{\mu} = \overline{x}, \hat{\sigma}^2 = \frac{1}{n} \sum_{i=1}^n (x_i - \overline{x})^2分别为μ,σ2\mu, \sigma^2的 MLE,而在Θ0\Theta_0μ,σ2\mu, \sigma^2的 MLE 为

μ^0=min{x,μ0},σ^02=1ni=1n(xiμ^0)2, \hat{\mu}_0 = \min\{\overline{x}, \mu_0\}, \quad \hat{\sigma}_0^2 = \frac{1}{n} \sum_{i=1}^n (x_i - \hat{\mu}_0)^2,

于是似然比统计量为

Λ=(2πσ^2)n2exp(n2)(2πσ^02)n2exp(n2)={1,xμ0,(1+n(xμ0)2(n1)s2)n2,x>μ0, \Lambda = \frac{(2\pi\hat{\sigma}^2)^{-\frac{n}{2}} \exp\left(-\frac{n}{2}\right)}{(2\pi\hat{\sigma}_0^2)^{-\frac{n}{2}} \exp\left(-\frac{n}{2}\right)} = \begin{cases} 1, & \overline{x} \leq \mu_0, \\[10pt] \displaystyle\left(1 + \frac{n(\overline{x} - \mu_0)^2}{(n-1)s^2}\right)^{\frac{n}{2}}, & \overline{x} > \mu_0, \end{cases}

μ=μ0\mu = \mu_0P(xμ0)=12P(\overline{x} \leq \mu_0) = \dfrac{1}{2},由于α<12\alpha < \dfrac{1}{2},故只需考虑x>μ0\overline{x} > \mu_0的情形。
此时Λ\Lambdat=n(xμ0)t = \sqrt{n(\overline{x} - \mu_0)}的单调增函数,故此时的似然比统计量Λ\Lambda是传统的tt统计量的增函数,即此时的似然比检验等价于单侧的tt检验,拒绝域

{Λc}{n(xμ0)sd}. \{ \Lambda \geq c \} \Leftrightarrow \left\{ \frac{\sqrt{n(\overline{x} - \mu_0)}}{s} \geq d \right\}.

tt检验的结论知,d=t1α(n1)d = t_{1-\alpha}(n-1),这就完成了证明。

某种配偶的后代按体格的属性分为三类,各类的数目分别是10,53,4610,53,46。按照某种遗传模型其频率之比应为p2:2p(1p):(1p)2p^2 : 2p(1-p) : (1-p)^2,问数据与模型是否相符(α=0.05\alpha = 0.05)?

点击查看答案

这是一个分布拟合优度检验,总体可分为三类。若记三类出现的概率分别为p1,p2,p3p_1, p_2, p_3,则要检验的假设为

H0:p1=p2,p2=2p(1p),p3=(1p)2, H_0: p_1 = p^2, \quad p_2 = 2p(1 - p), \quad p_3 = (1 - p)^2,

先用最大似然法估计pp。其似然函数为

L=(p2)n1[2p(1p)]n2[(1p)2]n3=2n2p2n1+n2(1p)n2+2n3,lnL=(2n1+n2)p+(n2+2n3)ln(1p)+n2ln2, \begin{aligned} &L = (p^2)^{n_1} \cdot [2p(1 - p)]^{n_2} \cdot [(1 - p)^2]^{n_3} = 2^{n_2} p^{2n_1+n_2}(1 - p)^{n_2+2n_3},\\ \Longrightarrow&\ln L = (2n_1 + n_2)p + (n_2 + 2n_3)\ln(1 - p) + n_2\ln 2, \end{aligned}

再微分法可得

p^=2n1+n22n=2×10+532(10+53+46)=0.3349, \hat{p} = \frac{2n_1 + n_2}{2n} = \frac{2 \times 10 + 53}{2(10 + 53 + 46)} = 0.3349,

于是p^1=0.1121,p^2=0.4455,p^3=0.4424\hat{p}_1 = 0.1121, \quad \hat{p}_2 = 0.4455, \quad \hat{p}_3 = 0.4424,从而

χ2=(10109×0.1121)2109×0.1121+(53109×0.4455)2109×0.4455+(46109×0.4424)2109×0.4424=0.9114, \chi^2 = \frac{(10 - 109 \times 0.1121)^2}{109 \times 0.1121} + \frac{(53 - 109 \times 0.4455)^2}{109 \times 0.4455} + \frac{(46 - 109 \times 0.4424)^2}{109 \times 0.4424} = 0.9114,

查表知χ0.952(1)=3.8415\chi^2_{0.95}(1) = 3.8415,故拒绝域为W={x23.8415}W = \{x^2 \geq 3.8415\},观察结果χ2\chi^2不落在拒绝域,因此不能拒绝H0H_0,即可以认为数据与模型是相符的。此处的pp值为

p=P(χ20.9114)=0.3397. p = P(\chi^2 \geq 0.9114) = 0.3397.

最后放一个常用分布分位数计算器(这样就不用查表辣

emm结果期末考试说不让用计算器,那么算什么……