呃啊,马上要期
中(末)考试了,紧急整理一波……(主要摘录茆书的习题+补充题)
统计量及其分布
设离散总体的分布列为
现进行不放回抽样,为样本,为样本均值,求 与 (表示成 的函数)。
点击查看答案
注意:本题的样本由于来自不放回抽样,所以不是简单随机样本,不具有独立同分布性质。
先计算样本的期望、方差和协方差:
所以
设总体的分布函数为,经验分布函数为,试证
点击查看答案
证明:设是取自总体分布函数为的样本,则经验分布函数为
若令,则是独立同分布的随机变量,且
于是
又可写为,故有
设总体的四阶中心矩存在,总体方差记为。求证:样本方差
的方差是
点击查看答案
证明:设
即样本阶中心矩和总体阶中心矩之差。那么
又因为为定值,而
所以
又经过计算,
因此
这个式子的含义:方差的方差 = 二阶波动 - 均值修正 + 二者耦合;由此可得渐近正态分布:
设总体的阶中心矩存在。若是来自该总体的样本,样本均值和样本方差分别记作和,求证:
点击查看答案
沿用上一题对的定义,则,所以
又因为,故
补充:关于的相关数字特征:。
设总体服从双参数指数分布,其分布函数为
其中,为样本的次序统计量。试证明,
服从自由度为的分布.
点击查看答案
证明: 令 ,则 的联合密度为
作变换
其雅可比行列式为 。又因为
所以的联合密度为
由此可得 ,从而
这正是指数分布,即的分布函数,故命题得证。
设和分别为容量的样本的最小和最大次序统计量,
(1)证明极差的分布函数
其中与分别为总体的分布函数与密度函数;
(2) 利用(1)的结论,求总体为指数分布时,样本极差的分布。
点击查看答案
证明:
(1)根据次序统计量的密度函数的表达式,和的联合密度是
那么,极差的分布是
命题得证。
(2)当总体是指数分布时,,,所以样本极差的分布是
这说明指数分布下与个样本的最大次序统计量同分布。
另外,均匀分布下的分布为.
设是来自分布函数为,密度函数为的一个样本。, 是其次序统计量,试求在给定时,的联合条件密度函数。
点击查看答案
次序统计量联合密度函数为
而后个次序统计量的联合密度函数为
故所求的联合条件密度函数为
最后结果表明:所求条件密度函数只与有关,而与的取值无关。从而,其分布也仅依赖于的给定值。
这样一来,条件密度函数完全可以写成。【类似“马尔可夫性”】
实际上,如果总体分布为,将看作到达时间的话,那么其在的条件下就是均匀分布的次序统计量。【可结合泊松过程理解】
证明:若,,且与相互独立,则
点击查看答案
证明:由题得,其密度函数分别为:
考虑变换:
则其雅可比行列式为:
于是联合密度函数为:
对积分得的边际密度:
这正是Beta分布的密度函数,故
推论:设,则.
设是来自的样本,记
计算。
点击查看答案
设,则,那么
又因为,所以
故
设。
记,试找出与分布的联系(提示:作正交变换)。
点击查看答案
基于上述正交变换可知,相互独立且
又有,所以
记,那么
统计量和三大分布这一块似乎有不少这样的大开大合计算题,吓哭了……参数估计
设简单样本。对给定常数,令
回答以下问题:
(1)证明是的无偏估计;
(2)证明是的相合估计;
(3)证明的渐近正态性。
点击查看答案
(1)证明:
所以是的无偏估计。
(2)设随机变量,则独立同分布且,所以由辛钦大数定律,
即是的相合估计。
(3)因为独立同分布且有限,所以由Lindeberg-Lévy中心极限定理,
即
故具有渐近正态性,。
设随机变量满足
其中是固定常数,独立同分布于,其中未知。回答以下问题:
(1)求关于的一个二维充分统计量;
(2)求的 MLE 并证明它是的一个无偏估计;
(3)求的 MLE 的分布。
点击查看答案
(1)因为,所以,那么的联合概率密度函数为
由因子分解定理,可取,则
所以是的一个二维充分统计量。
(2)取对数似然函数
对求偏导,使其为:
解得
下证其无偏性:
所以是的一个无偏估计。
(3)因为是的线性组合,所以也服从正态分布。
又因为
所以。
一个零膨胀泊松分布的概率函数是
其中都是未知参数。设是来自的一组简单随机样本,其中。
(1)求参数的矩估计;
(2)请写出参数的对数似然函数;
(3)请写出计算参数的最大似然估计的EM算法。
点击查看答案
(1)因为
所以,.
(2)因为
所以
若设,则
(3)算法步骤如下:
- 引入潜变量,定义
则。
2. 构造完全数据分布:因为
所以
- 取完全数据对数似然
- E步:计算
其中
- M步:最大化
分别对求偏导,取极值,得到
设是独立同分布随机变量,,
(1)求的MLE ,并问是否无偏;
(2)求的矩估计;
(3)求的无偏估计的方差的C-R下界。
点击查看答案
(1)设中取值的随机变量分别有个(),那么
所以
下面计算:
所以不是的无偏估计,而是渐近无偏估计。
(2)因为
所以.
(3)计算
所以Fisher信息量
所以,的无偏估计的方差的 C-R 下界为.
设是来自正态分布的一组简单随机样本,其中和都未知。记
回答以下问题:
(1)计算;
(2)构造的UMVUE。
点击查看答案
(1)因为样本服从正态分布,故
所以
(2)考虑到似然函数不易求导,故考虑矩估计:
又因为,所以
下面再求。利用第一问的结果:
所以。综上
又因为估计量是(充分完备统计量)的函数,所以是UMVUE。
设是来自的简单随机样本,其中未知。用表示样本均值。令。回答以下问题:
(1)求的最大似然估计;
(2)求的极限分布;
(3)求的UMVUE.
点击查看答案
(1)因为,所以
其中为标准正态分布的分布函数。又因为是的最大似然估计,根据MLE的不变性原理,
(2)根据中心极限定理,
则利用Delta方法,令,则
所以
(3)先找一个无偏估计量:(),又因为是充分完备统计量,所以只需要求即可。
因为在正态总体下,服从二元正态分布。其均值均为,
由此可得 在给定 条件下的分布仍为正态分布,且
所以,故
故的UMVUE为。
设是来自的样本,求的置信水平为的置信区间。
点击查看答案
令,则有
且。因此
分布与无关,即为枢轴量。下面求的分布:
因为的联合概率密度函数为
所以令,则根据换元公式,的联合概率密度函数为
因此的概率密度函数为
接下来构造置信区间。可设置信区间形式为(),则
由此得到
即的一个置信水平为的置信区间为
假设检验
其实这一章涉及具体数据的计算题解题套路都差不多,就是遵循假设检验的那套流程即可。可能唯一需要思考的就是一些带理论或证明性质的题目。
设正态总体的方差已知值,均值只能取或()两值之一,为总体的容量为的样本均值,考虑检验问题
若检验拒绝域取为,试验证:检验犯第二类错误的概率为
从而在给定时,有。
点击查看答案
由于,故检验犯第二类错误的概率为
由此得到
即,从而在给定时,有
若在猜硬币正反面游戏中,某人在次试猜中,共猜中次,你认为他是否有诀窍(取)?
点击查看答案
设为该人猜中概率,则该问题可以归结为如下假设检验问题:
以记 100 次中猜中的次数,则在原假设成立下,,由于样本量相当大,检验统计量可取为
在原假设下,该统计量近似服从正态分布,故检验拒绝域为
检验的值近似为
因此应拒绝原假设。看来此人猜硬币有某种诀窍。
由此可进一步得到,如果要在的条件下认为他是否有诀窍,则至少需要他在次试猜中,共猜中次即可。这说明当样本足够大时,只需要样本比率稍微极端一些,就可以拒绝原假设。
某建筑公司宣称其座下建筑工地平均每天发生事故次数不超过起,现记录了该建筑工地天的安全生产情况,事故数据记录如下:
| 一天的事故数 | 合计 | |||||||
|---|---|---|---|---|---|---|---|---|
| 天数 |
在下检验该建筑公司的宣称是否成立。
点击查看答案
设表示该建筑工地一天所发生的事故数,可认为服从泊松分布,表示平均每天发生事故次数。要检验的假设是
采用大样本检验。记,由于总体均值和方差都是,检验统计量是,拒绝域是。
因为,所以。当时,。
而,表明样本落入了拒绝域,拒绝原假设。相应的值是
在的显著性水平下也拒绝原假设。即认为该建筑公司的宣称不成立。
注:这里检验统计量用(表示样本得到的估计值)也可以,与上述检验的唯一区别是功效函数不同。
设为来自正态总体的 i.i.d 样本,其中未知。证明关于检验问题的单侧检验是似然比检验(显著性水平)。
点击查看答案
证明:记,样本的联合密度函数为
两个参数空间分别为
又因为在下分别为的 MLE,而在下的 MLE 为
于是似然比统计量为
在时,由于,故只需考虑的情形。
此时为的单调增函数,故此时的似然比统计量是传统的统计量的增函数,即此时的似然比检验等价于单侧的检验,拒绝域
由检验的结论知,,这就完成了证明。
某种配偶的后代按体格的属性分为三类,各类的数目分别是。按照某种遗传模型其频率之比应为,问数据与模型是否相符()?
点击查看答案
这是一个分布拟合优度检验,总体可分为三类。若记三类出现的概率分别为,则要检验的假设为
先用最大似然法估计。其似然函数为
再微分法可得
于是,从而
查表知,故拒绝域为,观察结果不落在拒绝域,因此不能拒绝,即可以认为数据与模型是相符的。此处的值为
最后放一个常用分布分位数计算器(这样就不用查表辣)
