样本及样本函数的分布 总体与样本 研究对象的全体是总体,总体中的每个元素是个体,总体中的元素个数称为总体容量,分为有限总体和无限总体两种. 研究对象的某一种数值指标,在总体中的分布可以用概率分布表示,则可以用随机变量 X X X 表示总体的这项数量指标,称为总体 X X X . 可以类比定义总体的分布函数、数字特征、离散型总体、连续型总体等概念. 从总体中抽取若干个个体的过程叫做抽样,抽样结果得到的一组数据叫做样本,样本所含个体的数量称为样本容量. 满足随机性、独立性的抽样是简单随机抽样,得到的样本称为简单随机样本. 无限总体、有限总体的放回抽样是简单随机抽样;有限总体容量远大于样本容量时进行不放回抽样,抽样可近似认为是简单随机抽样. 从总体中抽取容量为 n n n 的样本,就是对表示总体的随机变量 X X X 随机、独立地进行 n n n 次观测,每次观测的结果都可视为一个随机变量,这些试验的结果就可看成独立同分布的随机变量 X 1 , X 2 , ⋯ , X n X_1,X_2,\cdots,X_n X 1 , X 2 , ⋯ , X n . 设总体 X X X 是具有某一概率分布的随机变量,如果随机变量 X 1 , X 2 , ⋯ , X n X_1,X_2,\cdots,X_n X 1 , X 2 , ⋯ , X n 独立同分布,且与 X X X 具有相同的概率分布,则称 X 1 , X 2 , ⋯ , X n X_1,X_2,\cdots,X_n X 1 , X 2 , ⋯ , X n 是来自总体 X X X 的样本,观测得到样本 X 1 , X 2 , ⋯ , X n X_1,X_2,\cdots,X_n X 1 , X 2 , ⋯ , X n 的具体数值 x 1 , x 2 , ⋯ , x n x_1,x_2,\cdots,x_n x 1 , x 2 , ⋯ , x n 称为样本观测值(观测值、样本值). 从总体中抽取到样本的观测值,可以认为是事件 { X 1 = x 1 } , { X 2 = x 2 } , ⋯ , { X n = x n } \{X_1=x_1\},\{X_2=x_2\},\cdots,\{X_n=x_n\} { X 1 = x 1 } , { X 2 = x 2 } , ⋯ , { X n = x n } 同时发生. 样本容量为 n n n 的样本可看成 n n n 维随机变量,类似之前提到的多维随机变量的概念,可以定义样本的分布函数、密度函数(概率分布)等. 样本函数及其概率分布 统计量:设 X 1 , X 2 , ⋯ , X n X_1,X_2,\cdots,X_n X 1 , X 2 , ⋯ , X n 是来自总体 X X X 的样本,其观测值为 x 1 , x 2 , ⋯ , x n x_1,x_2,\cdots,x_n x 1 , x 2 , ⋯ , x n . 若 g ( t 1 , t 2 , ⋯ , t n ) g(t_1,t_2,\cdots,t_n) g ( t 1 , t 2 , ⋯ , t n ) 为 n n n 元函数,则称 g ( X 1 , X 2 , ⋯ , X n ) g(X_1,X_2,\cdots,X_n) g ( X 1 , X 2 , ⋯ , X n ) 为样本函数,它也是一个随机变量,相应地 g ( x 1 , x 2 , ⋯ , x n ) g(x_1,x_2,\cdots,x_n) g ( x 1 , x 2 , ⋯ , x n ) 是样本函数的观测值. 如果样本函数不含有未知参数,则称该样本函数为统计量. 以下设来自总体 X X X 的样本 X 1 , X 2 , ⋯ , X n X_1,X_2,\cdots,X_n X 1 , X 2 , ⋯ , X n 的观测值为 x 1 , x 2 , ⋯ , x n x_1,x_2,\cdots,x_n x 1 , x 2 , ⋯ , x n ,X X X 的均值和方差分别为 μ , σ 2 ( σ > 0 ) \mu,\sigma^2(\sigma>0) μ , σ 2 ( σ > 0 ) .
样本均值:称统计量
X ˉ = 1 n ∑ i = 1 n X i \bar{X}=\dfrac{1}{n}\sum\limits_{i=1}^nX_i X ˉ = n 1 i = 1 ∑ n X i
为样本均值,其观测值为
x ˉ = 1 n ∑ i = 1 n x i \bar{x}=\dfrac{1}{n}\sum\limits_{i=1}^nx_i x ˉ = n 1 i = 1 ∑ n x i
样本均值的数学期望为 μ \mu μ ,方差为 σ 2 n \dfrac{\sigma^2}{n} n σ 2 .
样本方差:统计量
S 2 = 1 n − 1 ∑ i = 1 n ( X i − X ˉ ) 2 = 1 n − 1 ( ∑ i = 1 n X i − n X ˉ 2 ) S^2=\dfrac{1}{n-1}\sum\limits_{i=1}^n(X_i-\bar{X})^2=\dfrac{1}{n-1}\left(\sum\limits_{i=1}^nX_i-n\bar{X}^2\right) S 2 = n − 1 1 i = 1 ∑ n ( X i − X ˉ ) 2 = n − 1 1 ( i = 1 ∑ n X i − n X ˉ 2 )
为样本方差,其观测值为
s 2 = 1 n − 1 ∑ i = 1 n ( x i − x ˉ ) 2 = 1 n − 1 ( ∑ i = 1 n x i − n x ˉ 2 ) s^2=\dfrac{1}{n-1}\sum\limits_{i=1}^n(x_i-\bar{x})^2=\dfrac{1}{n-1}\left(\sum\limits_{i=1}^nx_i-n\bar{x}^2\right) s 2 = n − 1 1 i = 1 ∑ n ( x i − x ˉ ) 2 = n − 1 1 ( i = 1 ∑ n x i − n x ˉ 2 )
样本方差的均值为 σ 2 \sigma^2 σ 2 ,方差为 2 σ 4 n − 1 \dfrac{2\sigma^4}{n-1} n − 1 2 σ 4 .
正态总体的样本均值和样本方差相互独立.
样本标准差:记 S = S 2 S=\sqrt{S^2} S = S 2 为样本标准差,其观测值记为 s = s 2 s=\sqrt{s^2} s = s 2 .
样本 k k k 阶原点矩:记
A k = 1 n ∑ i = 1 n X i k , k = 1 , 2 , ⋯ A_k=\dfrac{1}{n}\sum_{i=1}^nX_i^k,k=1,2,\cdots A k = n 1 i = 1 ∑ n X i k , k = 1 , 2 , ⋯
为样本 k k k 阶原点矩,其观测值为
a k = 1 n ∑ i = 1 n x i k , k = 1 , 2 , ⋯ a_k=\dfrac{1}{n}\sum_{i=1}^nx_i^k,k=1,2,\cdots a k = n 1 i = 1 ∑ n x i k , k = 1 , 2 , ⋯
显然,一阶原点矩是样本均值.
样本 k k k 阶中心矩:记
B k = 1 n ∑ i = 1 n ( X i − X ˉ ) k , k = 1 , 2 , ⋯ B_k=\dfrac{1}{n}\sum_{i=1}^n(X_i-\bar{X})^k,k=1,2,\cdots B k = n 1 i = 1 ∑ n ( X i − X ˉ ) k , k = 1 , 2 , ⋯
为样本 k k k 阶中心矩,其观测值为
b k = 1 n ∑ i = 1 n ( x i − x ˉ ) k , k = 1 , 2 , ⋯ b_k=\dfrac{1}{n}\sum_{i=1}^n(x_i-\bar{x})^k,k=1,2,\cdots b k = n 1 i = 1 ∑ n ( x i − x ˉ ) k , k = 1 , 2 , ⋯
显然,一阶中心矩恒为0.
为什么二阶中心矩不等于样本方差?或者说,为什么样本方差前面的系数是 1 n − 1 \dfrac{1}{n-1} n − 1 1 而不是 1 n \dfrac{1}{n} n 1 ?我总结出两方面原因: 其一是二阶中心矩确实不是总体方差的无偏估计. 根据样本二阶中心矩的定义有B 2 = 1 n ∑ i = 1 n ( X i − X ˉ ) 2 B_2=\dfrac{1}{n}\sum_{i=1}^n(X_i-\bar{X})^2 B 2 = n 1 i = 1 ∑ n ( X i − X ˉ ) 2
展开得B 2 = 1 n ∑ i = 1 n ( X i 2 − 2 X i X ˉ + X ˉ 2 ) = 1 n ∑ i = 1 n X i 2 − 1 n ∑ i = 1 n 2 X i X ˉ + 1 n n X ˉ 2 B_2=\dfrac{1}{n}\sum_{i=1}^n(X_i^2-2X_i\bar{X}+\bar{X}^2)=\dfrac{1}{n}\sum_{i=1}^nX_i^2-\dfrac{1}{n}\sum_{i=1}^n2X_i\bar{X}+\dfrac{1}{n}n\bar{X}^2 B 2 = n 1 i = 1 ∑ n ( X i 2 − 2 X i X ˉ + X ˉ 2 ) = n 1 i = 1 ∑ n X i 2 − n 1 i = 1 ∑ n 2 X i X ˉ + n 1 n X ˉ 2
由于1 n ∑ i = 1 n 2 X i X ˉ = 2 X ˉ ( X 1 + X 2 + ⋯ + X n n ) = 2 X ˉ 2 \dfrac{1}{n}\sum_{i=1}^n2X_i\bar{X}=2\bar{X}\left(\dfrac{X_1+X_2+\cdots+X_n}{n}\right)=2\bar{X}^2 n 1 i = 1 ∑ n 2 X i X ˉ = 2 X ˉ ( n X 1 + X 2 + ⋯ + X n ) = 2 X ˉ 2
B 2 B_2 B 2 的展开式可化简为B 2 = ( 1 n ∑ i = 1 n X i 2 ) − X ˉ 2 = 1 n ( ∑ i = 1 n X i 2 − n X ˉ 2 ) B_2=\left(\dfrac{1}{n}\sum_{i=1}^nX_i^2\right)-\bar{X}^2=\dfrac{1}{n}\left(\sum_{i=1}^nX_i^2-n\bar{X}^2\right) B 2 = ( n 1 i = 1 ∑ n X i 2 ) − X ˉ 2 = n 1 ( i = 1 ∑ n X i 2 − n X ˉ 2 )
因此 B 2 B_2 B 2 的数学期望为E ( B 2 ) = 1 n ∑ i = 1 n E ( X i 2 ) − E ( X ˉ 2 ) E(B_2)=\dfrac{1}{n}\sum_{i=1}^nE(X_i^2)-E(\bar{X}^2) E ( B 2 ) = n 1 i = 1 ∑ n E ( X i 2 ) − E ( X ˉ 2 )
根据方差的计算公式可得E ( X i 2 ) = D ( X i ) + [ E ( X i ) ] 2 = σ 2 + μ 2 E(X_i^2)=D(X_i)+[E(X_i)]^2=\sigma^2+\mu^2 E ( X i 2 ) = D ( X i ) + [ E ( X i ) ] 2 = σ 2 + μ 2
E ( X ˉ 2 ) = D ( X ˉ ) + [ E ( X ˉ ) ] 2 = σ 2 n + μ 2 E(\bar{X}^2)=D(\bar{X})+[E(\bar{X})]^2=\dfrac{\sigma^2}{n}+\mu^2 E ( X ˉ 2 ) = D ( X ˉ ) + [ E ( X ˉ ) ] 2 = n σ 2 + μ 2
代入可得E ( B 2 ) = σ 2 + μ 2 − σ 2 n − μ 2 = n − 1 n σ 2 ≠ σ 2 E(B_2)=\sigma^2+\mu^2-\dfrac{\sigma^2}{n}-\mu^2=\dfrac{n-1}{n}\sigma^2\neq \sigma^2 E ( B 2 ) = σ 2 + μ 2 − n σ 2 − μ 2 = n n − 1 σ 2 = σ 2
所以,样本二阶中心矩不是总体方差的无偏估计,B 2 B_2 B 2 与 S 2 S^2 S 2 的关系是B 2 = n − 1 n S 2 B_2=\dfrac{n-1}{n}S^2 B 2 = n n − 1 S 2
另一方面,样本观测值的均值是根据各次观测结果计算出来的,样本的一阶中心矩恒为0,即b 1 = 1 n ∑ i = 1 n ( x i − x ˉ ) = 0 b_1=\dfrac{1}{n}\sum_{i=1}^n(x_i-\bar{x})=0 b 1 = n 1 i = 1 ∑ n ( x i − x ˉ ) = 0
前 n − 1 n-1 n − 1 个偏差被计算出来后,由于上式恒等于0,最后一个样本观测值与样本均值之间的偏差就不能自由变动,而被前面的观测值固定下来,因此缺少一个自由度. 样本最大值和最小值:取样本观测值
x ( n ) = max ( x 1 , x 2 , ⋯ , x n ) , x ( 1 ) = min ( x 1 , x 2 , ⋯ , x n ) x_{(n)}=\max(x_1,x_2,\cdots,x_n),x_{(1)}=\min(x_1,x_2,\cdots,x_n) x ( n ) = max ( x 1 , x 2 , ⋯ , x n ) , x ( 1 ) = min ( x 1 , x 2 , ⋯ , x n )
作为随机变量 X ( n ) , X ( 1 ) X_{(n)},X_{(1)} X ( n ) , X ( 1 ) 的观测值,分别称为样本最大值和样本最小值,即
X ( n ) = max ( X 1 , X 2 , ⋯ , X n ) , X ( 1 ) = min ( X 1 , X 2 , ⋯ , X n ) X_{(n)}=\max(X_1,X_2,\cdots,X_n),X_{(1)}=\min(X_1,X_2,\cdots,X_n) X ( n ) = max ( X 1 , X 2 , ⋯ , X n ) , X ( 1 ) = min ( X 1 , X 2 , ⋯ , X n )
其分布函数分别为
F max ( x ) = [ F ( x ) ] n , F min ( x ) = 1 − [ 1 − F ( x ) ] n F_{\max}(x)=[F(x)]^n,F_{\min}(x)=1-[1-F(x)]^n F m a x ( x ) = [ F ( x ) ] n , F m i n ( x ) = 1 − [ 1 − F ( x ) ] n
设 X ∼ N ( μ , σ 2 ) , X 1 , X 2 , ⋯ , X n X\sim N(\mu,\sigma^2),X_1,X_2,\cdots,X_n X ∼ N ( μ , σ 2 ) , X 1 , X 2 , ⋯ , X n 是来自总体 X X X 的样本,X ˉ \bar{X} X ˉ 是样本均值,则随机变量
u = X ˉ − μ σ / n ∼ N ( 0 , 1 ) u=\dfrac{\bar{X}-\mu}{\sigma/\sqrt{n}}\sim N(0,1) u = σ / n X ˉ − μ ∼ N ( 0 , 1 )
设 X ∼ N ( μ 1 , σ 1 2 ) , Y ∼ N ( μ 2 , σ 2 2 ) X\sim N(\mu_1,\sigma^2_1),Y\sim N(\mu_2,\sigma^2_2) X ∼ N ( μ 1 , σ 1 2 ) , Y ∼ N ( μ 2 , σ 2 2 ) ,分别独立地从总体 X , Y X,Y X , Y 抽取样本 X 1 , X 2 , ⋯ , X n 1 , Y 1 , Y 2 , ⋯ , Y n 2 X_1,X_2,\cdots,X_{n_1},Y_1,Y_2,\cdots,Y_{n_2} X 1 , X 2 , ⋯ , X n 1 , Y 1 , Y 2 , ⋯ , Y n 2 ,样本均值分别为 X ˉ , Y ˉ \bar{X},\bar{Y} X ˉ , Y ˉ ,则
u = X ˉ − Y ˉ − ( μ 1 − μ 2 ) σ 1 2 n 1 + σ 2 n 2 ∼ N ( 0 , 1 ) u=\dfrac{\bar{X}-\bar{Y}-(\mu_1-\mu_2)}{\sqrt{\dfrac{\sigma_1^2}{n_1}+\dfrac{\sigma^2}{n_2}}}\sim N(0,1) u = n 1 σ 1 2 + n 2 σ 2 X ˉ − Y ˉ − ( μ 1 − μ 2 ) ∼ N ( 0 , 1 )
卡方分布 设 X 1 , X 2 , ⋯ , X n X_1,X_2,\cdots,X_n X 1 , X 2 , ⋯ , X n 是来自标准正态总体 N ( 0 , 1 ) N(0,1) N ( 0 , 1 ) 的样本,则统计量 χ 2 = X 1 2 + X 2 2 + ⋯ + X n 2 \chi^2=X_1^2+X_2^2+\cdots+X_n^2 χ 2 = X 1 2 + X 2 2 + ⋯ + X n 2 服从自由度为 n n n 的 χ 2 \chi^2 χ 2 分布,记为 χ 2 ∼ χ 2 ( n ) \chi^2\sim\chi^2(n) χ 2 ∼ χ 2 ( n ) .
三大分布的概率密度函数的解析式很复杂,个人认为非数学专业的应该用不上,所以也没怎么看。 若 χ 2 ∼ χ 2 ( n ) \chi^2\sim\chi^2(n) χ 2 ∼ χ 2 ( n ) ,则 E ( χ 2 ) = n , D ( χ 2 ) = 2 n E(\chi^2)=n,D(\chi^2)=2n E ( χ 2 ) = n , D ( χ 2 ) = 2 n . χ 2 \chi^2 χ 2 分布的可加性:设 X ∼ χ 2 ( n 1 ) , Y ∼ χ 2 ( n 2 ) X\sim\chi^2(n_1),Y\sim\chi^2(n_2) X ∼ χ 2 ( n 1 ) , Y ∼ χ 2 ( n 2 ) ,且 X , Y X,Y X , Y 相互独立,则 X + Y ∼ χ 2 ( n 1 + n 2 ) X+Y\sim\chi^2(n_1+n_2) X + Y ∼ χ 2 ( n 1 + n 2 ) .设 χ 2 ∼ χ 2 ( n ) \chi^2\sim\chi^2(n) χ 2 ∼ χ 2 ( n ) ,当 n n n 很大时,χ 2 − n 2 n \dfrac{\chi^2-n}{\sqrt{2n}} 2 n χ 2 − n 近似服从标准正态分布. 设 X 1 , X 2 , ⋯ , X n X_1,X_2,\cdots,X_n X 1 , X 2 , ⋯ , X n 是来自正态总体 N ( μ , σ 2 ) N(\mu,\sigma^2) N ( μ , σ 2 ) 的样本,则它们的标准化变量的平方和满足1 σ 2 ∑ i = 1 n ( X i − μ ) 2 ∼ χ 2 ( n ) \dfrac{1}{\sigma^2}\sum_{i=1}^n(X_i-\mu)^2\sim\chi^2(n) σ 2 1 i = 1 ∑ n ( X i − μ ) 2 ∼ χ 2 ( n )
设 X 1 , X 2 , ⋯ , X n X_1,X_2,\cdots,X_n X 1 , X 2 , ⋯ , X n 是来自正态总体 X ∼ N ( μ , σ 2 ) X\sim N(\mu,\sigma^2) X ∼ N ( μ , σ 2 ) 的样本,则样本方差满足( n − 1 ) S 2 σ 2 ∼ χ 2 ( n − 1 ) \dfrac{(n-1)S^2}{\sigma^2}\sim\chi^2(n-1) σ 2 ( n − 1 ) S 2 ∼ χ 2 ( n − 1 )
χ 2 ( n ) \chi^2(n) χ 2 ( n ) 分布的上 α ( 0 < α < 1 ) \alpha(0<\alpha<1) α ( 0 < α < 1 ) 分位点记为 χ α 2 ( n ) \chi^2_\alpha(n) χ α 2 ( n ) ,即P { χ 2 > χ α 2 ( n ) } = ∫ χ α 2 ( n ) + ∞ f ( x ) d x P\{\chi^2>\chi^2_\alpha(n)\}=\int_{\chi^2_\alpha(n)}^{+\infty}f(x)\mathrm{d}x P { χ 2 > χ α 2 ( n )} = ∫ χ α 2 ( n ) + ∞ f ( x ) d x
其中 f ( x ) f(x) f ( x ) 是 χ 2 ( n ) \chi^2(n) χ 2 ( n ) 分布的概率密度函数.t 分布 设 X ∼ N ( 0 , 1 ) , Y ∼ χ 2 ( n ) X\sim N(0,1),Y\sim\chi^2(n) X ∼ N ( 0 , 1 ) , Y ∼ χ 2 ( n ) ,且 X , Y X,Y X , Y 相互独立,则随机变量
t = X Y / n t=\dfrac{X}{\sqrt{Y/n}} t = Y / n X
服从自由度为 n n n 的t分布,记为 t ∼ t ( n ) t\sim t(n) t ∼ t ( n ) .
t 分布的图像关于纵轴成轴对称. 当 n → ∞ n\to\infty n → ∞ 时,t ( n ) t(n) t ( n ) 近似于标准正态分布. t ( n ) t(n) t ( n ) 分布的上 α ( 0 < α < 1 ) \alpha(0<\alpha<1) α ( 0 < α < 1 ) 分位点记为 t α ( n ) t_\alpha(n) t α ( n ) ,即P { t > t α ( n ) } = ∫ t α ( n ) + ∞ f ( x ) d x P\{t>t_\alpha(n)\}=\int_{t_\alpha(n)}^{+\infty}f(x)\mathrm{d}x P { t > t α ( n )} = ∫ t α ( n ) + ∞ f ( x ) d x
其中 f ( x ) f(x) f ( x ) 是 t ( n ) t(n) t ( n ) 分布的概率密度函数.根据 t 分布的对称性,有 t α ( n ) = − t 1 − α ( n ) t_\alpha(n)=-t_{1-\alpha}(n) t α ( n ) = − t 1 − α ( n ) 设 X 1 , X 2 , ⋯ , X n X_1,X_2,\cdots,X_n X 1 , X 2 , ⋯ , X n 是来自正态总体 X ∼ N ( μ , σ 2 ) X\sim N(\mu,\sigma^2) X ∼ N ( μ , σ 2 ) 的样本,样本均值和样本方差分别为 X ˉ , S 2 \bar{X},S^2 X ˉ , S 2 ,则随机变量t = X ˉ − μ S n ∼ t ( n − 1 ) t=\dfrac{\bar{X}-\mu}{S}\sqrt{n}\sim t(n-1) t = S X ˉ − μ n ∼ t ( n − 1 )
简单推导:X ˉ − μ S n = ( X ˉ − μ ) / ( σ / n ) S 2 ( n − 1 ) ( n − 1 ) σ 2 = u χ 2 ( n − 1 ) n − 1 \dfrac{\bar{X}-\mu}{S}\sqrt{n}=\dfrac{(\bar{X}-\mu)/(\sigma/\sqrt{n})}{\sqrt\dfrac{S^2(n-1)}{(n-1)\sigma^2}}=\dfrac{u}{\sqrt{\dfrac{\chi^2(n-1)}{n-1}}} S X ˉ − μ n = ( n − 1 ) σ 2 S 2 ( n − 1 ) ( X ˉ − μ ) / ( σ / n ) = n − 1 χ 2 ( n − 1 ) u
设 X 1 , X 2 , ⋯ , X n , X n + 1 X_1,X_2,\cdots,X_n,X_{n+1} X 1 , X 2 , ⋯ , X n , X n + 1 是来自正态总体 X ∼ N ( μ , σ 2 ) X\sim N(\mu,\sigma^2) X ∼ N ( μ , σ 2 ) 的样本,样本均值和样本方差分别为X ˉ n = 1 n ∑ i = 1 n X i , S n 2 = 1 n − 1 ∑ i = 1 n ( X i − X ˉ ) 2 \bar{X}_n=\dfrac{1}{n}\sum_{i=1}^nX_i,S^2_n=\dfrac{1}{n-1}\sum_{i=1}^n(X_i-\bar{X})^2 X ˉ n = n 1 i = 1 ∑ n X i , S n 2 = n − 1 1 i = 1 ∑ n ( X i − X ˉ ) 2
也就是这里的样本均值、方差只考虑前 n n n 个个体,则统计量t = n n + 1 ⋅ X n + 1 − X ˉ n S n ∼ t ( n − 1 ) t=\sqrt{\dfrac{n}{n+1}}\cdot\dfrac{X_{n+1}-\bar{X}_n}{S_n}\sim t(n-1) t = n + 1 n ⋅ S n X n + 1 − X ˉ n ∼ t ( n − 1 )
简单推导:X n + 1 − X ˉ n ∼ N ( 0 , n + 1 n σ 2 ) X_{n+1}-\bar{X}_n\sim N\left(0,\dfrac{n+1}{n}\sigma^2\right) X n + 1 − X ˉ n ∼ N ( 0 , n n + 1 σ 2 )
n n + 1 ⋅ X n + 1 − X ˉ n S n = ( X n + 1 − X ˉ n − 0 ) / n + 1 n σ S n σ \sqrt{\dfrac{n}{n+1}}\cdot\dfrac{X_{n+1}-\bar{X}_n}{S_n}=\dfrac{(X_{n+1}-\bar{X}_n-0)/\sqrt{\dfrac{n+1}{n}}\sigma}{S_n\sigma} n + 1 n ⋅ S n X n + 1 − X ˉ n = S n σ ( X n + 1 − X ˉ n − 0 ) / n n + 1 σ
= ( X n + 1 − X ˉ n − 0 ) / n + 1 n σ S n 2 ( n − 1 ) ( n − 1 ) σ 2 = u χ 2 ( n − 1 ) / ( n − 1 ) =\dfrac{(X_{n+1}-\bar{X}_n-0)/\sqrt{\dfrac{n+1}{n}}\sigma}{\sqrt\dfrac{S_n^2(n-1)}{(n-1)\sigma^2}}=\dfrac{u}{\sqrt{\chi^2(n-1)/(n-1)}} = ( n − 1 ) σ 2 S n 2 ( n − 1 ) ( X n + 1 − X ˉ n − 0 ) / n n + 1 σ = χ 2 ( n − 1 ) / ( n − 1 ) u
若从两个正态总体 N ( μ 1 , σ 2 ) , N ( μ 2 , σ 2 ) N(\mu_1,\sigma^2),N(\mu_2,\sigma^2) N ( μ 1 , σ 2 ) , N ( μ 2 , σ 2 ) (注意这两个正态总体是方差相同、均值不同的)分别独立地抽取样本,样本容量分别为 n 1 , n 2 n_1,n_2 n 1 , n 2 ,样本均值分别为 X ˉ , Y ˉ \bar{X},\bar{Y} X ˉ , Y ˉ ,样本方差分别为 S 1 2 , S 2 2 S_1^2,S_2^2 S 1 2 , S 2 2 ,记S W = ( n 1 − 1 ) S 1 2 + ( n 2 − 1 ) S 2 n 1 + n 2 − 2 S_W=\sqrt{\dfrac{(n_1-1)S_1^2+(n_2-1)S^2}{n_1+n_2-2}} S W = n 1 + n 2 − 2 ( n 1 − 1 ) S 1 2 + ( n 2 − 1 ) S 2
则随机变量t = X ˉ − Y ˉ − ( μ 1 − μ 2 ) S W 1 n 1 + 1 n 2 ∼ t ( n 1 + n 2 − 2 ) t=\dfrac{\bar{X}-\bar{Y}-(\mu_1-\mu_2)}{S_W\sqrt{\dfrac{1}{n_1}+\dfrac{1}{n_2}}}\sim t(n_1+n_2-2) t = S W n 1 1 + n 2 1 X ˉ − Y ˉ − ( μ 1 − μ 2 ) ∼ t ( n 1 + n 2 − 2 )
简单推导:X ˉ − Y ˉ ∼ N ( μ 1 − μ 2 , σ 2 n 1 + σ 2 n 2 ) \bar{X}-\bar{Y}\sim N\left(\mu_1-\mu_2,\dfrac{\sigma^2}{n_1}+\dfrac{\sigma^2}{n_2}\right) X ˉ − Y ˉ ∼ N ( μ 1 − μ 2 , n 1 σ 2 + n 2 σ 2 )
因此有X ˉ − Y ˉ − ( μ 1 − μ 2 ) σ 1 n 1 + 1 n 2 ∼ N ( 0 , 1 ) \dfrac{\bar{X}-\bar{Y}-(\mu_1-\mu_2)}{\sigma\sqrt{\dfrac{1}{n_1}+\dfrac{1}{n_2}}}\sim N(0,1) σ n 1 1 + n 2 1 X ˉ − Y ˉ − ( μ 1 − μ 2 ) ∼ N ( 0 , 1 )
两个样本方差满足( n 1 − 1 ) S 1 2 σ 2 ∼ χ 2 ( n 1 − 1 ) , ( n 2 − 1 ) S 2 2 σ 2 ∼ χ 2 ( n 2 − 1 ) \dfrac{(n_1-1)S_1^2}{\sigma^2}\sim\chi^2(n_1-1),\dfrac{(n_2-1)S_2^2}{\sigma^2}\sim\chi^2(n_2-1) σ 2 ( n 1 − 1 ) S 1 2 ∼ χ 2 ( n 1 − 1 ) , σ 2 ( n 2 − 1 ) S 2 2 ∼ χ 2 ( n 2 − 1 )
根据 χ 2 \chi^2 χ 2 分布的可加性,得到( n 1 − 1 ) S 1 2 σ 2 + ( n 2 − 1 ) S 2 2 σ 2 ∼ χ 2 ( n 1 + n 2 − 1 ) \dfrac{(n_1-1)S_1^2}{\sigma^2}+\dfrac{(n_2-1)S_2^2}{\sigma^2}\sim\chi^2(n_1+n_2-1) σ 2 ( n 1 − 1 ) S 1 2 + σ 2 ( n 2 − 1 ) S 2 2 ∼ χ 2 ( n 1 + n 2 − 1 )
因此有t = X ˉ − Y ˉ − ( μ 1 − μ 2 ) σ 1 n 1 + 1 n 2 1 σ ( n 1 − 1 ) S 1 2 + ( n 2 − 1 ) S 2 2 n 1 + n 2 − 2 ∼ t ( n 1 + n 2 − 2 ) t=\dfrac{\dfrac{\bar{X}-\bar{Y}-(\mu_1-\mu_2)}{\sigma\sqrt{\dfrac{1}{n_1}+\dfrac{1}{n_2}}}}{\dfrac{1}{\sigma}\sqrt{\dfrac{(n_1-1)S_1^2+(n_2-1)S_2^2}{n_1+n_2-2}}}\sim t(n_1+n_2-2) t = σ 1 n 1 + n 2 − 2 ( n 1 − 1 ) S 1 2 + ( n 2 − 1 ) S 2 2 σ n 1 1 + n 2 1 X ˉ − Y ˉ − ( μ 1 − μ 2 ) ∼ t ( n 1 + n 2 − 2 )
F 分布 设 X ∼ χ 2 ( n 1 ) , Y ∼ χ 2 ( n 2 ) X\sim\chi^2(n_1),Y\sim\chi^2(n_2) X ∼ χ 2 ( n 1 ) , Y ∼ χ 2 ( n 2 ) ,且 X , Y X,Y X , Y 相互独立,则随机变量
F = X / n 1 Y / n 2 F=\dfrac{X/n_1}{Y/n_2} F = Y / n 2 X / n 1
服从第一自由度为 n 1 n_1 n 1 、第二自由度为 n 2 n_2 n 2 (或者自由度为 ( n 1 , n 2 ) (n_1,n_2) ( n 1 , n 2 ) )的 F 分布,记作 F ∼ F ( n 1 , n 2 ) F\sim F(n_1,n_2) F ∼ F ( n 1 , n 2 ) .
若 F ∼ F ( n 1 , n 2 ) F\sim F(n_1,n_2) F ∼ F ( n 1 , n 2 ) ,则 1 F ∼ F ( n 2 , n 1 ) \dfrac{1}{F}\sim F(n_2,n_1) F 1 ∼ F ( n 2 , n 1 ) .
F ( n 1 , n 2 ) F(n_1,n_2) F ( n 1 , n 2 ) 分布的上 α ( 0 < α < 1 ) \alpha(0<\alpha<1) α ( 0 < α < 1 ) 分位点记为 F α ( n 1 , n 2 ) F_\alpha(n_1,n_2) F α ( n 1 , n 2 ) ,即
P { F > F α ( n 1 , n 2 ) } = ∫ F α ( n 1 , n 2 ) + ∞ f ( x ) d x P\{F>F_\alpha(n_1,n_2)\}=\int_{F_\alpha(n_1,n_2)}^{+\infty}f(x)\mathrm{d}x P { F > F α ( n 1 , n 2 )} = ∫ F α ( n 1 , n 2 ) + ∞ f ( x ) d x
其中 f ( x ) f(x) f ( x ) 是 F ( n 1 , n 2 ) F(n_1,n_2) F ( n 1 , n 2 ) 分布的概率密度函数.
F 1 − α ( n 1 , n 2 ) = 1 F α ( n 2 , n 1 ) F_{1-\alpha}(n_1,n_2)=\dfrac{1}{F_\alpha(n_2,n_1)} F 1 − α ( n 1 , n 2 ) = F α ( n 2 , n 1 ) 1
设 X 1 , X 2 , ⋯ , X n 1 X_1,X_2,\cdots,X_{n_1} X 1 , X 2 , ⋯ , X n 1 是来自正态总体 X ∼ N ( μ 1 , σ 1 2 ) X\sim N(\mu_1,\sigma_1^2) X ∼ N ( μ 1 , σ 1 2 ) 的样本,Y 1 , Y 2 , ⋯ , Y n 2 Y_1,Y_2,\cdots,Y_{n_2} Y 1 , Y 2 , ⋯ , Y n 2 是来自正态总体 N ( μ 2 , σ 2 2 ) N(\mu_2,\sigma^2_2) N ( μ 2 , σ 2 2 ) 的样本,且两个样本相互独立,则随机变量
F = n 2 n 1 ⋅ σ 2 2 σ 1 2 ⋅ ∑ i = 1 n 1 ( X i − μ 1 ) 2 ∑ j = 1 n 2 ( Y j − μ 2 ) 2 ∼ F ( n 1 , n 2 ) F=\dfrac{n_2}{n_1}\cdot\dfrac{\sigma_2^2}{\sigma_1^2}\cdot\dfrac{\sum\limits_{i=1}^{n_1}(X_i-\mu_1)^2}{\sum\limits_{j=1}^{n_2}(Y_j-\mu_2)^2}\sim F(n_1,n_2) F = n 1 n 2 ⋅ σ 1 2 σ 2 2 ⋅ j = 1 ∑ n 2 ( Y j − μ 2 ) 2 i = 1 ∑ n 1 ( X i − μ 1 ) 2 ∼ F ( n 1 , n 2 )
简单推导:
F = 1 n 1 ∑ i = 1 n 1 ( X i − μ 1 ) 2 σ 1 2 1 n 2 ∑ j = 1 n 2 ( Y j − μ 2 ) 2 σ 2 2 F=\dfrac{\dfrac{1}{n_1}\sum\limits_{i=1}^{n_1}\dfrac{(X_i-\mu_1)^2}{\sigma_1^2}}{\dfrac{1}{n_2}\sum\limits_{j=1}^{n_2}\dfrac{(Y_j-\mu_2)^2}{\sigma^2_2}} F = n 2 1 j = 1 ∑ n 2 σ 2 2 ( Y j − μ 2 ) 2 n 1 1 i = 1 ∑ n 1 σ 1 2 ( X i − μ 1 ) 2
注意到
X i − μ 1 σ 1 , Y i − μ 2 σ 2 \dfrac{X_i-\mu_1}{\sigma_1},\dfrac{Y_i-\mu_2}{\sigma_2} σ 1 X i − μ 1 , σ 2 Y i − μ 2
都是各自样本中个体的标准化变量,因此分子分母都是个体标准化变量的平方和的算术平均数. 记
χ 1 2 = ∑ i = 1 n 1 ( X i − μ 1 ) 2 σ 1 2 , χ 2 2 = ∑ j = 1 n 2 ( Y j − μ 2 ) 2 σ 2 2 \chi^2_1=\sum\limits_{i=1}^{n_1}\dfrac{(X_i-\mu_1)^2}{\sigma_1^2},\chi_2^2=\sum\limits_{j=1}^{n_2}\dfrac{(Y_j-\mu_2)^2}{\sigma^2_2} χ 1 2 = i = 1 ∑ n 1 σ 1 2 ( X i − μ 1 ) 2 , χ 2 2 = j = 1 ∑ n 2 σ 2 2 ( Y j − μ 2 ) 2
则有
F = χ 1 2 / n 1 χ 2 2 / n 2 ∼ F ( n 1 , n 2 ) F=\dfrac{\chi_1^2/{n_1}}{\chi_2^2/{n_2}}\sim F(n_1,n_2) F = χ 2 2 / n 2 χ 1 2 / n 1 ∼ F ( n 1 , n 2 )
设从两个正态总体N ( μ 1 , σ 1 2 ) , N ( μ 2 , σ 2 2 ) N(\mu_1,\sigma_1^2),N(\mu_2,\sigma_2^2) N ( μ 1 , σ 1 2 ) , N ( μ 2 , σ 2 2 ) 分别独立地各抽取一个样本,它们的样本容量分别为 n 1 , n 2 n_1,n_2 n 1 , n 2 ,样本方差分别为 S 1 2 , S 2 2 S_1^2,S_2^2 S 1 2 , S 2 2 ,则随机变量
F = σ 2 2 σ 1 2 ⋅ S 1 2 S 2 2 ∼ F ( n 1 − 1 , n 2 − 2 ) F=\dfrac{\sigma^2_2}{\sigma_1^2}\cdot\dfrac{S_1^2}{S_2^2}\sim F(n_1-1,n_2-2) F = σ 1 2 σ 2 2 ⋅ S 2 2 S 1 2 ∼ F ( n 1 − 1 , n 2 − 2 )
简单推导:
F = ( n 1 − 1 ) S 1 2 ( n 1 − 1 ) σ 1 2 ( n 2 − 1 ) S 2 2 ( n 2 − 2 ) σ 2 2 = χ 1 2 / ( n 1 − 1 ) χ 2 2 / ( n 2 − 1 ) ∼ F ( n 1 , n 2 ) F=\dfrac{\ \dfrac{(n_1-1)S_1^2}{(n_1-1)\sigma_1^2}\ }{\dfrac{(n_2-1)S_2^2}{(n_2-2)\sigma_2^2}}=\dfrac{\chi_1^2/(n_1-1)}{\chi^2_2/(n_2-1)}\sim F(n_1,n_2) F = ( n 2 − 2 ) σ 2 2 ( n 2 − 1 ) S 2 2 ( n 1 − 1 ) σ 1 2 ( n 1 − 1 ) S 1 2 = χ 2 2 / ( n 2 − 1 ) χ 1 2 / ( n 1 − 1 ) ∼ F ( n 1 , n 2 )
上面提到的几个统计量非常重要,后面参数估计和假设检验会经常用到
参数估计 参数估计解决的是总体分布类型已知,但参数未知的情况.
参数的点估计 设总体 X X X 的分布含有未知参数 θ \theta θ (可以是数值,或者向量 ( θ 1 , θ 2 , ⋯ , θ r ) (\theta_1,\theta_2,\cdots,\theta_r) ( θ 1 , θ 2 , ⋯ , θ r ) ),从总体中抽取样本 X 1 , X 2 , ⋯ , X n X_1,X_2,\cdots,X_n X 1 , X 2 , ⋯ , X n ,其观测值为 x 1 , x 2 , ⋯ , x n x_1,x_2,\cdots,x_n x 1 , x 2 , ⋯ , x n ,点估计就是构造适当的统计量 θ ^ ( X 1 , X 2 , ⋯ , X n ) \hat{\theta}(X_1,X_2,\cdots,X_n) θ ^ ( X 1 , X 2 , ⋯ , X n ) ,代入观测值求得未知参数的估计值 θ ^ \hat{\theta} θ ^ .
θ ^ ( X 1 , X 2 , ⋯ , X n ) \hat{\theta}(X_1,X_2,\cdots,X_n) θ ^ ( X 1 , X 2 , ⋯ , X n ) 称为点估计量 .θ ^ ( x 1 , x 2 , ⋯ , x n ) \hat{\theta}(x_1,x_2,\cdots,x_n) θ ^ ( x 1 , x 2 , ⋯ , x n ) 称为点估计值 .未知参数有 r r r 个时,需要构造 r r r 个统计量分别作为各个未知参数的点估计量. 点估计量和点估计值一般都用符号 θ ^ \hat{\theta} θ ^ ,但是要注意题目问的是什么. 矩估计法 设总体 X X X 的分布含有 r r r 个未知参数 θ 1 , θ 2 , ⋯ , θ r \theta_1,\theta_2,\cdots,\theta_r θ 1 , θ 2 , ⋯ , θ r ,总体的 1 , 2 , ⋯ , r 1,2,\cdots,r 1 , 2 , ⋯ , r 阶原点矩都存在,它们都是 θ 1 , θ 2 , ⋯ , θ r \theta_1,\theta_2,\cdots,\theta_r θ 1 , θ 2 , ⋯ , θ r 的函数,即
μ k = μ k ( θ 1 , θ 2 , ⋯ , θ r ) = E ( X k ) , k = 1 , 2 , ⋯ , r \mu_k=\mu_k(\theta_1,\theta_2,\cdots,\theta_r)=E(X^k),k=1,2,\cdots,r μ k = μ k ( θ 1 , θ 2 , ⋯ , θ r ) = E ( X k ) , k = 1 , 2 , ⋯ , r
从总体中抽取样本 X 1 , X 2 , ⋯ , X n X_1,X_2,\cdots,X_n X 1 , X 2 , ⋯ , X n ,根据辛钦定理可得当 n → ∞ n\to\infty n → ∞ 时样本 k k k 阶原点矩依概率收敛于总体的 k k k 阶原点矩 μ k \mu_k μ k ,取样本 k k k 阶原点矩 A k A_k A k 作为总体 k k k 阶原点矩 μ k \mu_k μ k 的估计,用样本矩的连续函数作为总体矩的同一个连续函数. 令
{ μ 1 ( θ 1 , θ 2 , ⋯ , θ r ) = A 1 , μ 2 ( θ 1 , θ 2 , ⋯ , θ r ) = A 2 , ⋯ , μ r ( θ 1 , θ 2 , ⋯ , θ r ) = A r \begin{equation*} \begin{cases} \mu_1(\theta_1,\theta_2,\cdots,\theta_r)=A_1,\\ \mu_2(\theta_1,\theta_2,\cdots,\theta_r)=A_2,\\ \cdots,\\ \mu_r(\theta_1,\theta_2,\cdots,\theta_r)=A_r \\ \end{cases} \end{equation*} ⎩ ⎨ ⎧ μ 1 ( θ 1 , θ 2 , ⋯ , θ r ) = A 1 , μ 2 ( θ 1 , θ 2 , ⋯ , θ r ) = A 2 , ⋯ , μ r ( θ 1 , θ 2 , ⋯ , θ r ) = A r
这是一个关于未知参数 ( θ 1 , θ 2 , ⋯ , θ r ) (\theta_1,\theta_2,\cdots,\theta_r) ( θ 1 , θ 2 , ⋯ , θ r ) 的方程组,记方程组的解为
{ θ 1 ^ = θ 1 ^ ( A 1 , A 2 , ⋯ , A r ) , θ 2 ^ = θ 2 ^ ( A 1 , A 2 , ⋯ , A r ) , ⋯ , θ r ^ = θ r ^ ( A 1 , A 2 , ⋯ , A r ) , \begin{equation*} \begin{cases} \hat{\theta_1}=\hat{\theta_1}(A_1,A_2,\cdots,A_r),\\ \hat{\theta_2}=\hat{\theta_2}(A_1,A_2,\cdots,A_r),\\ \cdots,\\ \hat{\theta_r}=\hat{\theta_r}(A_1,A_2,\cdots,A_r),\\ \end{cases} \end{equation*} ⎩ ⎨ ⎧ θ 1 ^ = θ 1 ^ ( A 1 , A 2 , ⋯ , A r ) , θ 2 ^ = θ 2 ^ ( A 1 , A 2 , ⋯ , A r ) , ⋯ , θ r ^ = θ r ^ ( A 1 , A 2 , ⋯ , A r ) ,
称为未知参数 θ 1 , θ 2 , ⋯ , θ r \theta_1,\theta_2,\cdots,\theta_r θ 1 , θ 2 , ⋯ , θ r 的矩估计量,这种求点估计量的方法叫做矩估计法,代入样本观测值即可得到矩估计量的观测值(估计值)
{ θ 1 ^ = θ 1 ^ ( a 1 , a 2 , ⋯ , a r ) , θ 2 ^ = θ 2 ^ ( a 1 , a 2 , ⋯ , a r ) , ⋯ , θ r ^ = θ r ^ ( a 1 , a 2 , ⋯ , a r ) , \begin{equation*} \begin{cases} \hat{\theta_1}=\hat{\theta_1}(a_1,a_2,\cdots,a_r),\\ \hat{\theta_2}=\hat{\theta_2}(a_1,a_2,\cdots,a_r),\\ \cdots,\\ \hat{\theta_r}=\hat{\theta_r}(a_1,a_2,\cdots,a_r),\\ \end{cases} \end{equation*} ⎩ ⎨ ⎧ θ 1 ^ = θ 1 ^ ( a 1 , a 2 , ⋯ , a r ) , θ 2 ^ = θ 2 ^ ( a 1 , a 2 , ⋯ , a r ) , ⋯ , θ r ^ = θ r ^ ( a 1 , a 2 , ⋯ , a r ) ,
其中 a k a_k a k 即为各阶样本矩的观测值.
第一次看到这玩意的定义可能一头雾水,可以这样理解:矩估计法就是用样本的 k k k 阶矩去估计总体的 k k k 阶矩。样本矩是我们有观测数据的,能直接算出来的,做题的时候写出表达式就行;总体矩是一个理论值,要通过理论推导,我们用要求的未知参数表示出来。这样,在 总体矩 = 样本矩 这个方程中,我们就得到了关于未知参数的方程,解出来就是矩估计量,代入具体观测值就是矩估计值,实在不行看一两个例题就明白了。
无论总体服从什么分布,总体均值的矩估计量都是样本均值,总体方差的矩估计量都是样本二阶中心矩. 有多组解表示出某个未知参数时,一般情况下优先使用低阶矩.
最大似然估计法 最大似然估计法是利用已知的总体的概率密度(概率分布)和样本,根据概率最大的事件在一次试验中最可能出现的原理,求总体的概率密度(或概率分布)的未知参数的点估计的方法。
对于离散型总体,若只有一个未知参数,设总体 X X X 为离散型随机变量,其概率分布为 P { X = x } = p ( x ; θ ) P\{X=x\}=p(x;\theta) P { X = x } = p ( x ; θ ) ,其中 θ \theta θ 是未知参数. 若样本 X 1 , X 2 , ⋯ , X n X_1,X_2,\cdots,X_n X 1 , X 2 , ⋯ , X n 的观测值为 x 1 , x 2 , ⋯ , x n x_1,x_2,\cdots,x_n x 1 , x 2 , ⋯ , x n ,由于样本中的各个随机变量之间相互独立,因此相当于 { X 1 = x 1 } , { X 2 = x 2 } , ⋯ , { X n = x n } \{X_1=x_1\},\{X_2=x_2\},\cdots,\{X_n=x_n\} { X 1 = x 1 } , { X 2 = x 2 } , ⋯ , { X n = x n } 同时发生,其概率为
p ( x 1 ; θ ) p ( x 2 ; θ ) ⋯ p ( x n ; θ ) = ∏ i = 1 n p ( x i ; θ ) p(x_1;\theta)p(x_2;\theta)\cdots p(x_n;\theta)=\prod_{i=1}^np(x_i;\theta) p ( x 1 ; θ ) p ( x 2 ; θ ) ⋯ p ( x n ; θ ) = i = 1 ∏ n p ( x i ; θ )
由于概率分布 p p p 、样本观测值 x 1 , x 2 , ⋯ , x n x_1,x_2,\cdots,x_n x 1 , x 2 , ⋯ , x n 都是已知的,上式仅含有唯一的未知参数 θ \theta θ ,即上式是 θ \theta θ 的函数,记为
L ( θ ) = ∏ i = 1 n p ( x i ; θ ) L(\theta)=\prod_{i=1}^np(x_i;\theta) L ( θ ) = i = 1 ∏ n p ( x i ; θ )
并称为样本的似然函数. 选取 L ( θ ) L(\theta) L ( θ ) 取得最大值的 θ ^ \hat{\theta} θ ^ 作为 θ \theta θ 的估计,此时样本观测值 x 1 , x 2 , ⋯ , x n x_1,x_2,\cdots,x_n x 1 , x 2 , ⋯ , x n 出现的概率最大. 若在 θ \theta θ 的取值范围内恒有 L ( θ ^ ) ≥ L ( θ ) L(\hat{\theta})\ge L(\theta) L ( θ ^ ) ≥ L ( θ ) ,则称 θ ^ \hat{\theta} θ ^ 是 θ \theta θ 的最大似然估计值,这样得到的估计量可以根据 x 1 , x 2 , ⋯ , x n x_1,x_2,\cdots,x_n x 1 , x 2 , ⋯ , x n 计算出来. 把样本观测值换成对应的随机变量,就得到最大似然估计量.
求 L ( θ ) L(\theta) L ( θ ) 的最大值点,要先求出 L ( θ ) L(\theta) L ( θ ) 的极大值点. 当 L ( θ ) L(\theta) L ( θ ) 是可导函数时,可以利用导数求出它的极大值点,也就是解方程
d L ( θ ) d θ = 0 \dfrac{\mathrm{d}L(\theta)}{\mathrm{d}\theta}=0 d θ d L ( θ ) = 0
这个方程叫做似然方程. 如果 L ( θ ) L(\theta) L ( θ ) 有唯一的驻点 θ ^ \hat{\theta} θ ^ ,则认为它是似然函数的极大值点.
似然方程一般含有大量关于 θ \theta θ 的表达式相乘的结构,求导数比较麻烦,由于 ln x \ln x ln x 在定义域上是单调增加函数,L ( θ ) , ln L ( θ ) L(\theta),\ln L(\theta) L ( θ ) , ln L ( θ ) 在同一点处取得极大值,可以由方程
d ln L ( θ ) d θ = 0 \dfrac{\mathrm{d}\ln L(\theta)}{\mathrm{d}\theta}=0 d θ d ln L ( θ ) = 0
求得 θ \theta θ 的最大似然估计值,该方程称为对数似然方程.
对于连续型随机变量的情形,可以类似取似然函数
L ( θ ) = ∏ i = 1 n f ( x i ; θ ) L(\theta)=\prod_{i=1}^nf(x_i;\theta) L ( θ ) = i = 1 ∏ n f ( x i ; θ )
并按照上述方法求极大值点,进而得到最大似然估计量和估计值. 这相当于让样本观测值取到 x 1 , x 2 , ⋯ , x n x_1,x_2,\cdots,x_n x 1 , x 2 , ⋯ , x n 邻域内的概率最大.
如果含有多个未知参数,则可按照类似的方法求关于每个未知参数的偏导数,解出各个未知参数的估计量、估计值:
∂ L ( θ 1 , θ 2 , ⋯ , θ r ) ∂ θ i = 0 \dfrac{\partial L(\theta_1,\theta_2,\cdots,\theta_r)}{\partial\theta_i}=0 ∂ θ i ∂ L ( θ 1 , θ 2 , ⋯ , θ r ) = 0
或者取对数似然方程
∂ ln L ( θ 1 , θ 2 , ⋯ , θ r ) ∂ θ i = 0 \dfrac{\partial \ln L(\theta_1,\theta_2,\cdots,\theta_r)}{\partial\theta_i}=0 ∂ θ i ∂ ln L ( θ 1 , θ 2 , ⋯ , θ r ) = 0
对于未知参数 θ \theta θ 的函数 u ( θ ) u(\theta) u ( θ ) ,若已知 θ ^ \hat{\theta} θ ^ 是最大似然估计值,则 u ^ = u ( θ ^ ) \hat{u}=u(\hat{\theta}) u ^ = u ( θ ^ ) 是 u = u ( θ ) u=u(\theta) u = u ( θ ) 的最大似然估计值.
有时候题目里面的似然函数是在定义域上单调的,这时需要考虑样本的边界值,比如最大最小值.
估计量的评选标准 无偏性:设 θ ^ = θ ^ ( X 1 , X 2 , ⋯ , X n ) \hat{\theta}=\hat{\theta}(X_1,X_2,\cdots,X_n) θ ^ = θ ^ ( X 1 , X 2 , ⋯ , X n ) 是未知参数 θ \theta θ 的估计量,若 E ( θ ^ ) E(\hat{\theta}) E ( θ ^ ) 存在,且满足 E ( θ ^ ) = θ E(\hat{\theta})=\theta E ( θ ^ ) = θ ,则称 θ ^ \hat{\theta} θ ^ 是 θ \theta θ 的无偏估计(量),或 θ ^ \hat{\theta} θ ^ 作为 θ \theta θ 的估计具有无偏性. 有效性:设 θ ^ 1 = θ ^ 1 ( X 1 , X 2 , ⋯ , X n ) , θ ^ 2 = θ ^ 2 ( X 1 , X 2 , ⋯ , X n ) \hat{\theta}_1=\hat{\theta}_1(X_1,X_2,\cdots,X_n),\hat{\theta}_2=\hat{\theta}_2(X_1,X_2,\cdots,X_n) θ ^ 1 = θ ^ 1 ( X 1 , X 2 , ⋯ , X n ) , θ ^ 2 = θ ^ 2 ( X 1 , X 2 , ⋯ , X n ) 是未知参数 θ \theta θ 的两个无偏估计量,若 D ( θ ^ 1 ) < D ( θ ^ 2 ) D(\hat{\theta}_1)<D(\hat{\theta}_2) D ( θ ^ 1 ) < D ( θ ^ 2 ) ,则称 θ ^ 1 \hat{\theta}_1 θ ^ 1 比 θ ^ 2 \hat{\theta}_2 θ ^ 2 更有效. 在无偏估计中,一般认为以方差更小的为好. 一致性:设 θ ^ n = θ ^ n ( X 1 , X 2 , ⋯ , X n ) \hat{\theta}_n=\hat{\theta}_n(X_1,X_2,\cdots,X_n) θ ^ n = θ ^ n ( X 1 , X 2 , ⋯ , X n ) 是未知参数 θ \theta θ 的估计量序列,若当 n → ∞ n\to\infty n → ∞ 时,θ ^ → P θ \hat{\theta}\xrightarrow{P}\theta θ ^ P θ ,则称 θ ^ n = θ ^ n ( X 1 , X 2 , ⋯ , X n ) \hat{\theta}_n=\hat{\theta}_n(X_1,X_2,\cdots,X_n) θ ^ n = θ ^ n ( X 1 , X 2 , ⋯ , X n ) 为未知参数 θ \theta θ 的一致估计(量)或相合估计(量),也称以 θ ^ \hat{\theta} θ ^ 估计 θ \theta θ 具有一致性或相合性,即当 n n n 充分大时 θ ^ n \hat{\theta}_n θ ^ n 稳定在 θ \theta θ 的附近. 证明一致性可以使用切比雪夫不等式. 双侧区间估计 设总体 X X X 的分布中含有一个未知参数 θ \theta θ ,( X 1 , X 2 , ⋯ , X n ) (X_1,X_2,\cdots,X_n) ( X 1 , X 2 , ⋯ , X n ) 是来自总体 X X X 的样本. 如果对于给定的概率 1 − α ( 0 < α < 1 ) 1-\alpha(0<\alpha<1) 1 − α ( 0 < α < 1 ) ,存在两个统计量 θ 1 = θ 1 ( X 1 , X 2 , ⋯ , X n ) , θ 2 = θ 2 ( X 1 , X 2 , ⋯ , X n ) \theta_1=\theta_1(X_1,X_2,\cdots,X_n),\theta_2=\theta_2(X_1,X_2,\cdots,X_n) θ 1 = θ 1 ( X 1 , X 2 , ⋯ , X n ) , θ 2 = θ 2 ( X 1 , X 2 , ⋯ , X n ) ,使得 P { θ 1 < θ < θ 2 } = 1 − α P\{\theta_1<\theta<\theta_2\}=1-\alpha P { θ 1 < θ < θ 2 } = 1 − α ,则称 1 − α 1-\alpha 1 − α 为置信度或置信水平,称随机区间 ( θ 1 , θ 2 ) (\theta_1,\theta_2) ( θ 1 , θ 2 ) 为未知参数 θ \theta θ 的置信水平为 1 − α 1-\alpha 1 − α 的置信区间,分别称 θ 1 , θ 2 \theta_1,\theta_2 θ 1 , θ 2 为置信水平为 1 − α 1-\alpha 1 − α 的双侧置信区间的置信下限和置信上限. 这种估计未知参数的方法叫做区间估计.
置信水平的意义是,置信区间 ( θ 1 , θ 2 ) (\theta_1,\theta_2) ( θ 1 , θ 2 ) 包含未知变量的真值的概率为 1 − α 1-\alpha 1 − α . 对于同一个未知参数 θ \theta θ ,置信水平为 1 − α 1-\alpha 1 − α 的置信区间不唯一. 区间长度越短,估计精确度越高.
计算置信区间的一般步骤:
构造样本函数 T ( X 1 , X 2 , ⋯ , X n ; θ ) T(X_1,X_2,\cdots,X_n;\theta) T ( X 1 , X 2 , ⋯ , X n ; θ ) ,要求仅包含一个未知参数 θ \theta θ . 根据给定的置信水平和 T T T 的分布,找到两个常数 a , b a,b a , b 满足P { a < T < b } = 1 − α P\{a<T<b\}=1-\alpha P { a < T < b } = 1 − α
解不等式求出 θ \theta θ 的置信区间 以下给出一些针对正态总体的区间估计方法. 假设总体 X ∼ N ( μ , σ 2 ) X\sim N(\mu,\sigma^2) X ∼ N ( μ , σ 2 ) ,从总体中抽取样本 X 1 , X 2 , ⋯ , X n X_1,X_2,\cdots,X_n X 1 , X 2 , ⋯ , X n ,样本均值和样本方差分别为 X ˉ , S 2 \bar{X},S^2 X ˉ , S 2 ,置信水平为 1 − α 1-\alpha 1 − α .
σ 2 \sigma^2 σ 2 已知,求 μ \mu μ 的置信区间:标准正态分布 N ( 0 , 1 ) N(0,1) N ( 0 , 1 )
根据
u = X ˉ − μ σ n ∼ N ( 0 , 1 ) u=\dfrac{\bar{X}-\mu}{\sigma}\sqrt{n}\sim N(0,1) u = σ X ˉ − μ n ∼ N ( 0 , 1 )
利用正态分布的对称性,有 u α 2 = − u 1 − α 2 u_{\frac{\alpha}{2}}=-u_{1-\frac{\alpha}{2}} u 2 α = − u 1 − 2 α ,得到
P { − u α / 2 < X ˉ − μ σ n < u α / 2 } = 1 − α P\left\{-u_{\alpha/2}<\dfrac{\bar{X}-\mu}{\sigma}\sqrt{n}<u_{\alpha/2}\right\}=1-\alpha P { − u α /2 < σ X ˉ − μ n < u α /2 } = 1 − α
由于 X ˉ , σ , n \bar{X},\sigma,n X ˉ , σ , n 都是已知条件,正态分布查表可得到 u α / 2 u_{\alpha/2} u α /2 的数据,中间这一坨服从正态分布,这个概率是天然成立的,因此解不等式
− u α / 2 < X ˉ − μ σ n < u α / 2 -u_{\alpha/2}<\dfrac{\bar{X}-\mu}{\sigma}\sqrt{n}<u_{\alpha/2} − u α /2 < σ X ˉ − μ n < u α /2
即可得到 μ \mu μ 的置信区间
( X ˉ − u α / 2 σ n , X ˉ + u α / 2 σ n ) \left(\bar{X}-u_{\alpha/2}\dfrac{\sigma}{\sqrt{n}},\bar{X}+u_{\alpha/2}\dfrac{\sigma}{\sqrt{n}}\right) ( X ˉ − u α /2 n σ , X ˉ + u α /2 n σ )
该区间的长度为
l = 2 u α / 2 σ n l=2u_{\alpha/2}\dfrac{\sigma}{\sqrt{n}} l = 2 u α /2 n σ
置信水平一定的情况下,l l l 与 n \sqrt{n} n 成反比. 设 a a a 为正实数,若要使 l ≤ a l\le a l ≤ a ,则样本容量应当满足
n ≥ ( 2 u α / 2 σ a ) 2 n\ge \left(2u_{\alpha/2}\dfrac{\sigma}{a}\right)^2 n ≥ ( 2 u α /2 a σ ) 2
σ 2 \sigma^2 σ 2 未知,求 μ \mu μ 的置信区间:t ( n − 1 ) t(n-1) t ( n − 1 ) 分布
根据
t = X ˉ − μ S n ∼ t ( n − 1 ) t=\dfrac{\bar{X}-\mu}{S}\sqrt{n}\sim t(n-1) t = S X ˉ − μ n ∼ t ( n − 1 )
利用 t 分布的对称性,选取 t 分布关于原点对称的区间:
P { − t α / 2 ( n − 1 ) < X ˉ − μ S n < t α / 2 ( n − 1 ) } = 1 − α P\left\{-t_{\alpha/2}(n-1)<\dfrac{\bar{X}-\mu}{S}\sqrt{n}<t_{\alpha/2}(n-1)\right\}=1-\alpha P { − t α /2 ( n − 1 ) < S X ˉ − μ n < t α /2 ( n − 1 ) } = 1 − α
解不等式,得到 μ \mu μ 的置信区间为
( X ˉ − S n t α / 2 ( n − 1 ) , X ˉ + S n t α / 2 ( n − 1 ) ) \left(\bar{X}-\dfrac{S}{\sqrt{n}}t_{\alpha/2}(n-1),\bar{X}+\dfrac{S}{\sqrt{n}}t_{\alpha/2}(n-1)\right) ( X ˉ − n S t α /2 ( n − 1 ) , X ˉ + n S t α /2 ( n − 1 ) )
μ \mu μ 已知,求 σ 2 \sigma^2 σ 2 的置信区间:χ 2 ( n ) \chi^2(n) χ 2 ( n ) 分布
根据
χ 2 = 1 σ 2 ∑ i = 1 n ( X i − μ ) 2 ∼ χ 2 ( n ) \chi^2=\dfrac{1}{\sigma^2}\sum_{i=1}^n(X_i-\mu)^2\sim\chi^2(n) χ 2 = σ 2 1 i = 1 ∑ n ( X i − μ ) 2 ∼ χ 2 ( n )
可得关于 σ 2 \sigma^2 σ 2 的不等式
χ 1 − α 2 2 ( n ) < 1 σ 2 ∑ i = 1 n ( X i − μ ) 2 < χ α 2 2 ( n ) \chi^2_{1-\frac{\alpha}{2}}(n)<\dfrac{1}{\sigma^2}\sum_{i=1}^n(X_i-\mu)^2<\chi^2_{\frac{\alpha}{2}}(n) χ 1 − 2 α 2 ( n ) < σ 2 1 i = 1 ∑ n ( X i − μ ) 2 < χ 2 α 2 ( n )
解得置信区间为
( ∑ i = 1 n ( X i − μ ) 2 χ α 2 2 ( n ) , ∑ i = 1 n ( X i − μ ) 2 χ 1 − α 2 2 ( n ) ) \left(\dfrac{\sum\limits_{i=1}^n(X_i-\mu)^2}{\chi^2_{\frac{\alpha}{2}}(n)},\dfrac{\sum\limits_{i=1}^n(X_i-\mu)^2}{\chi^2_{1-\frac{\alpha}{2}}(n)}\right) χ 2 α 2 ( n ) i = 1 ∑ n ( X i − μ ) 2 , χ 1 − 2 α 2 ( n ) i = 1 ∑ n ( X i − μ ) 2
μ \mu μ 未知,σ 2 \sigma^2 σ 2 的置信区间:χ 2 ( n − 1 ) \chi^2(n-1) χ 2 ( n − 1 ) 分布 根据
χ 2 = ( n − 1 ) σ 2 σ 2 ∼ χ 2 ( n − 1 ) \chi^2=\dfrac{(n-1)\sigma^2}{\sigma^2}\sim\chi^2(n-1) χ 2 = σ 2 ( n − 1 ) σ 2 ∼ χ 2 ( n − 1 )
仿照上述过程得到关于 σ 2 \sigma^2 σ 2 的不等式
χ 1 − α 2 2 ( n − 1 ) < ( n − 1 ) S 2 σ 2 < χ α 2 2 ( n − 1 ) \chi^2_{1-\frac{\alpha}{2}}(n-1)<\dfrac{(n-1)S^2}{\sigma^2}<\chi^2_{\frac{\alpha}{2}}(n-1) χ 1 − 2 α 2 ( n − 1 ) < σ 2 ( n − 1 ) S 2 < χ 2 α 2 ( n − 1 )
解得置信区间为
( ( n − 1 ) S 2 χ α 2 2 ( n − 1 ) , ( n − 1 ) S 2 χ 1 − α 2 2 ( n − 1 ) ) \left(\dfrac{(n-1)S^2}{\chi^2_{\frac{\alpha}{2}}(n-1)},\dfrac{(n-1)S^2}{\chi^2_{1-\frac{\alpha}{2}}(n-1)}\right) ( χ 2 α 2 ( n − 1 ) ( n − 1 ) S 2 , χ 1 − 2 α 2 ( n − 1 ) ( n − 1 ) S 2 )
对于两个正态总体 N ( μ 1 , σ 1 2 ) , N ( μ 2 , σ 2 2 ) N(\mu_1,\sigma_1^2),N(\mu_2,\sigma_2^2) N ( μ 1 , σ 1 2 ) , N ( μ 2 , σ 2 2 ) ,分别独立地抽取样本 X 1 , X 2 , ⋯ , X n 1 X_1,X_2,\cdots,X_{n_1} X 1 , X 2 , ⋯ , X n 1 和 Y 1 , Y 2 , ⋯ , Y n 2 Y_1,Y_2,\cdots,Y_{n_2} Y 1 , Y 2 , ⋯ , Y n 2 样本均值分别为 X ˉ , Y ˉ \bar{X},\bar{Y} X ˉ , Y ˉ ,样本方差分别为 S 1 2 , S 2 2 S_1^2,S_2^2 S 1 2 , S 2 2 .
σ 1 2 , σ 2 2 \sigma_1^2,\sigma_2^2 σ 1 2 , σ 2 2 已知,求 μ 1 − μ 2 \mu_1-\mu_2 μ 1 − μ 2 的置信区间:标准正态分布 N ( 0 , 1 ) N(0,1) N ( 0 , 1 )
根据
u = X ˉ − Y ˉ − ( μ 1 − μ 2 ) σ 1 2 n 1 + σ 2 2 n 2 ∼ N ( 0 , 1 ) u=\dfrac{\bar{X}-\bar{Y}-(\mu_1-\mu_2)}{\sqrt{\dfrac{\sigma_1^2}{n_1}+\dfrac{\sigma_2^2}{n_2}}}\sim N(0,1) u = n 1 σ 1 2 + n 2 σ 2 2 X ˉ − Y ˉ − ( μ 1 − μ 2 ) ∼ N ( 0 , 1 )
得到关于 μ 1 − μ 2 \mu_1-\mu_2 μ 1 − μ 2 的不等式
− u α 2 < X ˉ − Y ˉ − ( μ 1 − μ 2 ) σ 1 2 n 1 + σ 2 2 n 2 < u α 2 -u_{\frac{\alpha}{2}}<\dfrac{\bar{X}-\bar{Y}-(\mu_1-\mu_2)}{\sqrt{\dfrac{\sigma_1^2}{n_1}+\dfrac{\sigma_2^2}{n_2}}}<u_{\frac{\alpha}{2}} − u 2 α < n 1 σ 1 2 + n 2 σ 2 2 X ˉ − Y ˉ − ( μ 1 − μ 2 ) < u 2 α
解得置信区间为
( X ˉ − Y ˉ − u α 2 σ 1 2 n 1 + σ 2 2 n 2 , X ˉ − Y ˉ + u α 2 σ 1 2 n 1 + σ 2 2 n 2 ) \left(\bar{X}-\bar{Y}-u_{\frac{\alpha}{2}}\sqrt{\dfrac{\sigma^2_1}{n_1}+\dfrac{\sigma_2^2}{n_2}},\bar{X}-\bar{Y}+u_{\frac{\alpha}{2}}\sqrt{\dfrac{\sigma^2_1}{n_1}+\dfrac{\sigma_2^2}{n_2}}\right) X ˉ − Y ˉ − u 2 α n 1 σ 1 2 + n 2 σ 2 2 , X ˉ − Y ˉ + u 2 α n 1 σ 1 2 + n 2 σ 2 2
μ 1 − μ 2 \mu_1-\mu_2 μ 1 − μ 2 的置信区间可以用来比较两个总体的均值大小. 如果置信区间下界大于0,则以置信水平 1 − α 1-\alpha 1 − α 认为 μ 1 > μ 2 \mu_1>\mu_2 μ 1 > μ 2 ;若置信区间上界小于0,则以置信水平 1 − α 1-\alpha 1 − α 认为 μ 1 < μ 2 \mu_1<\mu_2 μ 1 < μ 2 .
σ 1 2 = σ 2 2 = σ 2 \sigma_1^2=\sigma_2^2=\sigma^2 σ 1 2 = σ 2 2 = σ 2 未知,求 μ 1 − μ 2 \mu_1-\mu_2 μ 1 − μ 2 的置信区间:t ( n 1 + n 2 − 2 ) t(n_1+n_2-2) t ( n 1 + n 2 − 2 ) 分布
注意这里的两个方差是相等的. 根据
t = X ˉ − Y ˉ − ( μ 1 − μ 2 ) S W 1 n 1 + 1 n 2 ∼ t ( n 1 + n 2 − 2 ) t=\dfrac{\bar{X}-\bar{Y}-(\mu_1-\mu_2)}{S_W\sqrt{\dfrac{1}{n_1}+\dfrac{1}{n_2}}}\sim t(n_1+n_2-2) t = S W n 1 1 + n 2 1 X ˉ − Y ˉ − ( μ 1 − μ 2 ) ∼ t ( n 1 + n 2 − 2 )
其中
S W = ( n 1 − 1 ) S 1 2 + ( n 2 − 1 ) S 2 2 n 1 + n 2 − 2 S_W=\sqrt{\dfrac{(n_1-1)S_1^2+(n_2-1)S_2^2}{n_1+n_2-2}} S W = n 1 + n 2 − 2 ( n 1 − 1 ) S 1 2 + ( n 2 − 1 ) S 2 2
得到关于 μ 1 − μ 2 \mu_1-\mu_2 μ 1 − μ 2 的不等式
− t α 2 ( n 1 + n 2 − 2 ) < X ˉ − Y ˉ − ( μ 1 − μ 2 ) S W 1 n 1 + 1 n 2 < t α 2 ( n 1 + n 2 − 2 ) -t_{\frac{\alpha}{2}}(n_1+n_2-2)<\dfrac{\bar{X}-\bar{Y}-(\mu_1-\mu_2)}{S_W\sqrt{\dfrac{1}{n_1}+\dfrac{1}{n_2}}}<t_{\frac{\alpha}{2}}(n_1+n_2-2) − t 2 α ( n 1 + n 2 − 2 ) < S W n 1 1 + n 2 1 X ˉ − Y ˉ − ( μ 1 − μ 2 ) < t 2 α ( n 1 + n 2 − 2 )
解得置信区间为
( X ˉ − Y ˉ − t α 2 ( n 1 + n 2 − 2 ) S W 1 n 1 + 1 n 2 , X ˉ − Y ˉ + t α 2 ( n 1 + n 2 − 2 ) S W 1 n 1 + 1 n 2 ) \left(\bar{X}-\bar{Y}-t_{\frac{\alpha}{2}}(n_1+n_2-2)S_W\sqrt{\dfrac{1}{n_1}+\dfrac{1}{n_2}},\bar{X}-\bar{Y}+t_{\frac{\alpha}{2}}(n_1+n_2-2)S_W\sqrt{\dfrac{1}{n_1}+\dfrac{1}{n_2}}\right) ( X ˉ − Y ˉ − t 2 α ( n 1 + n 2 − 2 ) S W n 1 1 + n 2 1 , X ˉ − Y ˉ + t 2 α ( n 1 + n 2 − 2 ) S W n 1 1 + n 2 1 )
已知 μ 1 , μ 2 \mu_1,\mu_2 μ 1 , μ 2 ,求 σ 1 2 σ 2 2 \dfrac{\sigma_1^2}{\sigma_2^2} σ 2 2 σ 1 2 的置信区间:F ( n 1 , n 2 ) F(n_1,n_2) F ( n 1 , n 2 ) 分布
利用 F F F 分布解答双侧区间估计问题时,常利用 F 1 − α ( n 1 , n 2 ) = 1 / F α ( n 2 , n 1 ) F_{1-\alpha}(n_1,n_2)=1/F_{\alpha}(n_2,n_1) F 1 − α ( n 1 , n 2 ) = 1/ F α ( n 2 , n 1 ) 这一性质. 根据
F = n 2 n 1 ⋅ σ 2 2 σ 1 2 ⋅ ∑ i = 1 n 1 ( X i − μ 1 ) 2 ∑ i = 1 n 2 ( Y i − μ 1 ) 2 ∼ F ( n 1 , n 2 ) F=\dfrac{n_2}{n_1}\cdot\dfrac{\sigma_2^2}{\sigma_1^2}\cdot\dfrac{\sum\limits_{i=1}^{n_1}(X_i-\mu_1)^2}{\sum\limits_{i=1}^{n_2}(Y_i-\mu_1)^2}\sim F(n_1,n_2) F = n 1 n 2 ⋅ σ 1 2 σ 2 2 ⋅ i = 1 ∑ n 2 ( Y i − μ 1 ) 2 i = 1 ∑ n 1 ( X i − μ 1 ) 2 ∼ F ( n 1 , n 2 )
得到关于 σ 1 2 σ 2 2 \dfrac{\sigma_1^2}{\sigma_2^2} σ 2 2 σ 1 2 的不等式
F 1 − α 2 ( n 1 , n 2 ) < n 2 n 1 ⋅ σ 2 2 σ 1 2 ⋅ ∑ i = 1 n 1 ( X i − μ 1 ) 2 ∑ i = 1 n 2 ( Y i − μ 1 ) 2 < F α 2 ( n 1 , n 2 ) F_{1-\frac{\alpha}{2}}(n_1,n_2) < \dfrac{n_2}{n_1}\cdot\dfrac{\sigma_2^2}{\sigma_1^2}\cdot\dfrac{\sum\limits_{i=1}^{n_1}(X_i-\mu_1)^2}{\sum\limits_{i=1}^{n_2}(Y_i-\mu_1)^2} < F_{\frac{\alpha}{2}}(n_1,n_2) F 1 − 2 α ( n 1 , n 2 ) < n 1 n 2 ⋅ σ 1 2 σ 2 2 ⋅ i = 1 ∑ n 2 ( Y i − μ 1 ) 2 i = 1 ∑ n 1 ( X i − μ 1 ) 2 < F 2 α ( n 1 , n 2 )
等价于
σ 1 2 σ 2 2 < n 2 ∑ i = 1 n 1 ( X i − μ 1 ) 2 n 1 ∑ i = 1 n 2 ( Y i − μ 1 ) 2 F α 2 ( n 2 , n 1 ) \dfrac{\sigma_1^2}{\sigma_2^2} < \dfrac{n_2\sum\limits_{i=1}^{n_1}(X_i-\mu_1)^2}{n_1\sum\limits_{i=1}^{n_2}(Y_i-\mu_1)^2}F_{\frac{\alpha}{2}}(n_2,n_1) σ 2 2 σ 1 2 < n 1 i = 1 ∑ n 2 ( Y i − μ 1 ) 2 n 2 i = 1 ∑ n 1 ( X i − μ 1 ) 2 F 2 α ( n 2 , n 1 )
σ 1 2 σ 2 2 > n 2 ∑ i = 1 n 1 ( X i − μ 1 ) 2 n 1 ∑ i = 1 n 2 ( Y i − μ 1 ) 2 ⋅ 1 F α 2 ( n 1 , n 2 ) \dfrac{\sigma_1^2}{\sigma_2^2} > \dfrac{n_2\sum\limits_{i=1}^{n_1}(X_i-\mu_1)^2}{n_1\sum\limits_{i=1}^{n_2}(Y_i-\mu_1)^2}\cdot \dfrac{1}{F_{\frac{\alpha}{2}}(n_1,n_2)} σ 2 2 σ 1 2 > n 1 i = 1 ∑ n 2 ( Y i − μ 1 ) 2 n 2 i = 1 ∑ n 1 ( X i − μ 1 ) 2 ⋅ F 2 α ( n 1 , n 2 ) 1
即其置信区间为
( n 2 ∑ i = 1 n 1 ( X i − μ 1 ) 2 n 1 ∑ i = 1 n 2 ( Y i − μ 1 ) 2 ⋅ 1 F α 2 ( n 1 , n 2 ) , n 2 ∑ i = 1 n 1 ( X i − μ 1 ) 2 n 1 ∑ i = 1 n 2 ( Y i − μ 1 ) 2 F α 2 ( n 2 , n 1 ) ) \left(\dfrac{n_2\sum\limits_{i=1}^{n_1}(X_i-\mu_1)^2}{n_1\sum\limits_{i=1}^{n_2}(Y_i-\mu_1)^2}\cdot \dfrac{1}{F_{\frac{\alpha}{2}}(n_1,n_2)},\dfrac{n_2\sum\limits_{i=1}^{n_1}(X_i-\mu_1)^2}{n_1\sum\limits_{i=1}^{n_2}(Y_i-\mu_1)^2}F_{\frac{\alpha}{2}}\textcolor{red}{(n_2,n_1)}\right) n 1 i = 1 ∑ n 2 ( Y i − μ 1 ) 2 n 2 i = 1 ∑ n 1 ( X i − μ 1 ) 2 ⋅ F 2 α ( n 1 , n 2 ) 1 , n 1 i = 1 ∑ n 2 ( Y i − μ 1 ) 2 n 2 i = 1 ∑ n 1 ( X i − μ 1 ) 2 F 2 α ( n 2 , n 1 )
μ 1 , μ 2 \mu_1,\mu_2 μ 1 , μ 2 未知,求 σ 1 2 σ 2 2 \dfrac{\sigma_1^2}{\sigma_2^2} σ 2 2 σ 1 2 的置信区间:F ( n 1 − 1 , n 2 − 1 ) F(n_1-1,n_2-1) F ( n 1 − 1 , n 2 − 1 ) 分布
根据
F = σ 2 2 σ 1 2 ⋅ S 1 2 S 2 2 ∼ F ( n 1 − 1 , n 2 − 2 ) F=\dfrac{\sigma_2^2}{\sigma_1^2}\cdot\dfrac{S_1^2}{S_2^2}\sim F(n_1-1,n_2-2) F = σ 1 2 σ 2 2 ⋅ S 2 2 S 1 2 ∼ F ( n 1 − 1 , n 2 − 2 )
可得关于 σ 1 2 σ 2 2 \dfrac{\sigma_1^2}{\sigma_2^2} σ 2 2 σ 1 2 的不等式
F 1 − α 2 ( n 1 − 1 , n 2 − 2 ) < σ 2 2 σ 1 2 ⋅ S 1 2 S 2 2 < F α 2 ( n 1 − 1 , n 2 − 2 ) F_{1-\frac{\alpha}{2}}(n_1-1,n_2-2)<\dfrac{\sigma_2^2}{\sigma_1^2}\cdot\dfrac{S_1^2}{S_2^2}<F_{\frac{\alpha}{2}}(n_1-1,n_2-2) F 1 − 2 α ( n 1 − 1 , n 2 − 2 ) < σ 1 2 σ 2 2 ⋅ S 2 2 S 1 2 < F 2 α ( n 1 − 1 , n 2 − 2 )
解得置信区间为
( S 1 2 S 2 2 ⋅ 1 F α 2 ( n 1 − 1 , n 2 − 2 ) , S 1 2 S 2 2 ⋅ F α 2 ( n 2 − 1 , n 1 − 2 ) ) \left(\dfrac{S_1^2}{S_2^2}\cdot\dfrac{1}{F_{\frac{\alpha}{2}}(n_1-1,n_2-2)},\dfrac{S_1^2}{S_2^2}\cdot F_{\frac{\alpha}{2}}\textcolor{red}{(n_2-1,n_1-2)}\right) ( S 2 2 S 1 2 ⋅ F 2 α ( n 1 − 1 , n 2 − 2 ) 1 , S 2 2 S 1 2 ⋅ F 2 α ( n 2 − 1 , n 1 − 2 ) )
如果 σ 1 2 σ 2 2 \dfrac{\sigma_1^2}{\sigma_2^2} σ 2 2 σ 1 2 的置信区间下限大于1,则以置信水平 1 − α 1-\alpha 1 − α 认为 σ 1 2 > σ 2 2 \sigma_1^2>\sigma_2^2 σ 1 2 > σ 2 2 ; 若 σ 1 2 σ 2 2 \dfrac{\sigma_1^2}{\sigma_2^2} σ 2 2 σ 1 2 的置信区间上限小于1,则以置信水平 1 − α 1-\alpha 1 − α 认为 σ 1 2 > σ 2 2 \sigma_1^2>\sigma_2^2 σ 1 2 > σ 2 2 .
单侧区间估计 需要求得未知参数的上/下限,而不关心另一个边界值时,可以用单侧区间估计来计算所需的边界值. 设总体 X X X 的分布中含有未知参数 θ \theta θ ,从总体 X X X 中抽取样本 X 1 , X 2 , ⋯ , X n X_1,X_2,\cdots,X_n X 1 , X 2 , ⋯ , X n ,对于给定的概率 1 − α ( 0 < α < 1 ) 1-\alpha(0<\alpha<1) 1 − α ( 0 < α < 1 ) :
如果统计量 θ 1 = θ 1 ( X 1 , X 2 , ⋯ , X n ) \theta_1=\theta_1(X_1,X_2,\cdots,X_n) θ 1 = θ 1 ( X 1 , X 2 , ⋯ , X n ) 满足 P { θ > θ 1 } = 1 − α P\{\theta>\theta_1\}=1-\alpha P { θ > θ 1 } = 1 − α ,则称随机区间 ( θ 1 , + ∞ ) (\theta_1,+\infty) ( θ 1 , + ∞ ) 为置信水平为 1 − α 1-\alpha 1 − α 的单侧置信区间,θ 1 \theta_1 θ 1 称为 θ \theta θ 的置信水平为 1 − α 1-\alpha 1 − α 的单侧置信下限. 如果统计量 θ 2 = θ 2 ( X 1 , X 2 , ⋯ , X n ) \theta_2=\theta_2(X_1,X_2,\cdots,X_n) θ 2 = θ 2 ( X 1 , X 2 , ⋯ , X n ) 满足 P { θ < θ 2 } = 1 − α P\{\theta<\theta_2\}=1-\alpha P { θ < θ 2 } = 1 − α ,则称随机区间 ( − ∞ , θ 2 ) (-\infty,\theta_2) ( − ∞ , θ 2 ) 为置信水平为 1 − α 1-\alpha 1 − α 的单侧置信区间,θ 2 \theta_2 θ 2 称为 θ \theta θ 的置信水平为 1 − α 1-\alpha 1 − α 的单侧置信上限. 实际上还是利用标准正态分布和三大分布的那几个统计量,只不过把需要解的不等式换成单侧的而已. 例如:
设总体 X ∼ N ( μ , σ 2 ) X\sim N(\mu,\sigma^2) X ∼ N ( μ , σ 2 ) ,X X X 的均值和方差 μ , σ 2 \mu,\sigma^2 μ , σ 2 都存在但未知. 从总体中抽取样本 X 1 , X 2 , ⋯ , X n X_1,X_2,\cdots,X_n X 1 , X 2 , ⋯ , X n ,对于给定的置信水平 1 − α 1-\alpha 1 − α :
求未知参数 μ \mu μ 的置信水平下限. 根据t = X ˉ − μ S n ∼ t ( n − 1 ) t=\dfrac{\bar{X}-\mu}{S}\sqrt{n}\sim t(n-1) t = S X ˉ − μ n ∼ t ( n − 1 )
可得不等式X ˉ − μ S n < t α ( n − 1 ) \dfrac{\bar{X}-\mu}{S}\sqrt{n}<t_\alpha(n-1) S X ˉ − μ n < t α ( n − 1 )
解得置信区间为( X ˉ − S n t α ( n − 1 ) , + ∞ ) \left(\bar{X}-\dfrac{S}{\sqrt{n}}t_\alpha(n-1),+\infty\right) ( X ˉ − n S t α ( n − 1 ) , + ∞ )
即置信区间下限为μ 1 = X ˉ − S n t α ( n − 1 ) \mu_1=\bar{X}-\dfrac{S}{\sqrt{n}}t_\alpha(n-1) μ 1 = X ˉ − n S t α ( n − 1 )
求未知参数 σ 2 \sigma^2 σ 2 的置信水平上限. 根据χ 2 = ( n − 1 ) S 2 σ 2 ∼ χ 2 ( n − 1 ) \chi^2=\dfrac{(n-1)S^2}{\sigma^2}\sim\chi^2(n-1) χ 2 = σ 2 ( n − 1 ) S 2 ∼ χ 2 ( n − 1 )
列出不等式( n − 1 ) S 2 σ 2 > χ 1 − α 2 ( n − 1 ) \dfrac{(n-1)S^2}{\sigma^2}>\chi_{1-\alpha}^2(n-1) σ 2 ( n − 1 ) S 2 > χ 1 − α 2 ( n − 1 )
解得置信区间为( 0 , ( n − 1 ) S 2 χ 1 − α 2 ( n − 1 ) ) \left(0,\dfrac{(n-1)S^2}{\chi^2_{1-\alpha}(n-1)}\right) ( 0 , χ 1 − α 2 ( n − 1 ) ( n − 1 ) S 2 )
即所求置信区间上限为σ 2 2 = ( n − 1 ) S 2 χ 1 − α 2 ( n − 1 ) \sigma_2^2=\dfrac{(n-1)S^2}{\chi^2_{1-\alpha}(n-1)} σ 2 2 = χ 1 − α 2 ( n − 1 ) ( n − 1 ) S 2
假设检验