注意
本文是猫娘学习概率论与数理统计的笔记,整理了吉林大学数学学院《随机数学》、茆诗松《概率论与数理统计教程》两本教材和知乎上的有关内容,有很多超出校内考试范围的内容,可能不适合期末考试复习。
随机事件及其概率 随机试验 必然现象与随机现象:在一定条件下必然出现的现象是必然现象,相同的条件下可能出现不同的结果,而在试验前无法预测结果的现象是随机现象。 随机现象在观测前不能确定其结果,是随机现象的随机性;大量重复试验后随机现象的结果表现出某种规律性,这叫做随机现象的统计规律性。 随机事件的特点: 可重复性,试验可以在相同条件下重复进行多次 可观测性:每次试验的所有可能结果都是明确的、可观测的,可能结果有至少两个 随机性:每次试验的结果是不确定的,实验前无法确定会出现哪一个结果 随机事件通常用字母 E E E 表示,随机事件的基本结果称为样本点,用 ω \omega ω 表示,所有基本结果的集合称为样本空间 Ω = { ω } \varOmega=\{\omega\} Ω = { ω } 随机事件 随机试验 E E E 的样本空间 Ω \varOmega Ω 的子集称为随机事件,简称事件,用大写字母 A , B , C ⋯ A,B,C\cdots A , B , C ⋯ 表示。 设事件 A ⊂ Ω A\sub \varOmega A ⊂ Ω ,如果某次试验的结果 ω ∈ Ω \omega \in \varOmega ω ∈ Ω ,则称为事件 A A A 发生,否则称为不发生。 只有一个样本点的事件称为基本事件,样本空间成为必然事件,空集称为不可能事件。 样本空间可以按照样本点的数量,分为有限样本空间和无限样本空间两类。 事件的关系 包含:事件 A A A 发生时,事件 B B B 一定发生,则称为事件 B B B 包含事件 A A A ,记作 A ⊂ B A\sub B A ⊂ B . 对于任意事件都有 ∅ ⊂ A ⊂ Ω \emptyset\sub A \sub \varOmega ∅ ⊂ A ⊂ Ω . 如果 A ⊂ B , B ⊂ C A\sub B,B\sub C A ⊂ B , B ⊂ C ,则 A ⊂ C A\sub C A ⊂ C . 相等:如果事件 A A A 和事件 B B B 相互包含,即 A ⊂ B , B ⊂ A A\sub B,B\sub A A ⊂ B , B ⊂ A ,则称为事件 A A A 与事件 B B B 相等,记作 A = B A=B A = B . 这表明两个事件是样本空间的同一个子集,实际上二者是同一个事件。 互斥:事件 A , B A,B A , B 在一次试验中不能同时发生,则称 A , B A,B A , B 互不相容,或者互斥。 互逆:每次试验中,A A A 和 B B B 两个事件必有一个且仅有一个发生,则称两个事件是互逆的(或者对立的),称其中一个事件是另一个事件的逆事件,记作 A ˉ = B \bar{A}=B A ˉ = B ,或者 B ˉ = A \bar{B}=A B ˉ = A 。 显然有 A ‾ ‾ = A \overline{\overline{A}}=A A = A . 互逆的事件在样本空间中互为补集。 事件的运算 并运算:事件A , B A,B A , B 至少有一个发生,这样一个事件称为A , B A,B A , B 的和事件或交事件,记作 A ∪ B A\cup B A ∪ B . A ∪ B = { ω ∣ ω ∈ A 或 ω ∈ B } A\cup B=\{\omega|\omega\in A \text{或} \omega\in B\} A ∪ B = { ω ∣ ω ∈ A 或 ω ∈ B } A ∪ A = A , A ∪ ∅ = A , A ∪ B = B ∪ A , A ∪ A ˉ = Ω , A ⊂ A ∪ B , B ⊂ A ∪ B A\cup A=A,A\cup \emptyset=A,A\cup B=B\cup A,A\cup \bar{A}=\varOmega,A\sub A\cup B,B\sub A\cup B A ∪ A = A , A ∪ ∅ = A , A ∪ B = B ∪ A , A ∪ A ˉ = Ω , A ⊂ A ∪ B , B ⊂ A ∪ B 如果 A ⊂ B A\sub B A ⊂ B ,则A ∪ B = B A\cup B=B A ∪ B = B 并运算可以推广到多个、无穷多个事件 ⋃ i = 1 n A i = { 事件 A 1 , A 2 , ⋯ , A n 至少有一个发生 } \bigcup_{i=1}^nA_i=\{\text{事件}A_1,A_2,\cdots,A_n\text{至少有一个发生}\} i = 1 ⋃ n A i = { 事件 A 1 , A 2 , ⋯ , A n 至少有一个发生 }
⋃ i = 1 ∞ A i = { A 1 , A 2 , ⋯ , A n , ⋯ 至少有一个发生 } \bigcup_{i=1}^{\infty}A_i=\{A_1,A_2,\cdots,A_n,\cdots\text{至少有一个发生}\} i = 1 ⋃ ∞ A i = { A 1 , A 2 , ⋯ , A n , ⋯ 至少有一个发生 }
交运算:如果事件 A , B A,B A , B 同时发生,则这样的一个事件称为 A , B A,B A , B 的交事件(或者积事件),记作 A ∩ B A\cap B A ∩ B 或者 A B AB A B . A ∩ B = { ω ∣ ω ∈ A 且 ω ∈ B } A\cap B=\{\omega|\omega\in A\ \text{且}\ \omega \in B\} A ∩ B = { ω ∣ ω ∈ A 且 ω ∈ B } A ∩ A = A , A ∩ ∅ = A , A ∩ B = B ∩ A , A ∩ A ˉ = ∅ , A ∩ B ⊂ A , A ∩ B ⊂ B A\cap A=A,A\cap \emptyset=A,A\cap B=B\cap A,A\cap \bar{A}=\emptyset,A\cap B\sub A,A\cap B\sub B A ∩ A = A , A ∩ ∅ = A , A ∩ B = B ∩ A , A ∩ A ˉ = ∅ , A ∩ B ⊂ A , A ∩ B ⊂ B 如果 A ⊂ B A\sub B A ⊂ B ,则有 A ∩ B = A A\cap B=A A ∩ B = A . 如果 A , B A,B A , B 互不相容,则 A ∩ B = ∅ A\cap B = \emptyset A ∩ B = ∅ . 交运算同样可以推广到多个集合甚至无穷多个事件 ⋂ i = 1 n A i = { 事件 A 1 , A 2 , ⋯ , A n 同时发生 } \bigcap_{i=1}^nA_i=\{\text{事件}A_1,A_2,\cdots,A_n\text{同时发生}\} i = 1 ⋂ n A i = { 事件 A 1 , A 2 , ⋯ , A n 同时发生 }
⋂ i = 1 ∞ A i = { 事件 A 1 , A 2 , ⋯ , A n , ⋯ 同时发生 } \bigcap_{i=1}^\infty A_i=\{\text{事件}A_1,A_2,\cdots,A_n,\cdots\text{同时发生}\} i = 1 ⋂ ∞ A i = { 事件 A 1 , A 2 , ⋯ , A n , ⋯ 同时发生 }
差运算:如果事件A A A 发生而B B B 不发生,则这样的事件称为 A A A 与 B B B 的差事件,记作 A − B A-B A − B . A − B = { ω ∣ ω ∈ A 且 ω ∉ B } A-B=\{\omega|\omega\in A\ \text{且}\ \omega \notin B\} A − B = { ω ∣ ω ∈ A 且 ω ∈ / B } A − A = ∅ , A − ∅ = A , A − B = A − A B = A B ˉ , Ω − A = A ˉ , A − Ω = ∅ , ( A − B ) ∪ B = A ∪ B A-A=\emptyset,A-\emptyset=A,A-B=A-AB=A\bar{B},\varOmega-A=\bar{A},A-\varOmega=\emptyset,(A-B)\cup B=A\cup B A − A = ∅ , A − ∅ = A , A − B = A − A B = A B ˉ , Ω − A = A ˉ , A − Ω = ∅ , ( A − B ) ∪ B = A ∪ B 事件运算的运算律 交换律:A ∪ B = B ∪ A , A B = B A A\cup B=B\cup A,AB=BA A ∪ B = B ∪ A , A B = B A 结合律:( A ∪ B ) ∪ C = A ∪ ( B ∪ C ) , ( A B ) C = A ( B C ) (A\cup B)\cup C=A\cup(B \cup C),(AB)C=A(BC) ( A ∪ B ) ∪ C = A ∪ ( B ∪ C ) , ( A B ) C = A ( B C ) 分配律:A ( B ∪ C ) = ( A B ) ∪ ( A C ) , A ∪ ( B C ) = ( A ∪ B ) ( A ∪ C ) A(B\cup C)=(AB)\cup (AC),A\cup (BC)=(A\cup B)(A\cup C) A ( B ∪ C ) = ( A B ) ∪ ( A C ) , A ∪ ( B C ) = ( A ∪ B ) ( A ∪ C ) 对偶律(德摩根律):A ∪ B ‾ = A ˉ B ˉ , A B ‾ = A ˉ ∪ B ˉ \overline{A\cup B}=\bar{A}\bar{B},\overline{AB}=\bar{A}\cup \bar{B} A ∪ B = A ˉ B ˉ , A B = A ˉ ∪ B ˉ 随机事件的概率 频率:在相同条件下进行的 n n n 次试验中,事件 A A A 发生了 n A n_A n A 次,称 n A n_A n A 是事件 A A A 发生的频数,比值 f n ( A ) = n A n f_n(A)=\dfrac{n_A}{n} f n ( A ) = n n A 是事件 A A A 发生的频率.
非负性:∀ A , f n ( A ) ≥ 0 \forall A,f_n(A)\ge 0 ∀ A , f n ( A ) ≥ 0 规范性:f n ( Ω ) = 1 f_n(\varOmega)=1 f n ( Ω ) = 1 有限可加性:两两互不相容的事件 A i , A 2 , ⋯ , A m A_i,A_2,\cdots,A_m A i , A 2 , ⋯ , A m 满足 f n ( ⋃ i = 1 m A i ) = ∑ i = 1 m f n ( A i ) f_n\left(\bigcup\limits_{i=1}^mA_i\right)=\sum\limits_{i=1}^mf_n(A_i) f n ( i = 1 ⋃ m A i ) = i = 1 ∑ m f n ( A i ) 由于试验结果具有随机性,频率也是具有随机性的,当 n n n 较小时波动性较大. 相同条件下重复进行 n n n 次试验,当 n n n 增大时事件 A A A 发生的频率呈现稳定性,逐渐趋向于某个常数 p p p . 常数 p p p 表示事件 A A A 发生的可能性大小,称为事件 A A A 的概率,记作 P ( A ) P(A) P ( A ) . 当 n n n 很大时,可以用频率 f n ( A ) f_n(A) f n ( A ) 作为 概率的近似值. 概率的定义:设随机事件 E E E 的样本空间为 Ω \varOmega Ω ,如果对于 E E E 的每一个事件 A A A ,都有唯一实数 P ( A ) P(A) P ( A ) 与之对应,且事件的函数 P ( A ) P(A) P ( A ) 满足以下条件:
非负性:∀ A , P ( A ) ≥ 0 \forall A,P(A)\ge 0 ∀ A , P ( A ) ≥ 0 规范性:P ( Ω ) = 1 P(\varOmega)=1 P ( Ω ) = 1 可列可加性:对于两两互不相容的事件A 1 , A 2 , ⋯ A_1,A_2,\cdots A 1 , A 2 , ⋯ 有 P ( ⋃ i = 1 ∞ A i ) = ∑ i = 1 ∞ P ( A i ) P\left(\bigcup\limits_{i=1}^{\infty}A_i\right)=\sum\limits_{i=1}^{\infty}P(A_i) P ( i = 1 ⋃ ∞ A i ) = i = 1 ∑ ∞ P ( A i ) 则称 P ( A ) P(A) P ( A ) 为事件 A A A 的概率.
概率的性质
P ( ∅ ) = 0 P(\emptyset)=0 P ( ∅ ) = 0 有限可加性:对于两两互不相容的事件 A 1 , A 2 , ⋯ , A n A_1,A_2,\cdots,A_n A 1 , A 2 , ⋯ , A n ,有P ( ⋃ i = 1 n A i ) = ∑ i = 1 n P ( A i ) P\left(\bigcup\limits_{i=1}^{n}A_i\right)=\sum\limits_{i=1}^{n}P(A_i) P ( i = 1 ⋃ n A i ) = i = 1 ∑ n P ( A i ) 对于任一事件 A A A ,有 P ( A ˉ ) = 1 − P ( A ) P(\bar{A})=1-P(A) P ( A ˉ ) = 1 − P ( A ) 如果 A ⊂ B A\sub B A ⊂ B ,那么 P ( B − A ) = P ( B ) − P ( A ) , P ( A ) ≤ P ( B ) P(B-A)=P(B)-P(A),P(A)\le P(B) P ( B − A ) = P ( B ) − P ( A ) , P ( A ) ≤ P ( B ) 对于任意事件 A A A ,P ( A ) ≤ 1 P(A)\le 1 P ( A ) ≤ 1 减法公式 :对于任意两个事件 A , B A,B A , B ,有 P ( B − A ) = P ( B ) − P ( A B ) P(B-A)=P(B)-P(AB) P ( B − A ) = P ( B ) − P ( A B ) 加法公式 :对于任意两个事件 A , B A,B A , B ,有 P ( A ∪ B ) = P ( A ) + P ( B ) − P ( A B ) P(A\cup B)=P(A)+P(B)-P(AB) P ( A ∪ B ) = P ( A ) + P ( B ) − P ( A B ) ,且 P ( A ∪ B ) ≤ P ( A ) + P ( B ) P(A\cup B)\le P(A)+P(B) P ( A ∪ B ) ≤ P ( A ) + P ( B ) 一般加法公式 :加法公式可以推广到任意有限个事件的情形. 设 A 1 , A 2 , ⋯ , A n A_1,A_2,\cdots,A_n A 1 , A 2 , ⋯ , A n 是 n n n 个随机事件,则P ( ⋃ i = 1 n A i ) = ∑ i = 1 n P ( A i ) − ∑ 1 ≤ i < j ≤ n P ( A i A j ) + ∑ 1 ≤ i < j < k ≤ n P ( A i A j A k ) + ⋯ + ( − 1 ) n − 1 P ( A 1 A 2 ⋯ A n ) P\left(\bigcup_{i=1}^{n}A_i\right)=\sum_{i=1}^{n}P(A_i)-\sum_{1\le i<j\le n}P(A_iA_j)+\sum_{1\le i<j<k\le n}P(A_iA_jA_k)+\cdots+(-1)^{n-1}P(A_1A_2\cdots A_n) P ( i = 1 ⋃ n A i ) = i = 1 ∑ n P ( A i ) − 1 ≤ i < j ≤ n ∑ P ( A i A j ) + 1 ≤ i < j < k ≤ n ∑ P ( A i A j A k ) + ⋯ + ( − 1 ) n − 1 P ( A 1 A 2 ⋯ A n )
古典概型 古典概型的定义:如果随机试验具有以下特点,则这种试验称为古典概型(或者等可能概型) 试验的样本空间只包括有限个样本点 试验中每个基本事件发生的概率相同 设 Ω \varOmega Ω 是样本空间,A A A 为随机事件,则 P ( A ) = ∣ A ∣ ∣ Ω ∣ P(A)=\dfrac{|A|}{|\varOmega|} P ( A ) = ∣ Ω ∣ ∣ A ∣ 几何概型 几何概型的定义特点 P ( A ) = A 的度量值 Ω 的度量值 P(A)=\dfrac{A\text{的度量值}}{\varOmega \text{的度量值}} P ( A ) = Ω 的度量值 A 的度量值 条件概率 事件的独立性 同一试验中的 A , B A,B A , B 两个事件,若 P ( A ) ≠ 0 P(A)\neq0 P ( A ) = 0 ,则条件概率 P ( B ∣ A ) P(B|A) P ( B ∣ A ) 可能等于 P ( B ) P(B) P ( B ) ,也可能不等于. 若 P ( A B ) = P ( A ) P ( B ) P(AB)=P(A)P(B) P ( A B ) = P ( A ) P ( B ) ,则事件 A A A 和事件 B B B 是独立的. (2021·新高考一卷,8) 若 P ( A ) > 0 P(A)>0 P ( A ) > 0 ,则 A A A 与 B B B 相互独立的充分必要条件是 P ( B ∣ A ) = P ( B ) P(B|A)=P(B) P ( B ∣ A ) = P ( B ) ;同理,若 P ( B ) > 0 P(B)>0 P ( B ) > 0 ,则 B B B 与 A A A 相互独立的充分必要条件是 P ( A ∣ B ) = P ( A ) P(A|B)=P(A) P ( A ∣ B ) = P ( A ) . 若 A , B A,B A , B 相互独立,则 A , B ˉ A,\bar{B} A , B ˉ 、A ˉ , B \bar{A},B A ˉ , B 、A ˉ , B ˉ \bar{A},\bar{B} A ˉ , B ˉ 也相互独立. 三个事件的两两相互独立:若同一个随机试验 E E E 的三个事件 A , B , C A,B,C A , B , C 满足 P ( A B ) = P ( A ) P ( B ) , P ( A C ) = P ( A ) P ( C ) , P ( B C ) = P ( B ) P ( C ) P(AB)=P(A)P(B),P(AC)=P(A)P(C),P(BC)=P(B)P(C) P ( A B ) = P ( A ) P ( B ) , P ( A C ) = P ( A ) P ( C ) , P ( B C ) = P ( B ) P ( C ) ,则称 A , B , C A,B,C A , B , C 两两相互独立. 三个事件的相互独立:如果三个事件 A , B , C A,B,C A , B , C 两两相互独立,且 P ( A B C ) = P ( A ) P ( B ) P ( C ) P(ABC)=P(A)P(B)P(C) P ( A B C ) = P ( A ) P ( B ) P ( C ) ,则称三个事件 A , B , C A,B,C A , B , C 是相互独立的. 三个事件相互独立 是 三个事件两两相互独立 的充分不必要条件。 n n n 个事件的相互独立:设 A 1 , A 2 , ⋯ , A n A_1,A_2,\cdots,A_n A 1 , A 2 , ⋯ , A n 是同一个试验 E E E 的 n n n 个事件,如果对于任意正整数 k k k ,n n n 个事件中的任意 k k k 个事件 A i 1 , A i 2 , ⋯ , A i k ( 2 ≤ k ≤ n ) A_{i_1},A_{i_2},\cdots,A_{i_k}(2\le k \le n) A i 1 , A i 2 , ⋯ , A i k ( 2 ≤ k ≤ n ) 都有等式 P ( A i 1 A i 2 ⋯ A i k ) = P ( A i 1 ) P ( A i 2 ) ⋯ P ( A i k ) P(A_{i_1}A_{i_2}\cdots A_{i_k})=P(A_{i_1})P(A_{i_2})\cdots P(A_{i_k}) P ( A i 1 A i 2 ⋯ A i k ) = P ( A i 1 ) P ( A i 2 ) ⋯ P ( A i k ) ,则称这 n n n 个事件是相互独立的. 也就是说,证明 n n n 个事件 A i , A 2 , ⋯ , A n A_i,A_2,\cdots,A_n A i , A 2 , ⋯ , A n 相互独立,需要证明对于任意 2 ≤ k ≤ n 2\le k \le n 2 ≤ k ≤ n ,在这 n n n 个事件中选择任意 k k k 个事件,这 k k k 个事件都相互独立. 因此,证明 n n n 个事件相互独立,需要证明 ∑ i = 2 n ( n i ) \sum\limits_{i=2}^n\binom{n}{i} i = 2 ∑ n ( i n ) 个等式.(注:( n i ) = C n i \binom{n}{i}=\text{C}_n^i ( i n ) = C n i 都是组合数符号) 若已知 A 1 , A 2 , ⋯ , A n A_1,A_2,\cdots,A_n A 1 , A 2 , ⋯ , A n 相互独立,将其中任意 k ( 2 ≤ k ≤ n ) k(2\le k \le n) k ( 2 ≤ k ≤ n ) 个事件替换成其对应的逆事件,仍然满足独立性. 若 A 1 , A 2 , ⋯ , A n A_1,A_2,\cdots,A_n A 1 , A 2 , ⋯ , A n 相互独立,则有 P ( A 1 A 2 ⋯ A n ) = ∏ i = 1 n P ( A i ) P(A_1A_2\cdots A_n)=\prod\limits_{i=1}^n P(A_i) P ( A 1 A 2 ⋯ A n ) = i = 1 ∏ n P ( A i )
P ( A 1 ∪ A 2 ∪ ⋯ ∪ A n ) = 1 − P ( A 1 ∪ A 2 ∪ ⋯ ∪ A n ‾ ) = 1 − P ( A 1 ˉ A 2 ˉ ⋯ A n ˉ ) = 1 − ∏ i = 1 n P ( A i ˉ ) P(A_1\cup A_2\cup\cdots\cup A_n)=1-P(\overline{A_1\cup A_2\cup\cdots\cup A_n})=1-P(\bar{A_1}\bar{A_2}\cdots\bar{A_n})=1-\prod_{i=1}^nP(\bar{A_i}) P ( A 1 ∪ A 2 ∪ ⋯ ∪ A n ) = 1 − P ( A 1 ∪ A 2 ∪ ⋯ ∪ A n ) = 1 − P ( A 1 ˉ A 2 ˉ ⋯ A n ˉ ) = 1 − i = 1 ∏ n P ( A i ˉ )
伯努利(Bernoulli)概型 其实就是高中那个 n n n 次独立重复试验 独立试验:将试验 E E E 重复进行 n n n 次,在每次试验中,事件 A A A 要么发生,要么不发生,且各次试验的结果互不影响(即每次试验中事件 A A A 发生的概率保持不变,不受其他各次试验结果影响),则称这 n n n 次试验相互独立. 伯努利概型:在 n n n 次独立试验的基础上,如果试验 E E E 只有两个可能的对立结果 A , A ˉ A,\bar{A} A , A ˉ ,且 P ( A ) = p , P ( A ˉ ) = 1 − p ( 0 < p < 1 ) P(A)=p,P(\bar{A})=1-p\ (0<p<1) P ( A ) = p , P ( A ˉ ) = 1 − p ( 0 < p < 1 ) ,则将试验 E E E 独立地重复进行 n n n 次所构成的一个试验叫做 n n n 重伯努利试验,简称为伯努利试验或伯努利概型. n n n 次独立重复试验中事件 A A A 若发生 k k k 次,则 A ˉ \bar{A} A ˉ 必定发生 n − k n-k n − k 次,该基本事件的概率为 P n ( k ) = ( n k ) p k ( 1 − p ) n − k P_n(k)=\binom{n}{k}p_k(1-p)^{n-k} P n ( k ) = ( k n ) p k ( 1 − p ) n − k . (二项概率公式)随机变量及其分布 分布函数 随机变量:设随机试验 E E E 的样本空间为 Ω = { ω } \varOmega=\{\omega\} Ω = { ω } ,若对于每一个 ω ∈ Ω \omega\in\varOmega ω ∈ Ω ,都有唯一实数 X ( ω ) X(\omega) X ( ω ) 与之对应,则称 X = X ( ω ) X=X(\omega) X = X ( ω ) 为随机变量. 随机变量是随着试验结果不同而变化的量,一般用大写字母表示. 分布函数:设 X X X 为随机变量,对于任意实数 x x x ,称 F ( x ) = P { X ≤ x } ( x ∈ R ) F(x)=P\{X\le x\}\ (x\in \R) F ( x ) = P { X ≤ x } ( x ∈ R ) 为随机变量 X X X 的分布函数. 随机变量 X X X 的分布函数的定义域为 R \R R ,表示随机事件 { X ≤ x } \{X\le x\} { X ≤ x } 发生的概率. 若 X X X 表示数轴上随机点的坐标,则 F ( a ) F(a) F ( a ) 表示随机点落在区间 ( − ∞ , a ] \left(-\infty,a\right] ( − ∞ , a ] 上的概率. ∀ x , 0 ≤ F ( x ) ≤ 1 \forall x,0\le F(x)\le 1 ∀ x , 0 ≤ F ( x ) ≤ 1 ∀ x 1 , x 2 ( x 1 < x 2 ) , P { x 1 < X ≤ x 2 } = F ( x 2 ) − F ( x 1 ) \forall x_1,x_2\ (x_1<x_2),\ P\{x_1<X\le x_2\}=F(x_2)-F(x_1) ∀ x 1 , x 2 ( x 1 < x 2 ) , P { x 1 < X ≤ x 2 } = F ( x 2 ) − F ( x 1 ) F ( − ∞ ) = lim x → − ∞ F ( x ) = 0 , F ( + ∞ ) = lim x → + ∞ F ( x ) = 1 F(-\infty)=\lim\limits_{x\to-\infty}F(x)=0,F(+\infty)=\lim\limits_{x\to+\infty}F(x)=1 F ( − ∞ ) = x → − ∞ lim F ( x ) = 0 , F ( + ∞ ) = x → + ∞ lim F ( x ) = 1 F ( x ) F(x) F ( x ) 处处右连续,即 F ( x + ) = F ( x ) F(x^+)=F(x) F ( x + ) = F ( x ) F ( x ) F(x) F ( x ) 是 R \R R 上的单调不减函数 离散型随机变量 高中数学到此为止
如果一个随机变量 X X X 所有可能取到的不同值是有限个或者可列无穷多个,并且以确定的概率取这些不同的值,则 X X X 为离散型随机变量.
分布律:设离散型随机变量 X X X 所有可能的取值为 x k ( k = 1 , 2 , ⋯ ) x_k(k=1,2,\cdots) x k ( k = 1 , 2 , ⋯ ) ,事件 { X = x k } \{X=x_k\} { X = x k } 的概率为 P { X = x k } = p k P\{X=x_k\}=p_k P { X = x k } = p k ,且满足 p k ≥ 0 , ∑ i = 1 ∞ p k = 1 p_k\ge 0,\sum\limits_{i=1}^\infty p_k=1 p k ≥ 0 , i = 1 ∑ ∞ p k = 1 ,则 P { X = x k } = p k P\{X=x_k\}=p_k P { X = x k } = p k 称为随机变量 X X X 的概率分布或分布律.
概率分布也可用表格形式表示:
X X X x 1 x_1 x 1 x 2 x_2 x 2 ⋯ \cdots ⋯ x k x_k x k ⋯ \cdots ⋯ P P P p 1 p_1 p 1 p 2 p_2 p 2 ⋯ \cdots ⋯ p k p_k p k ⋯ \cdots ⋯
对于任意实数 x x x ,随机事件 { X ≤ x } \{X\le x\} { X ≤ x } 等价于 ⋃ x k ≤ x { X = x k } \bigcup\limits_{x_k\le x}\{X=x_k\} x k ≤ x ⋃ { X = x k } ,根据概率的可加性,离散型随机变量 X X X 的分布函数为 F ( x ) = ∑ x k ≤ x P { X = x k } = ∑ x k ≤ x p k F(x)=\sum\limits_{x_k\le x}P\{X=x_k\}=\sum\limits_{x_k\le x} p_k F ( x ) = x k ≤ x ∑ P { X = x k } = x k ≤ x ∑ p k .
连续型随机变量 对于随机变量的分布函数 F ( x ) F(x) F ( x ) ,如果存在非负函数 f ( x ) f(x) f ( x ) ,使得对任意 x x x 都有 F ( x ) = ∫ − ∞ x f ( t ) d t F(x)=\int_{-\infty}^x f(t)\mathrm{d}t F ( x ) = ∫ − ∞ x f ( t ) d t ,则称随机变量 X X X 是连续型随机变量,其中函数 f ( x ) f(x) f ( x ) 是 X X X 的概率密度函数,简称概率密度,记作 X ∼ f ( x ) X\sim f(x) X ∼ f ( x ) . 连续型随机变量的分布函数在 R \R R 上连续. 概率密度函数不一定是连续的. 概率密度函数的性质 f ( x ) ≥ 0 f(x)\ge 0 f ( x ) ≥ 0 ∫ − ∞ + ∞ f ( x ) d x = 1 \int_{-\infty}^{+\infty}f(x)\mathrm{d}x=1 ∫ − ∞ + ∞ f ( x ) d x = 1 满足以上两条性质的函数必定是某个随机变量的概率密度函数.(2024概率B考过) 对于任意实数 a , b ( a < b ) a,b\ (a<b) a , b ( a < b ) ,有 P { a < X ≤ b } = F ( b ) − F ( a ) = ∫ a b f ( x ) d x P\{a<X\le b\}=F(b)-F(a)=\int_{a}^bf(x)\mathrm{d}x P { a < X ≤ b } = F ( b ) − F ( a ) = ∫ a b f ( x ) d x 如果 f ( x ) f(x) f ( x ) 在 x x x 处连续,则有 F ′ ( x ) = f ( x ) F'(x)=f(x) F ′ ( x ) = f ( x ) 连续型随机变量取任意指定实数的概率为0. 计算连续型随机变量在区间上取值的概率时,可以不区分区间的开闭性. 常用分布 (0-1) 分布【离散型】 如果随机变量 X X X 只取 0 , 1 0,1 0 , 1 两个值,其概率分布为
P { X = 0 } = 1 − p , P { X = 1 } = p , 0 < p < 1 P\{X=0\}=1-p,P\{X=1\}=p,0<p<1 P { X = 0 } = 1 − p , P { X = 1 } = p , 0 < p < 1
或者写成
P { X = k } = p k ( 1 − p ) 1 − k , k = 0 , 1 , 0 < p < 1 P\{X=k\}=p^k(1-p)^{1-k},k=0,1,0<p<1 P { X = k } = p k ( 1 − p ) 1 − k , k = 0 , 1 , 0 < p < 1
则称随机变量 X X X 服从参数为 p p p 的(0-1)分布或两点分布.
二项分布【离散型】 在 n n n 重伯努利试验中,如果以 X X X 表示事件 A A A 出现的次数,则 X X X 是一个离散型随机变量. X X X 的可能取值为 0 , 1 , ⋯ , n 0,1,\cdots,n 0 , 1 , ⋯ , n ,由二项概率公式可得
P { X = k } = ( n k ) p k ( 1 − p ) n − k P\{X=k\}=\binom{n}{k}p^k(1-p)^{n-k} P { X = k } = ( k n ) p k ( 1 − p ) n − k
称 X X X 服从参数为 n , p n,p n , p 的二项分布,记作 X ∼ B ( n , p ) X\sim B(n,p) X ∼ B ( n , p ) . 特别地,当 n = 1 n=1 n = 1 时,X X X 服从参数为 p p p 的(0-1)分布.
在有放回抽样中,通常会用到二项分布. 若 X ∼ B ( n 1 , p ) , Y ∼ B ( n 2 , p ) X\sim B(n_1,p),Y\sim B(n_2,p) X ∼ B ( n 1 , p ) , Y ∼ B ( n 2 , p ) 且 X , Y X,Y X , Y 相互独立,则 X + Y ∼ B ( n 1 + n 2 , p ) X+Y\sim B(n_1+n_2,p) X + Y ∼ B ( n 1 + n 2 , p ) .
泊松分布【离散型 可数无穷多个】 如果随机变量的所有可能取值为 0 , 1 , 2 , ⋯ 0,1,2,\cdots 0 , 1 , 2 , ⋯ ,且
P { X = k } = λ k e − λ k ! , k = 0 , 1 , 2 , ⋯ P\{X=k\}=\dfrac{\lambda^k\mathrm{e}^{-\lambda}}{k!},k=0,1,2,\cdots P { X = k } = k ! λ k e − λ , k = 0 , 1 , 2 , ⋯
其中 λ > 0 \lambda>0 λ > 0 为常数,则称随机变量 X X X 服从参数为 λ \lambda λ 的泊松分布,记为 X ∼ P ( λ ) X\sim P(\lambda) X ∼ P ( λ ) 或者 X ∼ π ( λ ) X\sim \pi(\lambda) X ∼ π ( λ ) .
泊松定理:设 λ > 0 \lambda>0 λ > 0 为常数,n ∈ N ∗ n\in \N^* n ∈ N ∗ ,且满足 λ = n p \lambda=np λ = n p ,则对于 ∀ k ∈ N \forall k\in \N ∀ k ∈ N 有
lim n → ∞ ( n k ) p k ( 1 − p ) n − k = λ k e − λ k ! \lim_{n\to\infty}\binom{n}{k}p^k(1-p)^{n-k}=\dfrac{\lambda^k\mathrm{e}^{-\lambda}}{k!} n → ∞ lim ( k n ) p k ( 1 − p ) n − k = k ! λ k e − λ
由于 n p = λ np=\lambda n p = λ ,当 n n n 很大时,p p p 必定很小. 泊松定理表明,当 n n n 很大而 p p p 很小时,有近似公式
( n k ) p k ( 1 − p ) n − k ≈ λ k e − λ k ! \binom{n}{k}p^k(1-p)^{n-k}\approx\dfrac{\lambda^k\mathrm{e}^{-\lambda}}{k!} ( k n ) p k ( 1 − p ) n − k ≈ k ! λ k e − λ
即当 n n n 很大时,p p p 很小时,二项分布 B ( n , p ) B(n,p) B ( n , p ) 可以近似为泊松分布 P ( n p ) P(np) P ( n p ) .
若随机变量 X ∼ P ( λ 1 ) , Y ∼ P ( λ 2 ) X\sim P(\lambda_1),Y\sim P(\lambda_2) X ∼ P ( λ 1 ) , Y ∼ P ( λ 2 ) ,则 X + Y ∼ P ( λ 1 + λ 2 ) X+Y\sim P(\lambda_1+\lambda_2) X + Y ∼ P ( λ 1 + λ 2 ) .
几何分布【离散型 可数无穷多个】 设试验 E E E 只有两个对立的结果 A , A ˉ A,\bar{A} A , A ˉ ,且 P ( A ) = p , P ( A ˉ ) = 1 − p , 0 < p < 1 P(A)=p,P(\bar{A})=1-p,0<p<1 P ( A ) = p , P ( A ˉ ) = 1 − p , 0 < p < 1 ,若将试验 E E E 独立重复进行直至事件 A A A 发生为止,以 X X X 表示需要进行的试验次数,则 X X X 是一个随机变量,且取值为 1 , 2 , ⋯ 1,2,\cdots 1 , 2 , ⋯ . 随机变量 X X X 的分布律为
P { X = k } = ( 1 − p ) k − 1 p , k = 1 , 2 , ⋯ P\{X=k\}=(1-p)^{k-1}p,k=1,2,\cdots P { X = k } = ( 1 − p ) k − 1 p , k = 1 , 2 , ⋯
称随机变量 X X X 服从参数为 p p p 的几何分布.
几何分布得名于其分布列构成一个几何级数.
超几何分布【离散型】 在无放回抽样中,通常会用到超几何分布.
超几何分布描述了在不放回抽样的情况下,从 N N N 个物品(指定种类物品有 M M M 个)中抽取 n n n 个物品,成功抽取 m m m 个指定种类物品的概率. 其分布列为
P { X = k } = ( M k ) ( N − M n − k ) ( N n ) , k = 0 , 1 , ⋯ , min ( M , n ) P\{X=k\}=\dfrac{\binom{M}{k}\binom{N-M}{n-k}}{\binom{N}{n}},k=0,1,\cdots,\min(M,n) P { X = k } = ( n N ) ( k M ) ( n − k N − M ) , k = 0 , 1 , ⋯ , min ( M , n )
均匀分布【连续型】 若连续型随机变量 X X X 的概率密度为
f ( x ) = { 1 b − a , a < x < b , 0 , 其他 . f(x)=\begin{equation*} \begin{cases} \dfrac{1}{b-a},&a<x<b, \\ 0,& \text{其他}. \end{cases} \end{equation*} f ( x ) = ⎩ ⎨ ⎧ b − a 1 , 0 , a < x < b , 其他 .
则称 X X X 在区间 ( a , b ) (a,b) ( a , b ) 上服从均匀分布,记为 X ∼ U ( a , b ) X\sim U(a,b) X ∼ U ( a , b ) . 易得 X X X 的分布函数为
F ( x ) = { 0 , x < a , x − a b − a , a ≤ x < b , 1 , x ≥ b . F(x)=\begin{equation*} \begin{cases} 0, & x<a,\\ \dfrac{x-a}{b-a},&a\le x<b, \\ 1,& x\ge b. \end{cases} \end{equation*} F ( x ) = ⎩ ⎨ ⎧ 0 , b − a x − a , 1 , x < a , a ≤ x < b , x ≥ b .
对于任意实数 x 1 , x 2 ∈ ( a , b ) x_1,x_2\in (a,b) x 1 , x 2 ∈ ( a , b ) ,若 x 1 < x 2 x_1<x_2 x 1 < x 2 ,则有 P { x 1 ≤ X ≤ x 2 } = x 2 − x 1 b − a P\{x_1\le X \le x_2\}=\dfrac{x_2-x_1}{b-a} P { x 1 ≤ X ≤ x 2 } = b − a x 2 − x 1 .这表明随机变量 X X X 位于区间 ( a , b ) (a,b) ( a , b ) 的任意子区间 [ x 1 , x 2 ] [x_1,x_2] [ x 1 , x 2 ] 内的概率只取决于 [ x 1 , x 2 ] [x_1,x_2] [ x 1 , x 2 ] 的长度,与子区间的位置无关.
指数分布【连续型】 若连续型随机变量 X X X 的概率密度为
f ( x ) = { λ e − λ x , x > 0 , 0 , x ≤ 0. f(x)=\begin{equation*} \begin{cases} \lambda \mathrm{e}^{-\lambda x},&x>0, \\ 0,&x\le 0. \end{cases} \end{equation*} f ( x ) = { λ e − λ x , 0 , x > 0 , x ≤ 0.
其中 λ \lambda λ 为常数,则称 X X X 服从参数为 λ \lambda λ 的指数分布 . 易得 X X X 的分布函数为
F ( x ) = { 1 − e − λ x , x > 0 , 0 , x ≤ 0. F(x)=\begin{equation*} \begin{cases} 1-\mathrm{e}^{-\lambda x},&x>0, \\ 0,& x \le 0. \end{cases} \end{equation*} F ( x ) = { 1 − e − λ x , 0 , x > 0 , x ≤ 0.
正态分布【连续型】 如果随机变量 X X X 具有概率密度
f ( x ) = 1 2 π σ e − ( x − μ ) 2 2 σ 2 , − ∞ < x < + ∞ f(x)=\dfrac{1}{\sqrt{2\pi}\sigma}\mathrm{e}^{-\frac{(x-\mu)^2}{2\sigma^2}},-\infty<x<+\infty f ( x ) = 2 π σ 1 e − 2 σ 2 ( x − μ ) 2 , − ∞ < x < + ∞
其中 μ , σ ( σ > 0 ) \mu,\sigma(\sigma>0) μ , σ ( σ > 0 ) 为常数,则称 X X X 服从参数为 μ , σ \mu,\sigma μ , σ 的正态分布,记作 X ∼ N ( μ , σ 2 ) X\sim N(\mu,\sigma^2) X ∼ N ( μ , σ 2 ) .
正态分布的分布函数
F ( x ) = 1 2 π σ ∫ − ∞ x e − ( t − μ ) 2 σ 2 d t , − ∞ < x < + ∞ F(x)=\dfrac{1}{\sqrt{2\pi}\sigma}\int_{-\infty}^x\mathrm{e}^{-\frac{(t-\mu)^2}{\sigma^2}}\mathrm{d}t,-\infty<x<+\infty F ( x ) = 2 π σ 1 ∫ − ∞ x e − σ 2 ( t − μ ) 2 d t , − ∞ < x < + ∞
不能用初等函数的形式表示.
正态分布的概率密度函数的图像是一条钟形曲线,关于直线 x = μ x=\mu x = μ 对称,并在 x = μ x=\mu x = μ 处取得最大值 1 2 π σ \dfrac{1}{\sqrt{2\pi}\sigma} 2 π σ 1 ,在 x = μ ± σ x=\mu \pm \sigma x = μ ± σ 处有拐点,以 x x x 轴为水平渐近线.
固定 σ \sigma σ 改变 μ \mu μ 的值,概率密度曲线沿着 x x x 轴左右平移,形状不变;固定 μ \mu μ 改变 σ \sigma σ 的值,当 σ \sigma σ 越小时,曲线在 x = μ x=\mu x = μ 处附近越陡峭,图像越“瘦”,反之则越平缓,图像越“胖”.
标准正态分布是 μ = 0 , σ = 1 \mu=0,\sigma=1 μ = 0 , σ = 1 时的特殊情形. 服从标准正态分布的随机变量 X X X 的概率密度和分布函数分别记作
φ ( x ) = 1 2 π e − x 2 2 , − ∞ < x < + ∞ \varphi(x)=\dfrac{1}{\sqrt{2\pi}}\mathrm{e}^{-\frac{x^2}{2}},-\infty<x<+\infty φ ( x ) = 2 π 1 e − 2 x 2 , − ∞ < x < + ∞
Φ ( x ) = 1 2 π ∫ − ∞ x e − t 2 2 d t , − ∞ < x < + ∞ \varPhi(x)=\dfrac{1}{\sqrt{2\pi}}\int_{-\infty}^x \mathrm{e}^{-\frac{t^2}{2}}\mathrm{d}t,-\infty<x<+\infty Φ ( x ) = 2 π 1 ∫ − ∞ x e − 2 t 2 d t , − ∞ < x < + ∞
概率密度函数 φ ( x ) \varphi(x) φ ( x ) 是偶函数,因此有 Φ ( − x ) = 1 − Φ ( x ) \varPhi(-x)=1-\varPhi(x) Φ ( − x ) = 1 − Φ ( x ) .
对一般的正态分布作变换 u = x − μ σ u=\dfrac{x-\mu}{\sigma} u = σ x − μ 可得到标准正态分布,即
f ( x ) = φ ( x − μ σ ) , F ( x ) = Φ ( x − μ σ ) f(x)=\varphi\left(\dfrac{x-\mu}{\sigma}\right),F(x)=\varPhi\left(\dfrac{x-\mu}{\sigma}\right) f ( x ) = φ ( σ x − μ ) , F ( x ) = Φ ( σ x − μ )
因此对于任意实数 x 1 , x 2 ( x 1 < x 2 ) x_1,x_2(x_1<x_2) x 1 , x 2 ( x 1 < x 2 ) ,有
P { x 1 < X < x 2 } = P { x 1 < X ≤ x 2 } = F ( x 2 ) − F ( x 1 ) = Φ ( x 2 − μ σ ) − Φ ( x 1 − μ σ ) P\{x_1<X<x_2\}=P\{x_1<X \le x_2\}=F(x_2)-F(x_1)=\varPhi\left(\dfrac{x_2-\mu}{\sigma}\right)-\varPhi\left(\dfrac{x_1-\mu}{\sigma}\right) P { x 1 < X < x 2 } = P { x 1 < X ≤ x 2 } = F ( x 2 ) − F ( x 1 ) = Φ ( σ x 2 − μ ) − Φ ( σ x 1 − μ )
对于给定的实数 0 < α < 1 0<\alpha<1 0 < α < 1 ,满足条件
P { X ≥ u α } = 1 2 π ∫ u α + ∞ e − x 2 2 d t = α P\{X\ge u_\alpha\}=\dfrac{1}{\sqrt{2\pi}}\int_{u_\alpha}^{+\infty}\mathrm{e}^{-\frac{x^2}{2}}\mathrm{d}t=\alpha P { X ≥ u α } = 2 π 1 ∫ u α + ∞ e − 2 x 2 d t = α
的实数 u α u_\alpha u α 称为标准正态分布的上 α \alpha α 分位点数.(注意这里是大于,和分布函数正好相反)
当随机变量 X ∼ N ( μ , σ 2 ) X \sim N(\mu,\sigma^2) X ∼ N ( μ , σ 2 ) 时, X X X 的线性函数 Y = a X + b ( a ≠ 0 ) Y=aX+b(a\neq 0) Y = a X + b ( a = 0 ) 服从正态分布 N ( a μ + b , a 2 σ 2 ) N(a\mu+b,a^2\sigma^2) N ( a μ + b , a 2 σ 2 ) .
柯西分布【连续型】 概率密度函数为
f ( x ) = 1 π ( 1 + x 2 ) , − ∞ < x < + ∞ f(x)=\dfrac{1}{\pi(1+x^2)},-\infty<x<+\infty f ( x ) = π ( 1 + x 2 ) 1 , − ∞ < x < + ∞
分布函数为
F ( x ) = 1 π arctan x , − ∞ < x < + ∞ F(x)=\dfrac{1}{\pi}\arctan x,-\infty<x<+\infty F ( x ) = π 1 arctan x , − ∞ < x < + ∞
柯西分布的数学期望和方差不存在.
随机变量函数的分布 离散型 设离散型随机变量 X X X 的概率分布为
P { X = x k } = p k , k = 1 , 2 , ⋯ P\{X=x_k\}=p_k,k=1,2,\cdots P { X = x k } = p k , k = 1 , 2 , ⋯
设 y = g ( x ) y=g(x) y = g ( x ) 是连续函数,则对于 X X X 的函数 Y = g ( x ) Y=g(x) Y = g ( x ) 有
P { Y = g ( x k ) } = p k , k = 1 , 2 , ⋯ P\{Y=g(x_k)\}=p_k,k=1,2,\cdots P { Y = g ( x k )} = p k , k = 1 , 2 , ⋯
即为 Y Y Y 的概率分布. 如果 g ( x k ) g(x_k) g ( x k ) 的数值有相同的,把相应的概率相加即可.
连续型 求连续型随机变量 Y = g ( X ) Y=g(X) Y = g ( X ) 的分布函数,关键在于解出关于 X X X 的不等式 g ( X ) ≤ y g(X)\le y g ( X ) ≤ y . 设随机变量 X X X 的概率密度为 f X ( x ) f_X(x) f X ( x ) ,定义域为 R \R R ,函数 g ( x ) g(x) g ( x ) 是处处可导的严格单调函数,则随机变量 Y = g ( X ) Y=g(X) Y = g ( X ) 的概率密度为
f Y ( y ) = { f X [ h ( y ) ] ∣ h ′ ( y ) ∣ , α < x < β , 0 , 其他 . f_Y(y)=\begin{equation*} \begin{cases} f_X[h(y)]\ |h'(y)|,&\alpha<x<\beta, \\ 0,& \text{其他}. \end{cases} \end{equation*} f Y ( y ) = { f X [ h ( y )] ∣ h ′ ( y ) ∣ , 0 , α < x < β , 其他 .
其中 α = min ( g ( − ∞ ) , g ( + ∞ ) ) , β = max ( g ( − ∞ ) , g ( + ∞ ) ) , h ( y ) \alpha=\min(g(-\infty),g(+\infty)),\beta=\max(g(-\infty),g(+\infty)),h(y) α = min ( g ( − ∞ ) , g ( + ∞ )) , β = max ( g ( − ∞ ) , g ( + ∞ )) , h ( y ) 是 g ( x ) g(x) g ( x ) 的反函数.
二维随机变量及其分布 二维随机变量 二维随机变量:设随机试验 E E E 的样本空间为 Ω \varOmega Ω ,X , Y X,Y X , Y 是定义在 Ω \varOmega Ω 上的两个随机变量,由它们构成的向量 ( X , Y ) (X,Y) ( X , Y ) 称为二维随机变量或二维随机向量. 联合分布函数:设 ( X , Y ) (X,Y) ( X , Y ) 是二维随机变量,对于任意实数 x , y x,y x , y ,记事件 { X ≤ x } , { Y ≤ y } \{X\le x\},\{Y\le y\} { X ≤ x } , { Y ≤ y } 的交事件为 { X ≤ x , Y ≤ y } \{X\le x,Y\le y\} { X ≤ x , Y ≤ y } ,称二元函数F ( x , y ) = P { X ≤ x , Y ≤ y } , ( x , y ) ∈ R 2 F(x,y)=P\{X\le x,Y\le y\},(x,y)\in \R^2 F ( x , y ) = P { X ≤ x , Y ≤ y } , ( x , y ) ∈ R 2
为二维随机变量 ( X , Y ) (X,Y) ( X , Y ) 的分布函数,或称为随机变量 X , Y X,Y X , Y 的联合分布函数. 分布函数 F ( x , y ) F(x,y) F ( x , y ) 在 ( x , y ) (x,y) ( x , y ) 处的函数值表示 x O y xOy x O y 平面上的随机点 ( X , Y ) (X,Y) ( X , Y ) 落在以 ( x , y ) (x,y) ( x , y ) 为顶点的左下方的无界域的概率. 联合分布函数的性质 0 ≤ F ( x , y ) ≤ 1 , lim x → − ∞ , y → − ∞ F ( x , y ) = 0 , lim x → + ∞ , y → + ∞ F ( x , y ) = 1 0\le F(x,y) \le 1,\lim\limits_{x\to-\infty,\ y\to-\infty}F(x,y)=0,\lim\limits_{x\to+\infty,\ y\to+\infty}F(x,y)=1 0 ≤ F ( x , y ) ≤ 1 , x → − ∞ , y → − ∞ lim F ( x , y ) = 0 , x → + ∞ , y → + ∞ lim F ( x , y ) = 1 对于任意固定的 x , F ( x , − ∞ ) = lim y → − ∞ F ( x , y ) = 0 x,F(x,-\infty)=\lim\limits_{y\to-\infty}F(x,y)=0 x , F ( x , − ∞ ) = y → − ∞ lim F ( x , y ) = 0 对于任意固定的 y , F ( − ∞ , y ) = lim x → − ∞ F ( x , y ) = 0 y,F(-\infty,y)=\lim\limits_{x\to-\infty}F(x,y)=0 y , F ( − ∞ , y ) = x → − ∞ lim F ( x , y ) = 0 F ( x , y ) F(x,y) F ( x , y ) 对于两个变量都是单调不减函数. 对于任意固定的 y , x 1 < x 2 , F ( x 1 , y ) ≤ F ( x 2 , y ) y,x_1<x_2,F(x_1,y)\le F(x_2,y) y , x 1 < x 2 , F ( x 1 , y ) ≤ F ( x 2 , y ) ;对于任意固定的 x , y 1 < y 2 , F ( x , y 1 ) ≤ F ( x , y 2 ) x,y_1<y_2,F(x,y_1)\le F(x,y_2) x , y 1 < y 2 , F ( x , y 1 ) ≤ F ( x , y 2 ) .F ( x , y ) F(x,y) F ( x , y ) 对于两个变量都是右连续的.∀ x 1 < x 2 , ∀ y 1 < y 2 , P { x 1 < X ≤ x 2 , y 1 < Y ≤ y 2 } = F ( x 2 , y 2 ) − F ( x 1 , y 2 ) − F ( x 2 , y 2 ) + F ( x 1 , y 1 ) \forall x_1<x_2,\forall y_1<y_2,P\{x_1<X\le x_2,y_1<Y\le y_2\}=F(x_2,y_2)-F(x_1,y_2)-F(x_2,y_2)+F(x_1,y_1) ∀ x 1 < x 2 , ∀ y 1 < y 2 , P { x 1 < X ≤ x 2 , y 1 < Y ≤ y 2 } = F ( x 2 , y 2 ) − F ( x 1 , y 2 ) − F ( x 2 , y 2 ) + F ( x 1 , y 1 ) 边缘分布 设二维随机变量 ( X , Y ) (X,Y) ( X , Y ) 的分布函数为 F ( x , y ) F(x,y) F ( x , y ) ,记 X X X 的分布函数为 F X ( x ) F_X(x) F X ( x ) ,Y Y Y 的分布函数为 F Y ( y ) F_Y(y) F Y ( y ) ,二者分别称为 ( X , Y ) (X,Y) ( X , Y ) 关于 X , Y X,Y X , Y 的边缘分布函数. 边缘分布函数是一维随机变量的分布函数,是一元函数.
F X ( x ) = P { X ≤ x } = P { X ≤ x , Y < + ∞ } = F ( x , + ∞ ) , x ∈ R F_X(x)=P\{X\le x\}=P\{X\le x,Y<+\infty\}=F(x,+\infty),x\in \R F X ( x ) = P { X ≤ x } = P { X ≤ x , Y < + ∞ } = F ( x , + ∞ ) , x ∈ R
F Y ( y ) = P { Y ≤ y } = P { X < + ∞ , Y ≤ y } = F ( + ∞ , y ) , y ∈ R F_Y(y)=P\{Y\le y\}=P\{X<+\infty,Y\le y\}=F(+\infty,y),y\in \R F Y ( y ) = P { Y ≤ y } = P { X < + ∞ , Y ≤ y } = F ( + ∞ , y ) , y ∈ R
如果对于任意实数 x , y x,y x , y 有 F ( x , y ) = F X ( x ) F Y ( y ) F(x,y)=F_X(x)F_Y(y) F ( x , y ) = F X ( x ) F Y ( y ) 则称随机变量 X , Y X,Y X , Y 是相互独立的. 二维随机变量的联合分布函数唯一确定边缘分布函数,但两个随机变量的边缘分布函数只有在相互独立时才能确定联合分布函数.
若 X , Y X,Y X , Y 相互独立,则 X , Y X,Y X , Y 的函数 f ( X ) , g ( Y ) f(X),g(Y) f ( X ) , g ( Y ) 也是相互独立的.
二维离散型随机变量的概率分布 若二维随机变量 ( X , Y ) (X,Y) ( X , Y ) 的可能的取值是有限个或可列无限个,则 ( X , Y ) (X,Y) ( X , Y ) 是二维离散型随机变量.
设二维离散型随机变量 ( X , Y ) (X,Y) ( X , Y ) 所有可能的取值为 ( x i , y i ) ( i = 1 , 2 , ⋯ ) (x_i,y_i)(i=1,2,\cdots) ( x i , y i ) ( i = 1 , 2 , ⋯ ) ,如果
P { X = x i , Y = y i } = p i j , i , j = 1 , 2 , ⋯ ( ∗ ) P\{X=x_i,Y=y_i\}=p_{ij},\ \ i,j=1,2,\cdots (*) P { X = x i , Y = y i } = p ij , i , j = 1 , 2 , ⋯ ( ∗ )
且满足
p i j ≤ 0 , ∑ i = 1 ∞ ∑ j = 1 ∞ p i j = 1 p_{ij}\le 0,\sum_{i=1}^\infty\sum_{j=1}^\infty p_{ij}=1 p ij ≤ 0 , i = 1 ∑ ∞ j = 1 ∑ ∞ p ij = 1
则称 (*) 式为二维离散型随机变量 ( X , Y ) (X,Y) ( X , Y ) 的概率分布,或者 X , Y X,Y X , Y 的联合概率分布、联合分布律. 二维离散型随机变量 ( X , Y ) (X,Y) ( X , Y ) 的分布律可以用下面的表格表示:
Y Y Y X X X y 1 y_1 y 1 y 2 y_2 y 2 ⋯ \cdots ⋯ y j y_j y j ⋯ \cdots ⋯ x 1 x_1 x 1 p 11 p_{11} p 11 p 12 p_{12} p 12 ⋯ \cdots ⋯ p 1 j p_{1j} p 1 j ⋯ \cdots ⋯ x 2 x_2 x 2 p 21 p_{21} p 21 p 22 p_{22} p 22 ⋯ \cdots ⋯ p 2 j p_{2j} p 2 j ⋯ \cdots ⋯ ⋮ \vdots ⋮ ⋮ \vdots ⋮ ⋮ \vdots ⋮ ⋮ \vdots ⋮ ⋮ \vdots ⋮ x i x_i x i p i 1 p_{i1} p i 1 p i 2 p_{i2} p i 2 ⋯ \cdots ⋯ p i j p_{ij} p ij ⋯ \cdots ⋯ ⋮ \vdots ⋮ ⋮ \vdots ⋮ ⋮ \vdots ⋮ ⋮ \vdots ⋮ ⋮ \vdots ⋮
联合分布函数为
F ( x , y ) = P { X ≤ x , Y ≤ y } = ∑ x i ≤ x ∑ y j ≤ y p i j F(x,y)=P\{X\le x,Y\le y\}=\sum_{x_i\le x}\sum_{y_j\le y}p_{ij} F ( x , y ) = P { X ≤ x , Y ≤ y } = x i ≤ x ∑ y j ≤ y ∑ p ij
X , Y X,Y X , Y 的概率分布分别为
P { X = x i } = p i ⋅ , i = 1 , 2 , ⋯ P\{X=x_i\}=p_{i\cdot},i=1,2,\cdots P { X = x i } = p i ⋅ , i = 1 , 2 , ⋯
P { Y = y i } = p ⋅ j , i = 1 , 2 , ⋯ P\{Y=y_i\}=p_{\cdot j},i=1,2,\cdots P { Y = y i } = p ⋅ j , i = 1 , 2 , ⋯
其中 p i ⋅ = ∑ j = 1 ∞ p i j , p ⋅ j = ∑ i = 1 ∞ p i j p_{i\cdot}=\sum\limits_{j=1}^\infty p_{ij},\ p_{\cdot j}=\sum\limits_{i=1}^\infty p_{ij} p i ⋅ = j = 1 ∑ ∞ p ij , p ⋅ j = i = 1 ∑ ∞ p ij ,两个概率分布分别称为二维随机变量 ( X , Y ) (X,Y) ( X , Y ) 关于 X , Y X,Y X , Y 的边缘概率密度.
简单来说,就是找到给了的那个变量取值的那一行/列,把所有的概率加起来,比如求 P { X = 1 } P\{X=1\} P { X = 1 } ,就在联合概率分布的表格里面找到 X = 1 X=1 X = 1 那一行,再把这一行所有的概率加起来.
随机变量 X , Y X,Y X , Y 相互独立的充分必要条件是 ∀ i , j , p i j = p i ⋅ p ⋅ j \forall i,j,p_{ij}=p_{i\cdot}p_{\cdot j} ∀ i , j , p ij = p i ⋅ p ⋅ j ,其中 i , j = 1 , 2 , ⋯ i,j=1,2,\cdots i , j = 1 , 2 , ⋯ .
二维连续型随机变量的概率分布 设二维随机变量 X , Y X,Y X , Y 的分布函数为 F ( x , y ) F(x,y) F ( x , y ) ,若存在非负二元函数对于任意实数 x , y x,y x , y ,满足
F ( x , y ) = ∫ − ∞ x ∫ ∞ y f ( u , v ) d u d v , ( x , y ) ∈ R 2 F(x,y)=\int_{-\infty}^x\int_{\infty}^y f(u,v)\mathrm{d}u\mathrm{d}v,(x,y)\in \R^2 F ( x , y ) = ∫ − ∞ x ∫ ∞ y f ( u , v ) d u d v , ( x , y ) ∈ R 2
则称二维随机变量 ( X , Y ) (X,Y) ( X , Y ) 为二维连续型随机变量,f ( x , y ) f(x,y) f ( x , y ) 称为概率密度(联合概率密度).
f ( x , y ) ≥ 0 f(x,y)\ge 0 f ( x , y ) ≥ 0 ∫ − ∞ + ∞ ∫ ∞ + ∞ f ( x , y ) d x d y = 1 \int_{-\infty}^{+\infty}\int_{\infty}^{+\infty} f(x,y)\mathrm{d}x\mathrm{d}y=1 ∫ − ∞ + ∞ ∫ ∞ + ∞ f ( x , y ) d x d y = 1 . 这表明曲面 z = f ( x , y ) z=f(x,y) z = f ( x , y ) 位于平面 x O y xOy x O y 上方,且介于 x O y xOy x O y 平面和该曲面之间的体积恒为 1 1 1 .若 f ( x , y ) f(x,y) f ( x , y ) 在点 ( x , y ) (x,y) ( x , y ) 处连续,则有 f ( x , y ) = ∂ 2 F ( x , y ) ∂ x ∂ y f(x,y)=\dfrac{\partial^2F(x,y)}{\partial x \partial y} f ( x , y ) = ∂ x ∂ y ∂ 2 F ( x , y ) . 若 G G G 是平面 x O y xOy x O y 上的一个区域,则有 P { ( X , Y ) ∈ G } = ∬ G f ( x , y ) d x d y P\{(X,Y)\in G\}=\iint\limits_{G}f(x,y)\mathrm{d}x\mathrm{d}y P {( X , Y ) ∈ G } = G ∬ f ( x , y ) d x d y . 这表明随机点 ( X , Y ) (X,Y) ( X , Y ) 落在平面区域 G G G 内的概率等于以 G G G 为底、以曲面 z = f ( x , y ) z=f(x,y) z = f ( x , y ) 为顶面的曲顶柱体的体积. X , Y X,Y X , Y 的概率密度函数分别为一元函数
f X ( x ) = ∫ − ∞ + ∞ f ( x , y ) d y , x ∈ R f_X(x)=\int_{-\infty}^{+\infty}f(x,y)\mathrm{d}y,x\in\R f X ( x ) = ∫ − ∞ + ∞ f ( x , y ) d y , x ∈ R
f Y ( y ) = ∫ − ∞ + ∞ f ( x , y ) d x , y ∈ R f_Y(y)=\int_{-\infty}^{+\infty}f(x,y)\mathrm{d}x,y\in\R f Y ( y ) = ∫ − ∞ + ∞ f ( x , y ) d x , y ∈ R
分别叫做 ( X , Y ) (X,Y) ( X , Y ) 关于 X , Y X,Y X , Y 的边缘密度函数. 随机变量 X , Y X,Y X , Y 相互独立的充分必要条件是 f ( x , y ) = f ( x ) f ( y ) f(x,y)=f(x)f(y) f ( x , y ) = f ( x ) f ( y ) .
常用二维连续型随机变量分布 均匀分布 设 D D D 是 x O y xOy x O y 平面上的有界区域,其面积为 A A A ,若二维连续型随机变量 X , Y X,Y X , Y 具有概率密度
f ( x , y ) = { 1 A , ( x , y ) ∈ D , 0 , 其他 , f(x,y)=\begin{equation*} \begin{cases} \dfrac{1}{A},&(x,y)\in D, \\ 0,&\text{其他}, \end{cases} \end{equation*} f ( x , y ) = ⎩ ⎨ ⎧ A 1 , 0 , ( x , y ) ∈ D , 其他 ,
则称 ( X , Y ) (X,Y) ( X , Y ) 在区域 D D D 上服从均匀分布. 联合概率服从均匀分布的二维随机变量,两个边缘分布不一定相互独立.
二维正态分布 二维连续型随机变量服从二维正态分布,则其概率密度为
f ( x , y ) = 1 2 π σ 1 σ 2 1 − ρ 2 e − 1 2 ( 1 − ρ 2 ) [ ( x − μ 1 ) 2 σ 1 2 − 2 ρ ( x − μ 1 ) ( y − μ 2 ) σ 1 σ 2 + ( y − μ 2 ) σ 2 2 ] , ( x , y ) ∈ R 2 f(x,y)=\dfrac{1}{2\pi\sigma_1\sigma_2\sqrt{1-\rho^2}}\mathrm{e}^{\frac{-1}{2(1-\rho^2)}\left[\frac{(x-\mu_1)^2}{\sigma_1^2}-2\rho\frac{(x-\mu_1)(y-\mu_2)}{\sigma_1\sigma_2}+\frac{(y-\mu^2)}{\sigma^2_2}\right]},(x,y)\in\R^2 f ( x , y ) = 2 π σ 1 σ 2 1 − ρ 2 1 e 2 ( 1 − ρ 2 ) − 1 [ σ 1 2 ( x − μ 1 ) 2 − 2 ρ σ 1 σ 2 ( x − μ 1 ) ( y − μ 2 ) + σ 2 2 ( y − μ 2 ) ] , ( x , y ) ∈ R 2
其中 μ 1 , μ 2 , σ 1 , σ 2 , ρ \mu_1,\mu_2,\sigma_1,\sigma_2,\rho μ 1 , μ 2 , σ 1 , σ 2 , ρ 均为常数,且满足 σ 1 > 0 , σ 2 > 0 , − 1 < ρ < 1 \sigma_1>0,\sigma_2>0,-1<\rho<1 σ 1 > 0 , σ 2 > 0 , − 1 < ρ < 1 ,称二维随机变量 ( X , Y ) (X,Y) ( X , Y ) 服从参数为 μ 1 , μ 2 , σ 1 , σ 2 , ρ \mu_1,\mu_2,\sigma_1,\sigma_2,\rho μ 1 , μ 2 , σ 1 , σ 2 , ρ 的二维正态分布,记作 ( X , Y ) ∼ N ( μ 1 , μ 2 , σ 1 , σ 2 , ρ ) (X,Y)\sim N(\mu_1,\mu_2,\sigma_1,\sigma_2,\rho) ( X , Y ) ∼ N ( μ 1 , μ 2 , σ 1 , σ 2 , ρ ) .
X , Y X,Y X , Y 相互独立的充分必要条件是 ρ = 0 \rho=0 ρ = 0 . X , Y X,Y X , Y 的边缘概率分布分别为一维正态分布,X ∼ N ( μ 1 , σ 1 2 ) , Y ∼ N ( μ 2 , σ 2 2 ) X\sim N(\mu_1,\sigma_1^2),Y\sim N(\mu_2,\sigma^2_2) X ∼ N ( μ 1 , σ 1 2 ) , Y ∼ N ( μ 2 , σ 2 2 ) .
( X , Y ) (X,Y) ( X , Y ) 的分布与参数 ρ \rho ρ 有关,对于不同的 ρ \rho ρ 会有不同的二维正态分布,但是 ( X , Y ) (X,Y) ( X , Y ) 关于 X , Y X,Y X , Y 的边缘分布与 ρ \rho ρ 无关.
仅根据边缘分布,一般无法确定联合分布.
条件分布 离散型随机变量的条件分布 设二维连续型随机变量 ( X , Y ) (X,Y) ( X , Y ) 的概率分布为
P { X = x i , Y = y i } = p i j , i , j = 1 , 2 , ⋯ P\{X=x_i,Y=y_i\}=p_{ij},i,j=1,2,\cdots P { X = x i , Y = y i } = p ij , i , j = 1 , 2 , ⋯
( X , Y ) (X,Y) ( X , Y ) 关于 ( X , Y ) (X,Y) ( X , Y ) 的边缘概率分布分别为
P { X = x i } = p i ⋅ , i = 1 , 2 , ⋯ P\{X=x_i\}=p_{i\cdot},i=1,2,\cdots P { X = x i } = p i ⋅ , i = 1 , 2 , ⋯
P { Y = y j } = p ⋅ j , j = 1 , 2 , ⋯ P\{Y=y_j\}=p_{\cdot j},j=1,2,\cdots P { Y = y j } = p ⋅ j , j = 1 , 2 , ⋯
则对于固定的 j j j ,若有 P { Y = y j } = p ⋅ j > 0 P\{Y=y_j\}=p_{\cdot j}>0 P { Y = y j } = p ⋅ j > 0 ,称
P { X = x i ∣ Y = y j } = P { X = x i , Y = y j } P { Y = y j } = p i j p ⋅ j P\{X=x_i|Y=y_j\}=\dfrac{P\{X=x_i,Y=y_j\}}{P\{Y=y_j\}}=\dfrac{p_{ij}}{p_{\cdot j}} P { X = x i ∣ Y = y j } = P { Y = y j } P { X = x i , Y = y j } = p ⋅ j p ij
为在条件 Y = y j Y=y_j Y = y j 下随机变量 X X X 的条件概率分布;对于固定的 i i i ,若有 p i ⋅ > 0 p_{i\cdot}>0 p i ⋅ > 0 ,则称
P { Y = y j ∣ X = x i } = P { X = x i , Y = y j } P { X = x i } = p i j p i ⋅ P\{Y=y_j|X=x_i\}=\dfrac{P\{X=x_i,Y=y_j\}}{P\{X=x_i\}}=\dfrac{p_{ij}}{p_{i\cdot}} P { Y = y j ∣ X = x i } = P { X = x i } P { X = x i , Y = y j } = p i ⋅ p ij
为在条件 X = x i X=x_i X = x i 下随机变量 X X X 的条件概率分布. 例如,列表表示在条件 Y = 0 Y=0 Y = 0 下的条件概率分布:
X = i X=i X = i 0 1 P { X = i ∣ Y = 0 } P\{X=i|Y=0\} P { X = i ∣ Y = 0 } 1 4 \dfrac{1}{4} 4 1 3 4 \dfrac{3}{4} 4 3
连续型随机变量的条件分布 设二维随机变量 ( X , Y ) (X,Y) ( X , Y ) 的分布函数为 F ( x , y ) F(x,y) F ( x , y ) ,概率密度为 f ( x , y ) f(x,y) f ( x , y ) ,若在点 ( x , y ) (x,y) ( x , y ) 处函数 f ( x , y ) f(x,y) f ( x , y ) 连续,且 ( X , Y ) (X,Y) ( X , Y ) 关于 Y Y Y 的边缘概率密度 f Y ( x ) f_Y(x) f Y ( x ) 连续,且 f Y ( y ) > 0 f_Y(y)>0 f Y ( y ) > 0 ,则在条件 Y = y Y=y Y = y 下 X X X 的条件分布函数为
F X ∣ Y ( x ∣ y ) = ∫ − ∞ x f ( u , y ) d u , x ∈ R F_{X|Y}(x|y)=\int_{-\infty}^x f(u,y)\mathrm{d}u,x\in \R F X ∣ Y ( x ∣ y ) = ∫ − ∞ x f ( u , y ) d u , x ∈ R
条件概率密度为
f X ∣ Y ( x ∣ y ) = f ( x , y ) f Y ( y ) , x ∈ R f_{X|Y}(x|y)=\dfrac{f(x,y)}{f_Y(y)},x\in\R f X ∣ Y ( x ∣ y ) = f Y ( y ) f ( x , y ) , x ∈ R
类似可得在条件 X = x X=x X = x 下 Y Y Y 的条件分布函数为
F Y ∣ X ( y ∣ x ) = ∫ − ∞ y f ( x , u ) d u , y ∈ R F_{Y|X}(y|x)=\int_{-\infty}^y f(x,u)\mathrm{d}u,y\in \R F Y ∣ X ( y ∣ x ) = ∫ − ∞ y f ( x , u ) d u , y ∈ R
条件概率密度为
f Y ∣ X ( y ∣ x ) = f ( x , y ) f X ( x ) , y ∈ R f_{Y|X}(y|x)=\dfrac{f(x,y)}{f_X(x)},y\in\R f Y ∣ X ( y ∣ x ) = f X ( x ) f ( x , y ) , y ∈ R
二维随机变量的函数的分布 对于离散型的二维随机变量,只需计算该函数可能的取值所对应的概率,即得该函数的概率分布. 对于二维连续型随机变量 ( X , Y ) (X,Y) ( X , Y ) ,概率密度为 f ( x , y ) f(x,y) f ( x , y ) ,设关于 X , Y X,Y X , Y 的二元函数 Z = g ( X , Y ) Z=g(X,Y) Z = g ( X , Y ) 是连续型随机变量,Z Z Z 的分布函数为
F Z ( z ) = P { Z ≤ z } = P { g ( X , Y ) ≤ z } = ∬ g ( X , Y ) ≤ z f ( x , y ) d x d y F_Z(z)=P\{Z\le z\}=P\{g(X,Y)\le z\}=\iint\limits_{g(X,Y)\le z}f(x,y)\mathrm{d}x\mathrm{d}y F Z ( z ) = P { Z ≤ z } = P { g ( X , Y ) ≤ z } = g ( X , Y ) ≤ z ∬ f ( x , y ) d x d y
其概率密度为
f Z ( z ) = F ′ ( z ) f_Z(z)=F'(z) f Z ( z ) = F ′ ( z )
对于随机变量 X , Y X,Y X , Y 的函数 Z = X + Y Z=X+Y Z = X + Y ,若 X , Y X,Y X , Y 相互独立,有卷积公式
f Z ( z ) = f X ( x ) ∗ f Y ( y ) = ∫ − ∞ + ∞ f X ( x ) f Y ( z − x ) d x = ∫ − ∞ + ∞ f Y ( y ) f X ( z − y ) d y f_Z(z)=f_X(x)*f_Y(y)=\int_{-\infty}^{+\infty}f_X(x)f_Y(z-x)\mathrm{d}x=\int_{-\infty}^{+\infty}f_Y(y)f_X(z-y)\mathrm{d}y f Z ( z ) = f X ( x ) ∗ f Y ( y ) = ∫ − ∞ + ∞ f X ( x ) f Y ( z − x ) d x = ∫ − ∞ + ∞ f Y ( y ) f X ( z − y ) d y
对于随机变量函数 M = max ( X , Y ) , N = min ( X , Y ) M=\max(X,Y),N=\min(X,Y) M = max ( X , Y ) , N = min ( X , Y ) ( X , Y X,Y X , Y 相互独立),其分布函数为
F max ( z ) = F X ( z ) F Y ( z ) , z ∈ R F_{\max}(z)=F_X(z)F_Y(z),z\in\R F m a x ( z ) = F X ( z ) F Y ( z ) , z ∈ R
F min ( z ) = 1 − [ 1 − F X ( z ) ] [ 1 − F Y ( z ) ] , z ∈ R F_{\min}(z)=1-[1-F_X(z)][1-F_Y(z)],z\in\R F m i n ( z ) = 1 − [ 1 − F X ( z )] [ 1 − F Y ( z )] , z ∈ R
求导可得其概率密度.
n 维随机变量 n n n 维随机变量与二维随机变量具有相似的性质,这里总结一些常见的概念:
定义:随机试验 E E E 的样本空间 Ω \varOmega Ω 上定义的 n n n 个随机变量 X 1 , X 2 , ⋯ , X n X_1,X_2,\cdots,X_n X 1 , X 2 , ⋯ , X n ,其构成的向量 ( X 1 , X 2 , ⋯ , X n ) (X_1,X_2,\cdots,X_n) ( X 1 , X 2 , ⋯ , X n ) 为 n n n 维随机变量或随机向量.
分布函数:对任意 n n n 个实数 x 1 , x 2 , ⋯ , x n x_1,x_2,\cdots,x_n x 1 , x 2 , ⋯ , x n ,n n n 元函数
F ( x 1 , x 2 , ⋯ , x n ) = P { X 1 ≤ x 1 , X 2 ≤ x 2 , ⋯ , X n ≤ x n } F(x_1,x_2,\cdots,x_n)=P\{X_1\le x_1,X_2\le x_2,\cdots,X_n\le x_n\} F ( x 1 , x 2 , ⋯ , x n ) = P { X 1 ≤ x 1 , X 2 ≤ x 2 , ⋯ , X n ≤ x n }
称为 n n n 维随机变量 ( X 1 , X 2 , ⋯ , X n ) (X_1,X_2,\cdots,X_n) ( X 1 , X 2 , ⋯ , X n ) 的分布函数(或 X 1 , X 2 , ⋯ , X n X_1,X_2,\cdots,X_n X 1 , X 2 , ⋯ , X n 的联合分布函数).
离散型随机变量: ( X 1 , X 2 , ⋯ , X n ) (X_1,X_2,\cdots,X_n) ( X 1 , X 2 , ⋯ , X n ) 的取值是有限个或可列无限个 n n n 元数组,则称为 n n n 维随机变量,其概率分布为
P { X 1 = x i 1 , X 2 = x i 2 , ⋯ , X n = x i n } = p i 1 i 2 ⋯ i n , i 1 , i 2 , ⋯ , i n = 1 , 2 , ⋯ P\{X_1=x_{i_1},X_2=x_{i_2},\cdots,X_n=x_{i_n}\}=p_{i_1i_2\cdots i_n},i_1,i_2,\cdots,i_n=1,2,\cdots P { X 1 = x i 1 , X 2 = x i 2 , ⋯ , X n = x i n } = p i 1 i 2 ⋯ i n , i 1 , i 2 , ⋯ , i n = 1 , 2 , ⋯
连续型随机变量:若存在非负 n n n 元函数 f ( x 1 , x 2 , ⋯ , x n ) f(x_1,x_2,\cdots,x_n) f ( x 1 , x 2 , ⋯ , x n ) 对任意 n n n 个实数 x 1 , x 2 , ⋯ , x n x_1,x_2,\cdots,x_n x 1 , x 2 , ⋯ , x n 有
F ( x 1 , x 2 , ⋯ , x n ) = ∫ − ∞ x 1 ∫ − ∞ x 2 ⋯ ∫ − ∞ x n f ( t 1 , t 2 , ⋯ , t n ) d t n ⋯ d t 2 d t 1 F(x_1,x_2,\cdots,x_n)=\int_{-\infty}^{x_1}\int_{-\infty}^{x_2}\cdots\int_{-\infty}^{x_n}f(t_1,t_2,\cdots,t_n)\mathrm{d}t_n\cdots\mathrm{d}t_2\mathrm{d}t_1 F ( x 1 , x 2 , ⋯ , x n ) = ∫ − ∞ x 1 ∫ − ∞ x 2 ⋯ ∫ − ∞ x n f ( t 1 , t 2 , ⋯ , t n ) d t n ⋯ d t 2 d t 1
则 ( X 1 , X 2 , ⋯ , X n ) (X_1,X_2,\cdots,X_n) ( X 1 , X 2 , ⋯ , X n ) 是 n n n 维连续型随机变量,f ( x 1 , x 2 , ⋯ , x n ) f(x_1,x_2,\cdots,x_n) f ( x 1 , x 2 , ⋯ , x n ) 为 ( X 1 , X 2 , ⋯ , X n ) (X_1,X_2,\cdots,X_n) ( X 1 , X 2 , ⋯ , X n ) 的概率密度(联合概率密度).
边缘分布:在 n n n 维随机变量中可以有 k ( 1 ≤ k < n ) k(1\le k < n) k ( 1 ≤ k < n ) 维的边缘分布. 已知 n n n 维随机变量 ( X 1 , X 2 , ⋯ , X n ) (X_1,X_2,\cdots,X_n) ( X 1 , X 2 , ⋯ , X n ) 的分布函数 F ( x 1 , x 2 , ⋯ , x n ) F(x_1,x_2,\cdots,x_n) F ( x 1 , x 2 , ⋯ , x n ) ,即可确定 k k k 维边缘分布函数,在 F ( x 1 , x 2 , ⋯ , x n ) F(x_1,x_2,\cdots,x_n) F ( x 1 , x 2 , ⋯ , x n ) 保留需要求边缘概率分布的变量,其他变量趋近于 + ∞ +\infty + ∞ ,该极限即为所求边缘分布函数.
例如, ( X 1 , X 2 , ⋯ , X n ) (X_1,X_2,\cdots,X_n) ( X 1 , X 2 , ⋯ , X n ) 关于 X 1 X_1 X 1 的边缘分布函数为
F X 1 ( x 1 ) = F ( x 1 , + ∞ , + ∞ , ⋯ , + ∞ ) , x 1 ∈ R F_{X_1}(x_1)=F(x_1,+\infty,+\infty,\cdots,+\infty),x_1\in\R F X 1 ( x 1 ) = F ( x 1 , + ∞ , + ∞ , ⋯ , + ∞ ) , x 1 ∈ R
而关于 ( X 1 , X 2 , X 3 ) (X_1,X_2,X_3) ( X 1 , X 2 , X 3 ) 的边缘分布函数为
F X 1 X 2 X 3 ( x 1 ) = F ( x 1 , x 2 , x 3 , + ∞ , + ∞ , ⋯ , + ∞ ) , ( x 1 , x 2 , x 3 ) ∈ R 3 F_{X_1X_2X_3}(x_1)=F(x_1,x_2,x_3,+\infty,+\infty,\cdots,+\infty),(x_1,x_2,x_3)\in\R^3 F X 1 X 2 X 3 ( x 1 ) = F ( x 1 , x 2 , x 3 , + ∞ , + ∞ , ⋯ , + ∞ ) , ( x 1 , x 2 , x 3 ) ∈ R 3
对于连续型随机变量 ( X 1 , X 2 , ⋯ , X n ) (X_1,X_2,\cdots,X_n) ( X 1 , X 2 , ⋯ , X n ) ,其概率密度为 f ( x 1 , x 2 , ⋯ , x n ) f(x_1,x_2,\cdots,x_n) f ( x 1 , x 2 , ⋯ , x n ) ,则关于 X 1 X_1 X 1 的边缘概率密度为
f X 1 ( x 1 ) = ∫ − ∞ + ∞ ∫ − ∞ + ∞ ⋯ ∫ − ∞ + ∞ ⏞ n − 1 个积分号 f ( x 1 , x 2 , ⋯ , x n ) d x 2 d x 3 ⋯ d x n , x 1 ∈ R f_{X_1}(x_1)=\overbrace{\int^{+\infty}_{-\infty}\int^{+\infty}_{-\infty}\cdots\int^{+\infty}_{-\infty}}^{n-1\text{个积分号}}f(x_1,x_2,\cdots,x_n)\mathrm{d}x_2\mathrm{d}x_3\cdots\mathrm{d}x_n,x_1\in\R f X 1 ( x 1 ) = ∫ − ∞ + ∞ ∫ − ∞ + ∞ ⋯ ∫ − ∞ + ∞ n − 1 个积分号 f ( x 1 , x 2 , ⋯ , x n ) d x 2 d x 3 ⋯ d x n , x 1 ∈ R
关于 ( X 1 , X 2 , X 3 ) (X_1,X_2,X_3) ( X 1 , X 2 , X 3 ) 的边缘概率密度为
f X 1 X 2 X 3 ( x 1 , x 2 , x 3 ) = ∫ − ∞ + ∞ ∫ − ∞ + ∞ ⋯ ∫ − ∞ + ∞ ⏞ n − 3 个积分号 f ( x 1 , x 2 , ⋯ , x n ) d x 4 d x 5 ⋯ d x n , ( x 1 , x 2 , x 3 ) ∈ R 3 f_{X_1X_2X_3}(x_1,x_2,x_3)=\overbrace{\int^{+\infty}_{-\infty}\int^{+\infty}_{-\infty}\cdots\int^{+\infty}_{-\infty}}^{n-3\text{个积分号}}f(x_1,x_2,\cdots,x_n)\mathrm{d}x_4\mathrm{d}x_5\cdots\mathrm{d}x_n,(x_1,x_2,x_3)\in\R^3 f X 1 X 2 X 3 ( x 1 , x 2 , x 3 ) = ∫ − ∞ + ∞ ∫ − ∞ + ∞ ⋯ ∫ − ∞ + ∞ n − 3 个积分号 f ( x 1 , x 2 , ⋯ , x n ) d x 4 d x 5 ⋯ d x n , ( x 1 , x 2 , x 3 ) ∈ R 3
对于离散型随机变量, ( X 1 , X 2 , ⋯ , X n ) (X_1,X_2,\cdots,X_n) ( X 1 , X 2 , ⋯ , X n ) 关于 X 1 X_1 X 1 的边缘概率分布为
P { X 1 = x i 1 } = ∑ i 2 = 1 ∞ ∑ i 3 = 1 ∞ ⋯ ∑ i n = 1 ∞ p i 1 i 2 ⋯ i n , i = 1 , 2 , ⋯ P\{X_1=x_{i_1}\}=\sum_{i_2=1}^\infty\sum_{i_3=1}^\infty\cdots\sum_{i_n=1}^\infty p_{i_1i_2\cdots i_n},i=1,2,\cdots P { X 1 = x i 1 } = i 2 = 1 ∑ ∞ i 3 = 1 ∑ ∞ ⋯ i n = 1 ∑ ∞ p i 1 i 2 ⋯ i n , i = 1 , 2 , ⋯
相互独立:对于任意 n n n 个实数 x 1 , x 2 , ⋯ , x n x_1,x_2,\cdots,x_n x 1 , x 2 , ⋯ , x n 满足
F ( x 1 , x 2 , ⋯ , x n ) = ∏ i = 1 n F X i ( x i ) F(x_1,x_2,\cdots,x_n)=\prod_{i=1}^nF_{X_i}(x_i) F ( x 1 , x 2 , ⋯ , x n ) = i = 1 ∏ n F X i ( x i )
则随机变量 ( X 1 , X 2 , ⋯ , X n ) (X_1,X_2,\cdots,X_n) ( X 1 , X 2 , ⋯ , X n ) 是相互独立的.
离散型 n n n 维随机向量的相互独立的充分必要条件:P { X 1 = x i 1 , X 2 = x i 2 , ⋯ , X n = x i n } = ∏ j = 1 n P { X i = x i j } P\{X_1=x_{i_1},X_2=x_{i_2},\cdots,X_n=x_{i_n}\}=\prod_{j=1}^n P\{X_i=x_{i_j}\} P { X 1 = x i 1 , X 2 = x i 2 , ⋯ , X n = x i n } = j = 1 ∏ n P { X i = x i j }
连续型 n n n 维随机向量的相互独立的充分必要条件:f ( x 1 , x 2 , ⋯ , x n ) = ∏ i = 1 n f X i ( x i ) f(x_1,x_2,\cdots,x_n)=\prod_{i=1}^nf_{X_i}(x_i) f ( x 1 , x 2 , ⋯ , x n ) = i = 1 ∏ n f X i ( x i )
正态分布:n n n 维随机变量 X 1 , X 2 , ⋯ , X n X_1,X_2,\cdots,X_n X 1 , X 2 , ⋯ , X n 相互独立,且均服从正态分布,即 X i ∼ N ( μ i , σ i 2 ) X_i\sim N(\mu_i,\sigma_i^2) X i ∼ N ( μ i , σ i 2 ) ,则他们的线性函数也服从正态分布:
∑ i = 1 n c i X i ∼ N ( ∑ i = 1 n c i μ i , ∑ i = 1 n c i 2 σ i 2 ) \sum_{i=1}^nc_iX_i\sim N\left( \sum_{i=1}^nc_i\mu_i,\sum_{i=1}^nc_i^2\sigma^2_i \right) i = 1 ∑ n c i X i ∼ N ( i = 1 ∑ n c i μ i , i = 1 ∑ n c i 2 σ i 2 )
对于任意 m + n m+n m + n 个实数 x 1 , x 2 , ⋯ , x m , y 1 , y 2 , ⋯ , y n x_1,x_2,\cdots,x_m,y_1,y_2,\cdots,y_n x 1 , x 2 , ⋯ , x m , y 1 , y 2 , ⋯ , y n ,如果有
F ( x 1 , x 2 , ⋯ , x m , y 1 , y 2 , ⋯ , y n ) = F 1 ( x 1 , x 2 , ⋯ ) F 2 ( y 1 , y 2 , ⋯ , y n ) F(x_1,x_2,\cdots,x_m,y_1,y_2,\cdots,y_n)=F_1(x_1,x_2,\cdots)F_2(y_1,y_2,\cdots,y_n) F ( x 1 , x 2 , ⋯ , x m , y 1 , y 2 , ⋯ , y n ) = F 1 ( x 1 , x 2 , ⋯ ) F 2 ( y 1 , y 2 , ⋯ , y n )
其中 F , F 1 , F 2 F,F_1,F_2 F , F 1 , F 2 分别为 ( X 1 , ⋯ , X m , Y 1 , ⋯ , Y n ) , ( X 1 , ⋯ , X m ) , ( Y 1 , ⋯ , Y n ) (X_1,\cdots,X_m,Y_1,\cdots,Y_n),(X_1,\cdots,X_m),(Y_1,\cdots,Y_n) ( X 1 , ⋯ , X m , Y 1 , ⋯ , Y n ) , ( X 1 , ⋯ , X m ) , ( Y 1 , ⋯ , Y n ) 的分布函数,则 ( X 1 , ⋯ , X m ) , ( Y 1 , ⋯ , Y n ) (X_1,\cdots,X_m),(Y_1,\cdots,Y_n) ( X 1 , ⋯ , X m ) , ( Y 1 , ⋯ , Y n ) 是相互独立的,相应的函数 h ( X 1 , ⋯ , X m ) h(X_1,\cdots,X_m) h ( X 1 , ⋯ , X m ) 和 g ( Y 1 , ⋯ , Y n ) g(Y_1,\cdots,Y_n) g ( Y 1 , ⋯ , Y n ) 也是相互独立的.
X 1 , X 2 , ⋯ , X n X_1,X_2,\cdots,X_n X 1 , X 2 , ⋯ , X n 是 n n n 个相互独立的随机变量,则 M = max ( X 1 , X 2 , ⋯ , X n ) M=\max(X_1,X_2,\cdots,X_n) M = max ( X 1 , X 2 , ⋯ , X n ) 的分布函数为
F max ( z ) = ∏ i = 1 n F X i ( z ) , z ∈ R F_{\max}(z)=\prod_{i=1}^nF_{X_i}(z),z\in\R F m a x ( z ) = i = 1 ∏ n F X i ( z ) , z ∈ R
M = min ( X 1 , X 2 , ⋯ , X n ) M=\min(X_1,X_2,\cdots,X_n) M = min ( X 1 , X 2 , ⋯ , X n ) 的分布函数为
F min ( z ) = 1 − ∏ i = 1 n [ 1 − F X i ( z ) ] , z ∈ R F_{\min}(z)=1-\prod_{i=1}^n[1-F_{X_i}(z)],z\in\R F m i n ( z ) = 1 − i = 1 ∏ n [ 1 − F X i ( z )] , z ∈ R
多项分布 多项分布是二项分布的推广,适用于随机试验 E E E 中有 r r r 种互不相容事件 A 1 , A 2 , ⋯ , A r A_1,A_2,\cdots,A_r A 1 , A 2 , ⋯ , A r 可能发生的情况. 记 P ( A i ) = p i , X i P(A_i)=p_i,X_i P ( A i ) = p i , X i 为 n n n 次独立重复试验中事件 A i A_i A i 发生的次数,则 n n n 维随机变量 ( X 1 , X 2 , ⋯ , X r ) (X_1,X_2,\cdots,X_r) ( X 1 , X 2 , ⋯ , X r ) 取值为 ( n 1 , n 2 , ⋯ , n r ) (n_1,n_2,\cdots,n_r) ( n 1 , n 2 , ⋯ , n r ) 的概率为
P { X 1 = n 1 , X 2 = n 2 , ⋯ , X r = n r } = n ! n 1 ! n 2 ! ⋯ n r ! p 1 n 1 p 2 n 2 ⋯ p r n r P\{X_1=n_1,X_2=n_2,\cdots,X_r=n_r\}=\dfrac{n!}{n_1!n_2!\cdots n_r!}p_1^{n_1}p_2^{n_2}\cdots p_r^{n_r} P { X 1 = n 1 , X 2 = n 2 , ⋯ , X r = n r } = n 1 ! n 2 ! ⋯ n r ! n ! p 1 n 1 p 2 n 2 ⋯ p r n r
这个概率分布称为多项分布,也叫 r r r 项分布,因为其系数对应 ( p 1 + p 2 + ⋯ + p r ) n (p_1+p_2+\cdots+p_r)^n ( p 1 + p 2 + ⋯ + p r ) n 展开的系数. r r r 项分布是 r − 1 r-1 r − 1 维随机变量的分布,因为 n r n_r n r 总可以用前 r − 1 r-1 r − 1 个自变量表示.
多维超几何分布 多维超几何分布是超几何分布的推广,适用于不放回抽样. 袋中有 N N N 个球,其中 i ( i = 1 , 2 , ⋯ , r ) i(i=1,2,\cdots,r) i ( i = 1 , 2 , ⋯ , r ) 号球有 N i N_i N i 个,取出任意 n ( n ≤ N ) n(n\le N) n ( n ≤ N ) 个球,记随机变量 X i X_i X i 表示 i i i 号球抽到 n i n_i n i 个,则
P { X 1 = n 1 , X 2 = n 2 , ⋯ , X r = n r } = ( N 1 n 1 ) ( N 2 n 2 ) ⋯ ( N r n r ) ( N n ) P\{X_1=n_1,X_2=n_2,\cdots,X_r=n_r\}=\dfrac{\binom{N_1}{n_1}\binom{N_2}{n_2}\cdots\binom{N_r}{n_r}}{\binom{N}{n}} P { X 1 = n 1 , X 2 = n 2 , ⋯ , X r = n r } = ( n N ) ( n 1 N 1 ) ( n 2 N 2 ) ⋯ ( n r N r )
r r r 维超几何分布同样是 r − 1 r-1 r − 1 维随机变量的分布.
多维均匀分布 设有界区域 D ⊂ R n D\sub \R^n D ⊂ R n ,其度量为 S D S_D S D (面积、体积等),若随机变量 ( X 1 , X 2 , ⋯ , X n ) (X_1,X_2,\cdots,X_n) ( X 1 , X 2 , ⋯ , X n ) 的联合密度函数为
f ( x 1 , x 2 , ⋯ , x n ) = { 1 S D , ( x 1 , x 2 , ⋯ , x n ) ∈ D , 0 , 其他 , f(x_1,x_2,\cdots,x_n)=\begin{equation*} \begin{cases} \dfrac{1}{S_D},&(x_1,x_2,\cdots,x_n)\in D, \\ 0,&\text{其他}, \end{cases} \end{equation*} f ( x 1 , x 2 , ⋯ , x n ) = ⎩ ⎨ ⎧ S D 1 , 0 , ( x 1 , x 2 , ⋯ , x n ) ∈ D , 其他 ,
则称 ( X 1 , X 2 , ⋯ , X n ) (X_1,X_2,\cdots,X_n) ( X 1 , X 2 , ⋯ , X n ) 服从 D D D 上的均匀分布,记为 ( X 1 , X 2 , ⋯ , X n ) ∼ U ( D ) (X_1,X_2,\cdots,X_n)\sim U(D) ( X 1 , X 2 , ⋯ , X n ) ∼ U ( D ) .
随机变量的数字特征 数学期望 设离散型随机变量 X X X 的概率分布为 P { X = x k } = p k ( k = 1 , 2 , ⋯ ) P\{X=x_k\}=p_k(k=1,2,\cdots) P { X = x k } = p k ( k = 1 , 2 , ⋯ ) ,无穷级数 ∑ k = 1 ∞ x k p k \sum\limits_{k=1}^\infty x_kp_k k = 1 ∑ ∞ x k p k 绝对收敛,则称无穷级数 ∑ k = 1 ∞ x k p k \sum\limits_{k=1}^\infty x_kp_k k = 1 ∑ ∞ x k p k 的和为离散型随机变量 X X X 的数学期望或均值,记作 E ( X ) E(X) E ( X ) .
设离散型随机变量 X X X 的概率密度为 f ( x ) f(x) f ( x ) ,若反常积分 ∫ − ∞ + ∞ x f ( x ) d x \int_{-\infty}^{+\infty}xf(x)\mathrm{d}x ∫ − ∞ + ∞ x f ( x ) d x 绝对收敛,则称该反常积分的值为连续型随机变量 X X X 的数学期望或均值,记作 E ( X ) E(X) E ( X ) .
设随机变量 Y = g ( X ) Y=g(X) Y = g ( X ) ,其中 g ( x ) g(x) g ( x ) 为一元连续函数.
若 X X X 为离散型随机变量,其概率分布为 P { X = x k } = p k ( k = 1 , 2 , ⋯ ) P\{X=x_k\}=p_k(k=1,2,\cdots) P { X = x k } = p k ( k = 1 , 2 , ⋯ ) ,如果无穷级数 ∑ k = 1 ∞ x k p k \sum\limits_{k=1}^\infty x_kp_k k = 1 ∑ ∞ x k p k 是绝对收敛的,则 Y Y Y 的数学期望为 E ( Y ) = E [ g ( X ) ] = ∑ k = 1 ∞ g ( x k ) p k E(Y)=E[g(X)]=\sum\limits_{k=1}^\infty g(x_k)p_k E ( Y ) = E [ g ( X )] = k = 1 ∑ ∞ g ( x k ) p k . 若 Y Y Y 为连续型随机变量,其概率密度为 f ( x ) f(x) f ( x ) ,若反常积分若反常积分 ∫ − ∞ + ∞ g ( x ) f ( x ) d x \int_{-\infty}^{+\infty}g(x)f(x)\mathrm{d}x ∫ − ∞ + ∞ g ( x ) f ( x ) d x 绝对收敛,则 Y Y Y 的数学期望为 E ( Y ) = E [ g ( X ) ] = ∫ − ∞ + ∞ g ( x ) f ( x ) d x E(Y)=E[g(X)]=\int_{-\infty}^{+\infty}g(x)f(x)\mathrm{d}x E ( Y ) = E [ g ( X )] = ∫ − ∞ + ∞ g ( x ) f ( x ) d x . 对于二维随机变量也有类似的结论:对于离散型随机变量,E [ g ( X , Y ) ] = ∑ i = 1 ∞ ∑ j = 1 ∞ g ( x i , y j ) p i j E[g(X,Y)]=\sum\limits_{i=1}^\infty\sum\limits_{j=1}^\infty g(x_i,y_j)p_{ij} E [ g ( X , Y )] = i = 1 ∑ ∞ j = 1 ∑ ∞ g ( x i , y j ) p ij ;对于连续型随机变量,E [ g ( X , Y ) ] = ∫ − ∞ + ∞ ∫ − ∞ + ∞ g ( x , y ) f ( x , y ) d x d y E[g(X,Y)]=\int_{-\infty}^{+\infty}\int_{-\infty}^{+\infty}g(x,y)f(x,y)\mathrm{d}x\mathrm{d}y E [ g ( X , Y )] = ∫ − ∞ + ∞ ∫ − ∞ + ∞ g ( x , y ) f ( x , y ) d x d y . 其中 g ( x , y ) g(x,y) g ( x , y ) 是二元连续函数,要求上述无穷级数或反常积分都是绝对收敛的. 数学期望具有如下性质,假定 C C C 为常数,X , Y X,Y X , Y 的数学期望都存在:
E ( C ) = C E(C)=C E ( C ) = C E ( C X ) = C E ( X ) E(CX)=CE(X) E ( C X ) = C E ( X ) E ( X + Y ) = E ( X ) + E ( Y ) E(X+Y)=E(X)+E(Y) E ( X + Y ) = E ( X ) + E ( Y ) E ( a X + b Y + c ) = a E ( X ) + b E ( Y ) + c E(aX+bY+c)=aE(X)+bE(Y)+c E ( a X + bY + c ) = a E ( X ) + b E ( Y ) + c 若随机变量 X , Y X,Y X , Y 相互独立,则 E ( X Y ) = E ( X ) E ( Y ) E(XY)=E(X)E(Y) E ( X Y ) = E ( X ) E ( Y ) ,反之未必成立 [ E ( X Y ) ] 2 ≤ E ( X 2 ) E ( Y 2 ) [E(XY)]^2\le E(X^2)E(Y^2) [ E ( X Y ) ] 2 ≤ E ( X 2 ) E ( Y 2 ) 数学期望反映了随机变量的加权平均值.
方差 方差反映随机变量与其均值之间的偏离程度. 设 X X X 为随机变量,若期望 E { [ X − E ( X ) ] 2 } E\{[X-E(X)]^2\} E {[ X − E ( X ) ] 2 } 存在,则称之为 X X X 的方差,记作 D ( X ) D(X) D ( X ) . D ( X ) \sqrt{D(X)} D ( X ) 称作随机变量的标准差或均方差,记为 σ ( X ) \sigma(X) σ ( X ) . 如果随机变量的取值在期望附近,则方差较小;若随机变量取值较为分散,则方差会更大. 根据定义,离散型、连续型随机变量的方差计算公式如下:
D ( X ) = ∑ i = 1 ∞ [ x k − E ( X ) ] 2 p k D(X)=\sum_{i=1}^\infty[x_k-E(X)]^2p_k D ( X ) = i = 1 ∑ ∞ [ x k − E ( X ) ] 2 p k
D ( X ) = ∫ − ∞ + ∞ [ x − E ( X ) ] 2 f ( x ) d x D(X)=\int_{-\infty}^{+\infty}[x-E(X)]^2f(x)\mathrm{d}x D ( X ) = ∫ − ∞ + ∞ [ x − E ( X ) ] 2 f ( x ) d x
常用的计算方差的公式是
D ( X ) = E ( X 2 ) − [ E ( X ) ] 2 D(X)=E(X^2)-[E(X)]^2 D ( X ) = E ( X 2 ) − [ E ( X ) ] 2
其中,E ( X 2 ) E(X^2) E ( X 2 ) 可由随机变量函数的期望的计算方法求得.
方差具有如下性质,假定 C C C 为常数,X , Y X,Y X , Y 的数学期望和方差都存在:
D ( C ) = 0 D(C)=0 D ( C ) = 0 D ( C X ) = C 2 D ( X ) D(CX)=C^2D(X) D ( C X ) = C 2 D ( X ) D ( X + C ) = D ( X ) D(X+C)=D(X) D ( X + C ) = D ( X ) 若 X , Y X,Y X , Y 相互独立,则 D ( X ± Y ) = D ( X ) ± D ( Y ) D(X\pm Y)=D(X)\pm D(Y) D ( X ± Y ) = D ( X ) ± D ( Y ) 随机变量 X X X 的方差为 0 的充分必要条件是 P { X = C } = 1 P\{X=C\}=1 P { X = C } = 1 随机变量 X X X 具有数学期望 E ( X ) = μ E(X)=\mu E ( X ) = μ 和方差 D ( X ) = σ 2 D(X)=\sigma^2 D ( X ) = σ 2 ,则称 X ∗ = X − μ σ X^*=\dfrac{X-\mu}{\sigma} X ∗ = σ X − μ 是 X X X 的标准化变量. 该标准化变量的 E ( X ∗ ) = 0 , D ( X ∗ ) = 1 E(X^*)=0,D(X^*)=1 E ( X ∗ ) = 0 , D ( X ∗ ) = 1 .
常见分布的期望和方差 名称 概率密度函数/分布律 数学期望 方差 (0-1)分布 P { X = k } = p k ( 1 − p ) 1 − k k = 0 , 1 , 0 < p < 1 P\{X=k\}=p^k(1-p)^{1-k}\\k=0,1,0<p<1 P { X = k } = p k ( 1 − p ) 1 − k k = 0 , 1 , 0 < p < 1 p p p p ( 1 − p ) p(1-p) p ( 1 − p ) 二项分布 B ( n , p ) B(n,p) B ( n , p ) P { X = k } = ( n k ) p k ( 1 − p ) n − k P\{X=k\}=\binom{n}{k}p^k(1-p)^{n-k} P { X = k } = ( k n ) p k ( 1 − p ) n − k n p np n p n p ( 1 − p ) np(1-p) n p ( 1 − p ) 泊松分布 P ( λ ) P(\lambda) P ( λ ) P { X = k } = λ k e − λ k ! P\{X=k\}=\dfrac{\lambda^k\mathrm{e}^{-\lambda}}{k!} P { X = k } = k ! λ k e − λ λ \lambda λ λ \lambda λ 几何分布 P { X = k } = ( 1 − p ) k − 1 p P\{X=k\}=(1-p)^{k-1}p P { X = k } = ( 1 − p ) k − 1 p 1 p \dfrac{1}{p} p 1 1 − p p 2 \dfrac{1-p}{p^2} p 2 1 − p 均匀分布 U ( a , b ) U(a,b) U ( a , b ) f ( x ) = 1 b − a f(x)=\dfrac{1}{b-a} f ( x ) = b − a 1 a + b 2 \dfrac{a+b}{2} 2 a + b ( b − a ) 2 12 \dfrac{(b-a)^2}{12} 12 ( b − a ) 2 正态分布 N ( μ , σ 2 ) N(\mu,\sigma^2) N ( μ , σ 2 ) f ( x ) = 1 2 π σ e − ( x − μ ) 2 2 σ 2 f(x)=\dfrac{1}{\sqrt{2\pi}\sigma}\mathrm{e}^{-\frac{(x-\mu)^2}{2\sigma^2}} f ( x ) = 2 π σ 1 e − 2 σ 2 ( x − μ ) 2 μ \mu μ σ 2 \sigma^2 σ 2 指数分布 f ( x ) = λ e − λ x ( x > 0 ) f(x)=\lambda\mathrm{e}^{-\lambda x}(x>0) f ( x ) = λ e − λ x ( x > 0 ) 1 λ \dfrac{1}{\lambda} λ 1 1 λ 2 \dfrac{1}{\lambda^2} λ 2 1
协方差 设随机变量 X , Y X,Y X , Y 的数学期望都存在,若 E { [ X − E ( X ) ] [ Y − E ( Y ) ] } E\{[X-E(X)][Y-E(Y)]\} E {[ X − E ( X )] [ Y − E ( Y )]} 存在,则称其为 X , Y X,Y X , Y 的协方差,记为 Cov ( X , Y ) \text{Cov}(X,Y) Cov ( X , Y ) .
常用的计算协方差的公式是
Cov ( X , Y ) = E ( X Y ) − E ( X ) E ( Y ) \text{Cov}(X,Y)=E(XY)-E(X)E(Y) Cov ( X , Y ) = E ( X Y ) − E ( X ) E ( Y )
协方差具有以下性质:
Cov ( X , Y ) = Cov ( Y , X ) \text{Cov}(X,Y)=\text{Cov}(Y,X) Cov ( X , Y ) = Cov ( Y , X ) 若 a , b a,b a , b 为常数,则 Cov ( a X , b Y ) = a b Cov ( X , Y ) \text{Cov}(aX,bY)=ab\text{Cov}(X,Y) Cov ( a X , bY ) = ab Cov ( X , Y ) Cov ( X + Y , Z ) = Cov ( X , Z ) + Cov ( Y , Z ) \text{Cov}(X+Y,Z)=\text{Cov}(X,Z)+\text{Cov}(Y,Z) Cov ( X + Y , Z ) = Cov ( X , Z ) + Cov ( Y , Z ) D ( X ± Y ) = D ( X ) + D ( Y ) ± 2 Cov ( X , Y ) D(X\pm Y)=D(X)+D(Y)\pm 2\text{Cov}(X,Y) D ( X ± Y ) = D ( X ) + D ( Y ) ± 2 Cov ( X , Y ) Cov ( X , X ) = D ( X ) \text{Cov}(X,X)=D(X) Cov ( X , X ) = D ( X ) X , Y X,Y X , Y 相互独立是 Cov ( X , Y ) = 0 \text{Cov}(X,Y)=0 Cov ( X , Y ) = 0 的充分不必要条件相关系数 设随机变量 X , Y X,Y X , Y 的方差都存在且不等于0,协方差 Cov ( X , Y ) \text{Cov}(X,Y) Cov ( X , Y ) 存在,称
ρ X Y = Cov ( X , Y ) D ( X ) D ( Y ) \rho_{XY}=\dfrac{\text{Cov}(X,Y)}{\sqrt{D(X)}\sqrt{D(Y)}} ρ X Y = D ( X ) D ( Y ) Cov ( X , Y )
为 X , Y X,Y X , Y 的相关系数. 当 ρ X Y = 0 \rho_{XY}=0 ρ X Y = 0 时,称为 X , Y X,Y X , Y 不相关.
相关系数为0的两个随机变量不一定相互独立. 相互独立的两个随机变量,相关系数必定为0. ∣ ρ X Y ∣ ≤ 1 |\rho_{XY}|\le 1 ∣ ρ X Y ∣ ≤ 1 ∣ ρ X Y ∣ = 1 |\rho_{XY}| = 1 ∣ ρ X Y ∣ = 1 的充分必要条件是存在常数 a , b a,b a , b 使 P { Y = a + b X } = 1 P\{Y=a+bX\}=1 P { Y = a + b X } = 1 相关系数表示两个随机变量线性相关的程度.
∣ ρ X Y ∣ = 1 |\rho_{XY}|= 1 ∣ ρ X Y ∣ = 1 时,两个随机变量存在线性关系∣ ρ X Y ∣ |\rho_{XY}| ∣ ρ X Y ∣ 较大时,两个随机变量线性相关关系的程度较好∣ ρ X Y ∣ |\rho_{XY}| ∣ ρ X Y ∣ 较小时,两个随机变量线性相关的程度较差ρ X Y > 0 \rho_{XY}>0 ρ X Y > 0 时,X X X 与 Y Y Y 正相关,反之则为负相关对于随机变量 X , Y X,Y X , Y ,若相关的数字特征是存在的,则下列命题等价:
Cov ( X , Y ) = 0 \text{Cov}(X,Y)=0 Cov ( X , Y ) = 0 X , Y X,Y X , Y 不相关E ( X Y ) = E ( X ) E ( Y ) E(XY)=E(X)E(Y) E ( X Y ) = E ( X ) E ( Y ) D ( X + Y ) = D ( X ) + D ( Y ) D(X+Y)=D(X)+D(Y) D ( X + Y ) = D ( X ) + D ( Y ) 上述条件都是 X , Y X,Y X , Y 相互独立的必要不充分条件.
对于二维正态分布 ( X , Y ) ∼ N ( μ 1 , μ 2 , σ 1 2 , σ 2 2 , ρ ) (X,Y)\sim N(\mu_1,\mu_2,\sigma_1^2,\sigma_2^2,\rho) ( X , Y ) ∼ N ( μ 1 , μ 2 , σ 1 2 , σ 2 2 , ρ ) ,X , Y X,Y X , Y 相互独立的充分必要条件是 ρ = 0 \rho=0 ρ = 0 ,且 ρ X Y = ρ \rho_{XY}=\rho ρ X Y = ρ . 因此二维正态分布完全由 X , Y X,Y X , Y 的期望、方差、相关系数决定.
矩 设 X , Y X,Y X , Y 为随机变量,k , l k,l k , l 为正整数.
原点矩:若 E ( X k ) E(X^k) E ( X k ) 存在,则称为 X X X 的 k k k 阶原点矩,记作 μ k = E ( X k ) \mu_k=E(X^k) μ k = E ( X k ) . 中心矩:若 E { [ X − E ( X ) ] k } E\{[X-E(X)]^k\} E {[ X − E ( X ) ] k } 存在,则称为 X X X 的 k k k 阶中心矩,记为 ν k = E { [ X − E ( X ) ] k } \nu_k=E\{[X-E(X)]^k\} ν k = E {[ X − E ( X ) ] k } . 混合原点矩:若 E ( X k Y l ) E(X^kY^l) E ( X k Y l ) 存在,则称为 X , Y X,Y X , Y 的 k + l k+l k + l 阶原点矩. 混合中心矩:若 E { [ X − E ( X ) ] k [ Y − E ( Y ) ] l } E\{[X-E(X)]^k [Y-E(Y)]^l\} E {[ X − E ( X ) ] k [ Y − E ( Y ) ] l } 存在,则称为 X , Y X,Y X , Y 的 k + l k+l k + l 阶混合中心矩. 显然 E ( X ) E(X) E ( X ) 是 X X X 的一阶原点矩,D ( X ) D(X) D ( X ) 是 X X X 的二阶中心矩,协方差 Cov ( X , Y ) \text{Cov}(X,Y) Cov ( X , Y ) 是 X , Y X,Y X , Y 的二阶混合中心矩.
中心矩和原点矩的关系为
E { [ X − E ( X ) ] k } = E [ ( X − μ 1 ) k ] E\{[X-E(X)]^k\}=E[(X-\mu_1)^k] E {[ X − E ( X ) ] k } = E [( X − μ 1 ) k ]
根据二项式定理有
E [ ( X − μ 1 ) k ] = E [ ∑ i = 0 k ( − 1 ) k − i ( k i ) μ 1 k − i X i ] = ∑ i = 0 k ( − 1 ) k − i ( k i ) μ 1 k − i E ( X i ) E[(X-\mu_1)^k]=E\left[\sum_{i=0}^k(-1)^{k-i}\binom{k}{i}\mu_1^{k-i}X^i\right]=\sum_{i=0}^k(-1)^{k-i}\binom{k}{i}\mu_1^{k-i}E(X^i) E [( X − μ 1 ) k ] = E [ i = 0 ∑ k ( − 1 ) k − i ( i k ) μ 1 k − i X i ] = i = 0 ∑ k ( − 1 ) k − i ( i k ) μ 1 k − i E ( X i )
注意到 E ( X i ) = μ i E(X^i)=\mu_i E ( X i ) = μ i ,即
E { [ X − E ( X ) ] k } = ∑ i = 1 k ( − 1 ) k − i ( k i ) μ 1 k − i μ i E\{[X-E(X)]^k\}=\sum_{i=1}^k(-1)^{k-i}\binom{k}{i}\mu_1^{k-i}\mu_i E {[ X − E ( X ) ] k } = i = 1 ∑ k ( − 1 ) k − i ( i k ) μ 1 k − i μ i
随机变量 X X X 的前四阶中心矩可用原点矩表示如下:
ν 1 = 0 \nu_1=0 ν 1 = 0
ν 2 = μ 2 − μ 1 2 \nu_2=\mu_2-\mu_1^2 ν 2 = μ 2 − μ 1 2
ν 3 = μ 3 − 3 μ 1 μ 2 + 2 μ 1 3 \nu_3=\mu_3-3\mu_1\mu_2+2\mu_1^3 ν 3 = μ 3 − 3 μ 1 μ 2 + 2 μ 1 3
ν 4 = μ 4 − 4 μ 1 μ 3 + 6 μ 2 μ 1 2 − 3 μ 1 4 \nu_4=\mu_4-4\mu_1\mu_3+6\mu_2\mu_1^2-3\mu_1^4 ν 4 = μ 4 − 4 μ 1 μ 3 + 6 μ 2 μ 1 2 − 3 μ 1 4
正态分布N ( 0 , σ 2 ) N(0,\sigma^2) N ( 0 , σ 2 ) 的偶数阶原点矩为 ν k = ( k − 1 ) ! ! σ k , k = 2 , 4 , 6 … \nu_k=(k-1)!!\sigma^k,k=2,4,6\dots ν k = ( k − 1 )!! σ k , k = 2 , 4 , 6 … ,奇数阶原点矩总为0.
分位数 设连续型随机变量 X X X 的分布函数为 F ( x ) F(x) F ( x ) ,概率密度为 f ( x ) f(x) f ( x ) ,对任意实数 p ∈ ( 0 , 1 ) p\in(0,1) p ∈ ( 0 , 1 ) ,满足
F ( x p ) = ∫ − ∞ x p f ( x ) d x = p F(x_p)=\int_{-\infty}^{x_p}f(x)\mathrm{d}x=p F ( x p ) = ∫ − ∞ x p f ( x ) d x = p
的实数 x p x_p x p 称为下侧 p p p 分位数,它表示概率密度曲线下 x p x_p x p 左侧部分的面积为 p p p ;满足
1 − F ( x p ′ ) = ∫ x p ′ + ∞ f ( x ) d x = p 1-F(x_p')=\int_{x_p'}^{+\infty}f(x)\mathrm{d}x=p 1 − F ( x p ′ ) = ∫ x p ′ + ∞ f ( x ) d x = p
的实数 x p ′ x_p' x p ′ 称为上侧 p p p 分位数(因为分布函数表示 x p ′ x_p' x p ′ 左侧的面积,因此要用1减去分布函数值),它表示概率密度曲线下 x p ′ x_p' x p ′ 右侧部分的面积为 p p p .
对于同一个 p p p 值,上下侧分位数满足 x p = x 1 − p ′ , x p ′ = x 1 − p x_p=x_{1-p}',x_p'=x_{1-p} x p = x 1 − p ′ , x p ′ = x 1 − p .
一般情况下,分位数指的是下侧分位数.
中位数 设连续型随机变量 X X X 的分布函数为 F ( x ) F(x) F ( x ) ,概率密度为 f ( x ) f(x) f ( x ) ,称 p = 0.5 p=0.5 p = 0.5 时的分位数 x 0.5 x_{0.5} x 0.5 为 X X X 的中位数,即
F ( x 0.5 ) = ∫ − ∞ x 0.5 f ( x ) d x = 0.5 F(x_{0.5})=\int_{-\infty}^{x_{0.5}}f(x)\mathrm{d}x=0.5 F ( x 0.5 ) = ∫ − ∞ x 0.5 f ( x ) d x = 0.5
偏度 设随机变量 X X X 的前三阶矩存在,则称
β s = ν 3 ν 2 3 2 = E { [ X − E ( X ) ] 3 } σ 3 ( X ) \beta_s=\dfrac{\nu_3}{\nu_2^{\frac{3}{2}}}=\dfrac{E\{[X-E(X)]^3\}}{\sigma^3(X)} β s = ν 2 2 3 ν 3 = σ 3 ( X ) E {[ X − E ( X ) ] 3 }
为随机变量 X X X 的偏度系数,简称偏度,偏度是无量纲数.
当 β s > 0 \beta_s>0 β s > 0 时,称该分布右偏(正偏),概率密度函数的图像中右侧有长尾,表示变量在高值处有较大的偏离均值的趋势. 当 β s < 0 \beta_s<0 β s < 0 时,称该分布左偏(负偏),概率密度函数的图像中左侧有长尾,表示变量在低值处有较大的偏离均值的趋势. 当密度函数关于数学期望对称时,偏度为0. 所有正态分布的偏度都为0. 当 β s ≠ 0 \beta_s\neq 0 β s = 0 时,称该分布为偏态分布. 峰度 设随机变量 X X X 的前四阶矩存在,则称
β k = ν 4 ν 2 2 − 3 = E { [ X − E ( X ) ] 4 } [ D ( X ) ] 2 − 3 \beta_k=\dfrac{\nu_4}{\nu_2^2}-3=\dfrac{E\{[X-E(X)]^4\}}{[D(X)]^2}-3 β k = ν 2 2 ν 4 − 3 = [ D ( X ) ] 2 E {[ X − E ( X ) ] 4 } − 3
为随机变量 X X X 的峰度系数,即峰度,峰度也是无量纲数. 峰度是描述分布尾部粗细和尖峭程度的特征数.
峰度不是密度函数上峰值的高低,与方差无关,是一个相对于正态分布的指标. 记 X X X 的标准化变量为 X ∗ X^* X ∗ ,则
β k = E { [ X − E ( X ) ] 4 } [ D ( X ) ] 2 − 3 = E { [ X − E ( X ) ] 4 } / [ σ ( X ) ] 4 [ D ( X ) ] 2 / [ σ ( X ) ] 4 − 3 = E [ ( X ∗ ) 4 ] − 3 \beta_k=\dfrac{E\{[X-E(X)]^4\}}{[D(X)]^2}-3=\dfrac{E\{[X-E(X)]^4\}/[\sigma(X)]^4}{[D(X)]^2/[\sigma(X)]^4}-3=E[(X^*)^4]-3 β k = [ D ( X ) ] 2 E {[ X − E ( X ) ] 4 } − 3 = [ D ( X ) ] 2 / [ σ ( X ) ] 4 E {[ X − E ( X ) ] 4 } / [ σ ( X ) ] 4 − 3 = E [( X ∗ ) 4 ] − 3
注意到 标准正态分布的四阶原点矩为3,因此峰度系数表示的是 标准化变量 相对于标准正态分布而言的超出量.
β k > 0 \beta_k>0 β k > 0 表示标准化后的分布比正态分布更加陡峭、尾部更粗β k < 0 \beta_k<0 β k < 0 表示标准化后的分布比正态分布更加平坦、尾部更细β k = 0 \beta_k=0 β k = 0 表示标准化后的分布与正态分布的陡峭程度相同实际分布若峰度、偏度均接近0,则可认为该分布近似为正态分布 偏度和峰度两个特征数描述了分布的形状,如果偏度、峰度与某个参数均无关,则该参数不能称为形状参数;反之,若偏度、峰度与参数有关,则该参数为形状参数. 变异系数 若随机变量 X X X 的二阶矩存在,则称
C v ( X ) = D ( X ) E ( X ) C_v(X)=\dfrac{\sqrt{D(X)}}{E(X)} C v ( X ) = E ( X ) D ( X )
为 X X X 的变异系数. 变异系数消除了量纲和取值大小的差异,能表示波动的相对大小.
大数定律与中心极限定理 切比雪夫不等式 设随机变量 X X X 具有数学期望 E ( X ) = μ E(X)=\mu E ( X ) = μ 和方差 D ( X ) = σ 2 D(X)=\sigma^2 D ( X ) = σ 2 ,则对于任意给定的正数 ε \varepsilon ε 有
P { ∣ X − E ( X ) ∣ ≥ ε } ≤ D ( X ) ε 2 P\{|X-E(X)|\ge \varepsilon\}\le \dfrac{D(X)}{\varepsilon^2} P { ∣ X − E ( X ) ∣ ≥ ε } ≤ ε 2 D ( X )
该不等式称为切比雪夫不等式,等价于
P { ∣ X − E ( X ) ∣ < ε } ≥ 1 − D ( X ) ε 2 P\{|X-E(X)|< \varepsilon\}\ge 1- \dfrac{D(X)}{\varepsilon^2} P { ∣ X − E ( X ) ∣ < ε } ≥ 1 − ε 2 D ( X )
大数定律 依概率收敛:设 X 1 , X 2 , ⋯ , X n X_1,X_2,\cdots,X_n X 1 , X 2 , ⋯ , X n 是随机变量序列,a a a 为常数,若对于任意给定实数 ε \varepsilon ε ,有
lim n → ∞ P { ∣ X n − a ∣ < ε } = 1 \lim_{n\to\infty}P\{|X_n-a|<\varepsilon\}=1 n → ∞ lim P { ∣ X n − a ∣ < ε } = 1
则称随机变量 X 1 , X 2 , ⋯ , X n X_1,X_2,\cdots,X_n X 1 , X 2 , ⋯ , X n 依概率收敛于 a a a ,记为 X n → P a X_n\xrightarrow{P} a X n P a .
切比雪夫定理:设随机变量 X 1 , X 2 , ⋯ , X n , ⋯ X_1,X_2,\cdots,X_n,\cdots X 1 , X 2 , ⋯ , X n , ⋯ 相互独立,分别具有数学期望和方差,且方差是一致有上界的(∃ M > 0 , D ( X n ) ≤ M \exists M>0,D(X_n)\le M ∃ M > 0 , D ( X n ) ≤ M ),则对任意给定正数 ε \varepsilon ε 有
lim n → ∞ P { ∣ 1 n ∑ i = 1 n X k − 1 n ∑ i = 1 n E ( X k ) ∣ < ε } = 1 \lim_{n\to\infty}P\left\{\left|\dfrac{1}{n}\sum_{i=1}^nX_k-\dfrac{1}{n}\sum_{i=1}^nE(X_k)\right|<\varepsilon\right\}=1 n → ∞ lim P { n 1 i = 1 ∑ n X k − n 1 i = 1 ∑ n E ( X k ) < ε } = 1
即 X 1 , X 2 , ⋯ , X n , X_1,X_2,\cdots,X_n, X 1 , X 2 , ⋯ , X n , 的算术平均值与它们的数学期望的算术平均值之差当 n → ∞ n\to\infty n → ∞ 时依概率收敛于0.
推论:若 X 1 , X 2 , ⋯ , X n , ⋯ X_1,X_2,\cdots,X_n,\cdots X 1 , X 2 , ⋯ , X n , ⋯ 又具有相同的数学期望 E ( X k ) = μ E(X_k)=\mu E ( X k ) = μ 和相同的方差 D ( X k ) = σ 2 D(X_k)=\sigma^2 D ( X k ) = σ 2 ,则X 1 , X 2 , ⋯ , X n X_1,X_2,\cdots,X_n X 1 , X 2 , ⋯ , X n 的算术平均值当 n → ∞ n\to\infty n → ∞ 时依概率收敛于数学期望 μ \mu μ ,即对于任意给定的正数 ε \varepsilon ε ,恒有
lim n → ∞ P { ∣ 1 n ∑ i = 1 n X k − μ ∣ < ε } = 1 \lim_{n\to\infty}P\left\{\left|\dfrac{1}{n}\sum_{i=1}^nX_k-\mu\right|<\varepsilon\right\}=1 n → ∞ lim P { n 1 i = 1 ∑ n X k − μ < ε } = 1
这是在实际问题中使用算术平均数的理论依据. 对同一个量在相同条件下重复测量 n n n 次,得到测量结果 x 1 , x 2 , ⋯ , x n x_1,x_2,\cdots,x_n x 1 , x 2 , ⋯ , x n ,可以认为它们是服从同一分布、具有相同数学期望和方差 μ , σ 2 \mu,\sigma^2 μ , σ 2 的随机变量 X 1 , X 2 , ⋯ , X n X_1,X_2,\cdots,X_n X 1 , X 2 , ⋯ , X n 的观测值,当 n n n 充分大时测量结果的平均值与真实值的误差趋近于0.
伯努利定理:设 n A n_A n A 是在 n n n 次独立重复试验中事件 A A A 发生的次数,p p p 是一次试验中 A A A 发生的概率,则对于任意正数 ε \varepsilon ε 有
lim n → ∞ P { ∣ n A n − p ∣ < ε } = 1 \lim_{n\to\infty}P\left\{\left|\dfrac{n_A}{n}-p\right|<\varepsilon\right\}=1 n → ∞ lim P { n n A − p < ε } = 1
这表明事件 A A A 在 n n n 次独立重复试验中发生的频率当 n → ∞ n\to\infty n → ∞ 时依概率收敛于 p p p ,即频率的稳定性,在实际中当 n n n 很大时,可以用频率近似替代概率.
辛钦定理:设随机变量 X 1 , X 2 , … , X n , … X_1,X_2,\dots,X_n,\dots X 1 , X 2 , … , X n , … 独立同分布,且具有数学期望 E ( X k ) = μ ( k = 1 , 2 , … ) E(X_k)=\mu(k=1,2,\dots) E ( X k ) = μ ( k = 1 , 2 , … ) ,则对于任意正数 ε \varepsilon ε 有
lim n → ∞ P { ∣ 1 n ∑ i = 1 n X k − μ ∣ < ε } = 1 \lim_{n\to\infty}P\left\{\left|\dfrac{1}{n}\sum_{i=1}^nX_k-\mu\right|<\varepsilon\right\}=1 n → ∞ lim P { n 1 i = 1 ∑ n X k − μ < ε } = 1
即前 n n n 个随机变量的算术平均值 1 n ∑ i = 1 n X k \dfrac{1}{n}\sum\limits_{i=1}^nX_k n 1 i = 1 ∑ n X k 依概率收敛于它们的数学期望 μ \mu μ . 如果 E ( X k l ) = μ l E(X^l_k)=\mu_l E ( X k l ) = μ l 存在,则有 1 n ∑ i = 1 n X k → P μ l \dfrac{1}{n}\sum\limits_{i=1}^nX_k\xrightarrow{P}\mu_l n 1 i = 1 ∑ n X k P μ l . 辛钦定理是矩估计法的理论基础.
中心极限定理 依分布收敛:设随机变量 X , X 1 , X 2 , ⋯ , X n , ⋯ X,X_1,X_2,\cdots,X_n,\cdots X , X 1 , X 2 , ⋯ , X n , ⋯ 的分布函数依次为 F ( x ) , F 1 ( x ) , F 2 ( X ) , ⋯ , F n ( x ) , ⋯ F(x),F_1(x),F_2(X),\cdots,F_n(x),\cdots F ( x ) , F 1 ( x ) , F 2 ( X ) , ⋯ , F n ( x ) , ⋯ ,如果对于 F ( x ) F(x) F ( x ) 的每一个连续点都有lim n → ∞ F n ( x ) = F ( x ) \lim_{n\to\infty}F_n(x)=F(x) n → ∞ lim F n ( x ) = F ( x )
则称 X 1 , X 2 , ⋯ , X n , ⋯ X_1,X_2,\cdots,X_n,\cdots X 1 , X 2 , ⋯ , X n , ⋯ 依分布收敛于 X X X ,记作 X n → L X X_n\xrightarrow{L}X X n L X . 独立同分布的中心极限定理:(莱维-林德伯格定理)设随机变量 X 1 , X 2 , ⋯ , X n , ⋯ X_1,X_2,\cdots,X_n,\cdots X 1 , X 2 , ⋯ , X n , ⋯ 独立同分布,且具有数学期望和方差 X k = μ , D ( X k ) = σ 2 ≠ 0 X_k=\mu,D(X_k)=\sigma^2\neq 0 X k = μ , D ( X k ) = σ 2 = 0 ,随机变量Y n = ∑ k = 1 n X k − n μ n σ Y_n=\dfrac{\sum\limits_{k=1}^nX_k-n\mu}{\sqrt{n}\sigma} Y n = n σ k = 1 ∑ n X k − n μ
的分布函数为 F n ( x ) F_n(x) F n ( x ) ,即F n ( x ) = P { Y n ≤ x } = P { ∑ k = 1 n X k − n μ n σ ≤ x } , x ∈ R F_n(x)=P\{Y_n\le x\}=P\left\{\dfrac{\sum\limits_{k=1}^nX_k-n\mu}{\sqrt{n}\sigma}\le x\right\},x\in\R F n ( x ) = P { Y n ≤ x } = P ⎩ ⎨ ⎧ n σ k = 1 ∑ n X k − n μ ≤ x ⎭ ⎬ ⎫ , x ∈ R
则对任意实数 x x x 恒有lim n → ∞ F n ( x ) = Φ ( x ) = ∫ − ∞ x 1 2 π e − t 2 2 d t \lim_{n\to\infty}F_n(x)=\varPhi(x)=\int_{-\infty}^x\dfrac{1}{\sqrt{2\pi}}\mathrm{e}^{-\frac{t^2}{2}}\mathrm{d}t n → ∞ lim F n ( x ) = Φ ( x ) = ∫ − ∞ x 2 π 1 e − 2 t 2 d t
也就是说,随机变量 X 1 , X 2 , ⋯ , X n , ⋯ X_1,X_2,\cdots,X_n,\cdots X 1 , X 2 , ⋯ , X n , ⋯ 独立同分布,且具有数学期望和方差 X k = μ , D ( X k ) = σ 2 ≠ 0 X_k=\mu,D(X_k)=\sigma^2\neq 0 X k = μ , D ( X k ) = σ 2 = 0 ,则它们的算术平均值的标准化变量依分布收敛于标准正态分布的随机变量,即 Y n → L u Y_n\xrightarrow{L}u Y n L u . 棣莫弗-拉普拉斯极限定理:设随机变量 Y n ∼ B ( n , p ) ( n = 1 , 2 , … , ) Y_n\sim B(n,p)(n=1,2,\dots,) Y n ∼ B ( n , p ) ( n = 1 , 2 , … , ) ,则对任意实数 x x x 恒有lim n → ∞ P { Y n − n p n p ( 1 − p ) ≤ x } = ∫ − ∞ x 1 2 π e − t 2 2 d t \lim_{n\to\infty}P\left\{\dfrac{Y_n-np}{\sqrt{np(1-p)}}\le x\right\}=\int_{-\infty}^x\dfrac{1}{\sqrt{2\pi}}\mathrm{e}^{-\frac{t^2}{2}}\mathrm{d}t n → ∞ lim P { n p ( 1 − p ) Y n − n p ≤ x } = ∫ − ∞ x 2 π 1 e − 2 t 2 d t
这一定理表明当 n n n 充分大时,可用正态分布近似计算二项分布的概率,即正态分布是二项分布的极限分布.