随机抽样:随机就完事
分层抽样:将整体分组进行抽样,比如一线城市,二线城市,三线城市
整群抽样:按群里进行抽样;比如后端工程师,前端工程师,AI工程师
系统抽样:按照预定规则抽样;比如每生产100个抽取1个
大数法则
当测试数据量无限增大的时候,随机事件曾现几乎必然的结果,比如:实验平均结果是趋近于数学期望
切比雪夫大数定律
设随机变量

伯努利大数定律:
跟期望类似,只不过这里说的是概率,事件A的发生概率为P,将实验独立重复地进行n次,当n趋近于无穷大时,事件A发生的频数几近于概率
中心极限定理
理解
1.样本均值等于总体的均值
2.无论总体是什么分布,样本均值在总体均值附近
3.样本均值成正太分布
同分布中心极限定理
对于随机变量,相互独立且服从统一分布,有数学期望和方差
,当n足够大时
对于标准化变量的分布函数
,对于任意x满足
因为,即正太分布, 所以
为正态分布的面积

拉普拉斯定理(中心极限定理2)
n=1,2,3.......,其中0<p<1,q=1-p,则对任意实数x,有


点估计
点估计指的是用样本统计量来估计总体参数,比如一个学校随机抽样几个学生得出学校的平均身高,因为样本为数轴上某一点值,估计的结果也以一个点的数值表示,所以称为点估计。
矩估计
矩估计方法是点估计中的一种,其原理就是构造样本和总体的矩,然后用样本的矩去估计总体的矩。
一阶原点距:
二阶原点距:
在求样本的期望和连续型随机变量(已经概率密度的)的期望,求法是不一样的。
计算步骤:
- 根据题目给出的概率密度函数,计算总体的原点矩(如果只有一个参数只要计算一阶原点矩,如果有两个参数要计算一阶和二阶)。
- 根据题目给出的样本。按照计算样本的原点矩。(计算方法在上文都有给出)
- 让总体的原点矩与样本的原点矩相等,解出参数。所得结果即为参数的矩估计值
极大似然估计
极大似然估计源于贝叶斯分类
1.已知整体满足某种概率分布,
2.通过若干次实验分析结果,计算参数大概值
3.获取能使样本出现概率最大的参数
计算方法:
- 写出似然函数;
- 对似然函数取对数,并整理;
- 求导数;
- 解似然方程。
区间估计
置信区间
怎么理解,比如学生身高均值为[165,175]的置信区间,置信度为95%;说明任意一个样本学生X落在[165,175]的概率为95%。
置信水平:
指置信区间包含总体平均值的概率多大,如置信水平为95%;用一句话说就是:我有 95% 的把握估计我高考分数是 600-650,因为你对考试成绩的把握,就是根据你多次考试的均值
在给定置信度的条件下,置信区间的宽度决定于抽样分布,会随着样本量的增大而减小,在样本量给定时,置信区间的宽度随着置信系数的增大而增大。
标准误差
标准误差是对样本均值方差的度量,公式是:, n是样本数
例子:
已知产品重量的分布服从正态分布,且总体标准差为10g。试估计该批产品平均重量的置信区间,置信水平为95%。


这里的1.96是怎么得出来的呢?因为置信区间为95%,所以
T分布,卡方分布
很多情况下,已知是未知的
