1、【学而思高中数学讲义】 知识内容 一随机抽样 1随机抽样:满足每个个体被抽到的机会是均等的抽样,共有三种经常采用的随机抽样方 法: 简单随机抽样:从元素个数为N的总体中不放回地抽取容量为n的样本,如果每一次抽 取时总体中的各个个体有相同的可能性被抽到,这种抽样方法叫做简单随机抽样 抽出办法:抽签法:用纸片或小球分别标号后抽签的方法 随机数表法:随机数表是使用计算器或计算机的应用程序生成随机数的功能生成的一张 数表表中每一位置出现各个数字的可能性相同 随机数表法是对样本进行编号后, 按照一定的规律从随机数表中读数, 并取出相应的样本的 方法 简单随机抽样是最简单、最基本的抽样方法 系统抽样:将总
2、体分成均衡的若干部分,然后按照预先制定的规则,从每一部分抽取一个 个体,得到所需要的样本的抽样方法 抽出办法:从元素个数为N的总体中抽取容量为n的样本,如果总体容量能被样本容量整 除,设 N k n ,先对总体进行编号,号码从1到N,再从数字1到k中随机抽取一个数s作 为起始数,然后顺次抽取第2(1)sksksnk, ,个数,这样就得到容量为n的样 本如果总体容量不能被样本容量整除,可随机地从总体中剔除余数,然后再按系统抽样 方法进行抽样 系统抽样适用于大规模的抽样调查,由于抽样间隔相等,又被称为等距抽样 分层抽样:当总体有明显差别的几部分组成时,要反映总体情况,常采用分层抽样,使 总体中各个
3、个体按某种特征分成若干个互不重叠的几部分,每一部分叫做层,在各层中按 层在总体中所占比例进行简单随机抽样,这种抽样方法叫做分层抽样 分层抽样的样本具有较强的代表性,而且各层抽样时,可灵活选用不同的抽样方法, 应用广泛 2简单随机抽样必须具备下列特点: 简单随机抽样要求被抽取的样本的总体个数N是有限的 简单随机样本数n小于等于样本总体的个数N 简单随机样本是从总体中逐个抽取的 简单随机抽样是一种不放回的抽样 简单随机抽样的每个个体入样的可能性均为 n N 3系统抽样时,当总体个数N恰好是样本容量n的整数倍时,取 N k n ; 若 N n 不是整数时,先从总体中随机地剔除几个个体,使得总体中剩余
4、的个体数能被样本容 板块二.频率直方图 【学而思高中数学讲义】 量n整除因为每个个体被剔除的机会相等,因而整个抽样过程中每个个体被抽取的机会仍 然相等,为 N n 二频率直方图 列出样本数据的频率分布表和频率分布直方图的步骤: 计算极差:找出数据的最大值与最小值,计算它们的差; 决定组距与组数:取组距,用 极差 组距 决定组数; 决定分点:决定起点,进行分组; 列频率分布直方图:对落入各小组的数据累计,算出各小数的频数,除以样本容量,得 到各小组的频率 绘制频率分布直方图:以数据的值为横坐标,以 频率 组距 的值为纵坐标绘制直方图, 知小长方形的面积组距 频率 组距 频率 频率分布折线图: 将
5、频率分布直方图各个长方形上边的中点用线段连接起来, 就得到频率分 布折线图,一般把折线图画成与横轴相连,所以横轴左右两端点没有实际意义 总体密度曲线:样本容量不断增大时,所分组数不断增加,分组的组距不断缩小,频率分布 直方图可以用一条光滑曲线( )yf x来描绘,这条光滑曲线就叫做总体密度曲线总体密度 曲线精确地反映了一个总体在各个区域内取值的规律 三茎叶图 制作茎叶图的步骤: 将数据分为“茎”、“叶”两部分; 将最大茎与最小茎之间的数字按大小顺序排成一列,并画上竖线作为分隔线; 将各个数据的“叶”在分界线的一侧对应茎处同行列出 四统计数据的数字特征 用样本平均数估计总体平均数;用样本标准差估
6、计总体标准差 数据的离散程序可以用极差、方差或标准差来描述 极差又叫全距,是一组数据的最大值和最小值之差,反映一组数据的变动幅度; 样本方差描述了一组数据平均数波动的大小,样本的标准差是方差的算术平方根 一般地,设样本的元素为 12n xxx, , ,样本的平均数为x, 定义样本方差为 222 212 ()()() n xxxxxx s n , 样本标准差 222 12 ()()() n xxxxxx s n 简化公式: 22222 12 1 () n sxxxnx n 五独立性检验 1两个变量之间的关系; 常见的有两类:一类是确定性的函数关系;另一类是变量间存在关系,但又不具备函数关系 所要
7、求的确定性,它们的关系是带有一定随机性的当一个变量取值一定时,另一个变量的 取值带有一定随机性的两个变量之间的关系叫做相关关系 2散点图:将样本中的n个数据点()(1 2) ii xyin, , ,描在平面直角坐标系中,就得到 【学而思高中数学讲义】 了散点图 散点图形象地反映了各个数据的密切程度, 根据散点图的分布趋势可以直观地判断分析两个 变量的关系 3如果当一个变量的值变大时,另一个变量的值也在变大,则这种相关称为正相关;此时, 散点图中的点在从左下角到右上角的区域 反之,一个变量的值变大时,另一个变量的值由大变小,这种相关称为负相关此时,散点 图中的点在从左上角到右下角的区域 散点图可
8、以判断两个变量之间有没有相关关系 4统计假设:如果事件A与B独立,这时应该有()( ) ( )P ABP A P B,用字母 0 H表示此式, 即 0: ()( ) ( )HP ABP A P B,称之为统计假设 5 2 (读作“卡方”)统计量: 统计学中有一个非常有用的统计量,它的表达式为 2 211221221 1212 ()n n nn n n n n n ,用它的大小可以 用来决定是否拒绝原来的统计假设 0 H如果 2 的值较大,就拒绝 0 H,即认为A与B是有 关的 2 统计量的两个临界值:3.841、6.635;当 2 3.841时,有95%的把握说事件A与B有 关;当 2 6.6
9、35时,有99%的把握说事件A与B有关;当 2 3.841时,认为事件A与B 是无关的 独立性检验的基本思想与反证法类似, 由结论不成立时推出有利于结论成立的小概率事件发 生,而小概率事件在一次试验中通常是不会发生的,所以认为结论在很大程度上是成立的 1独立性检验的步骤:统计假设: 0 H;列出22联表;计算 2 统计量;查对临界值表, 作出判断 2几个临界值: 222 ()0.10(3.841)0.05(6.635)0.01PPP2.706, 22联表的独立性检验: 如果对于某个群体有两种状态,对于每种状态又有两个情况,这样排成一张22的表,如 下: 状态B 状态B 合计 状态A 11 n
10、12 n 1 n 状态A 21 n 22 n 2 n 1 n 2 nn 如果有调查得来的四个数据 11122122 nnnn, 并希望根据这样的4个数据来检验上述的两种 状态A与B是否有关,就称之为22联表的独立性检验 六回归分析 1回归分析:对于具有相关关系的两个变量进行统计分析的方法叫做回归分析,即回归分 析就是寻找相关关系中这种非确定关系的某种确定性 回归直线: 如果散点图中的各点都大致分布在一条直线附近, 就称这两个变量之间具有线性 相关关系,这条直线叫做回归直线 2最小二乘法: 记回归直线方程为: y abx,称为变量Y对变量x的回归直线方程,其中a b,叫做回归 系数 y 是为了区
11、分Y的实际值y,当x取值 i x时,变量Y的相应观察值为 i y,而直线上对应于 i x 【学而思高中数学讲义】 的纵坐标是i i yabx 设x Y,的一组观察值为() ii xy,1 2in, , ,且回归直线方程为 y abx, 当x取值 i x时,Y的相应观察值为 i y,差 ( 1 2) ii yy in, , ,刻画了实际观察值 i y与回归 直线上相应点的纵坐标之间的偏离程度,称这些值为离差 我们希望这n个离差构成的总离差越小越好,这样才能使所找的直线很贴近已知点 记 2 1 () n ii i Qyabx ,回归直线就是所有直线中Q取最小值的那条 这种使“离差平方和为最小”的方
12、法,叫做最小二乘法 用最小二乘法求回归系数a b,有如下的公式: 1 22 1 n ii i n i i x ynxy b xnx , a ybx,其中a b,上方加“”,表示是由观察值按最小二乘法求得的 回归系数 3线性回归模型:将用于估计y值的线性函数abx作为确定性函数;y的实际值与估计 值之间的误差记为,称之为随机误差;将yabx称为线性回归模型 产生随机误差的主要原因有: 所用的确定性函数不恰当即模型近似引起的误差; 忽略了某些因素的影响,通常这些影响都比较小; 由于测量工具等原因,存在观测误差 4线性回归系数的最佳估计值: 利用最小二乘法可以得到 a b,的计算公式为 11 222
13、 11 ()() ()( ) nn iiii ii nn ii ii xxyyx ynxy b xxxn x , a ybx,其中 1 1 n i i xx n , 1 1 n i i yy n 由此得到的直线yabx 就称为回归直线,此直线方程即为线性回归方程其中 a ,b 分 别为a,b的估计值, a 称为回归截距,b 称为回归系数, y 称为回归值 5相关系数: 11 222222 1111 ()() ()()( ) )( ) ) nn iiii ii nnnn iiii iiii xxyyx ynxy r xxyyxn xyn y 6相关系数r的性质: |1r ; |r越接近于 1,x
14、y,的线性相关程度越强; |r越接近于 0,xy,的线性相关程度越弱 可见,一条回归直线有多大的预测功能,和变量间的相关系数密切相关 7转化思想: 根据专业知识或散点图,对某些特殊的非线性关系,选择适当的变量代换,把非线性方程转 化为线性回归方程,从而确定未知参数 8一些备案 回归 (regression) 一词的来历: “回归”这个词英国统计学家 Francils Galton 提出来的 1889 年,他在研究祖先与后代的身高之间的关系时发现,身材较高的父母,他们的孩子也较高, 但这些孩子的平均身高并没有他们父母的平均身高高; 身材较矮的父母, 他们的孩子也较矮, 【学而思高中数学讲义】 但
15、这些孩子的平均身高却比他们父母的平均身高高 Galton 把这种后代的身高向中间值靠近 的趋势称为“回归现象”后来,人们把由一个变量的变化去推测另一个变量的变化的方法称 为回归分析 回归系数的推导过程: 22222 ()222 iiiiiiii Qyabxyaynabx yabxbx 2222 2 ()2 iiiiii naa bxybxbx yy , 把上式看成a的二次函数, 2 a的系数0n , 因此当 2() 2 iiii bxyybx a nn 时取最小值 同理, 把Q的展开式按b的降幂排列, 看成b的二次函数, 当 2 iii i x yax b x 时取最小值 解得: 1 2 22
16、 1 ()() () n ii ii i n i i i x ynxy xxyy b xx xnx ,aybx, 其中 1 i yy n , 1 i xx n 是样本平均数 9 对相关系数r进行相关性检验的步骤: 提出统计假设 0 H:变量xy,不具有线性相关关系; 如果以95%的把握作出推断,那么可以根据10.950.05与2n (n是样本容量)在相 关性检验的临界值表中查出一个r的临界值 0.05 r(其中10.950.05称为检验水平) ; 计算样本相关系数r; 作出统计推断:若 0.05 |rr,则否定 0 H,表明有95%的把握认为变量y与x之间具有线 性相关关系;若 0.05 |r
17、r,则没有理由拒绝 0 H,即就目前数据而言,没有充分理由认为变 量y与x之间具有线性相关关系 说明: 对相关系数r进行显著性检验,一般取检验水平0.05,即可靠程度为95% 这里的r指的是线性相关系数,r的绝对值很小,只是说明线性相关程度低,不一定不相 关,可能是非线性相关的某种关系 这里的r是对抽样数据而言的有时即使| 1r ,两者也不一定是线性相关的故在统计 分析时,不能就数据论数据,要结合实际情况进行合理解释 题型一 频率分布直方图 【例 1】 (2010 西城二模) 某区高二年级的一次数学统考中,随机抽取200名同学的成绩,成绩全部在50分 至100分之间, 将成绩按如下方式分成5组
18、: 第一组, 成绩大于等于50分且小于60 分;第二组,成绩大于等于60分且小于70分;第五组,成绩大于等于90分且 小于等于100分,据此绘制了如图所示的频率分布直方图 典例分析 【学而思高中数学讲义】 则这200名同学中成绩大于等于80分且小于90分的学生有_名 【例 2】 (2010 东城二模) 已知一个样本容量为100的样本数据的频率分布直方图如图所示,样本数据落在 6,10)内的样本频数为,样本数据落在2,10)内的频率为 【例 3】 (2010 北京) 从某小学随机抽取 100 名同学,将他们的身高(单位:厘米)数据绘制成频率分 布直方图(如图) 由图中数据可知a 若要从身高在12
19、0, 130, 130, 140,140, 150三组内的学生中,用分层抽样的方法选取 18 人参加一项活 动,则从身高在140, 150内的学生中选取的人数应为 【例 4】 (2010 江苏高考) 【学而思高中数学讲义】 某棉纺厂为了了解一批棉花的质量,从中随机抽取了100根棉花纤维的长度(棉花 纤维的长度是棉花质量的重要指标) , 所得数据都在区间540,中, 其频率分布直 方图如图所示,则其抽样的100根中,有_根在棉花纤维的长度小于20mm 【例 5】 (2009 湖北 15) 下图是样本容量为200的频率分布直方图 根据样本的频率分布直方图估计, 样本数据落在610,内的频数为, 数
20、据 落在210,内的概率约为 【例 6】 (2009 福建 3) 一个容量为100的样本,其数据的分组与各组的频数如下: 组 别 010,1020,2030,3040,4050,5060,6070, 频 数 1213241516137 则样本数据落在1040,上的频率为() A0.13B0.39C0.52D0.64 【例 7】 某校为了了解学生的课外阅读情况,随机调查了 50 名学生,得到他们在某一天各 自课外阅读所用时间的数据,结果用下面的条形图表示,根据条形图可得这 50 名 学生这一天平均每人的课外阅读时间为() 【学而思高中数学讲义】 A0.6hB0.9h C1.0hD1.5h 【例
21、8】 为了调查某厂工人生产某种产品的能力,随机抽查了20位工人某天生产该产品的 数量 产品数量的分组区间为4555,5565,6575,7585,8595, 由此得到频率分布直方图如图3, 则这20名工人中一天生产该产品数量在5575, 的人数是 【例 9】 (2009 山东 8) 某工厂对一批产品进行了抽样检测 右图是根据抽样检测后的产品净重 (单位: 克) 数据绘制的频率分布直方图,其中产品净重的范围是96106,样本数据分组为 9698,98100,100102,102104,104106,已知样本中产品净 重小于100克的个数是36,则样本中净重大于或等于98克并且小于104克的产品
22、的个数是() 【学而思高中数学讲义】 A90B75C60 D45 【例 10】某路段检查站监控录象显示,在某时段内,有1000辆汽车通过该站,现在随 机抽取其中的200辆汽车进行车速分析,分析的结果表示为右图的频率分布直方 图, 则估计在这一时段内通过该站的汽车中速度不小于90km/h 的车辆数为 () A200B600C500D300 【例 11】(2006 年全国 II) 一个社会调查机构就某地居民的月收入调查了10000人, 并根据所得数据画了样本 频率分布直方图,为了分析居民的收入与年龄、学历、职业等方面的联系,要从这 10000人中用分层抽样的方法抽出100人做进一步调查,则在250
23、0 3000,(元) 月收入段应抽出_人 【学而思高中数学讲义】 【例 12】如图为某样本数据的频率分布直方图,则下列说法不正确的是() A6 10),的频率为0.32 B若样本容量为100,则10 14),的频数为40 C若样本容量为100,则(10,的频数为40 D由频率分布布直方图可得出结论:估计总体大约有10%分布在10 14), 【例 13】(2006 北京模拟)下面是某学校学生日睡眠时间的抽样频率分布表: 睡眠时间人数频率 6 6.5),50.05 6.5 7), 170.17 7 7.5), 330.33 7.5 8),370.37 8 8.5),60.06 8.5 9), 20
24、.02 合计1001 画出频率分布直方图,估计该校学生的日平均睡眠时间 【例 14】(2010 崇文一模) 为了调查某厂 2000 名工人生产某种产品的能力,随机抽查了m位工人某天生产该 产品的数量,产品数量的分组区间为10, 15,15, 20,20, 25,25, 30, 30, 35, 频率分布直方图如图所示 已知生产的产品数量在20,25之间的工人有 6 位 求m; 【学而思高中数学讲义】 工厂规定从各组中任选 1 人进行再培训, 则选取 5 人不在同一组的概率是多少? 【例 15】考查某校高三年级男生的身高,随机抽取40名高三男生,实测身高数据(单 位:cm)如下: 作出频率分布表;
25、 画出频率分布直方图 【例 16】(2010 陕西卷高考) 为了解学生身高情况,某校以10%的比例对全校 700 名学生按性别进行出样检查, 测得身高情况的统计图如下: 171163163166166168168160168165 171169167169151168170160168174 165168174159167156157164169180 176157162161158164163163167161 【学而思高中数学讲义】 估计该小男生的人数; 估计该校学生身高在170 185cm之间的概率; 从样本中身高在165 180cm之间的女生 中任选 2 人,求至少有 1 人身高在 1
26、70 180cm之间的概率 【例 17】从某校高一年级的1002名新生中用系统抽样的方法抽取一个容量为100的身 高样本,如下(单位:cm) 作出该样本的频率分布表,画出频率分布直方图及 折线图,并根据作出的频率分布直方图估计身高不小于170的同学的人数 168165171167170165170152175174 165170168169171166164155164158 170155166158155160160164156162 160170168164174170165179163172 180174173159163172167160164169 15116815816817615
27、5165165169162 177158175165169151163166163167 178165158170169159155163153155 167163164158168167161162167168 161165174156167166162161164166 【例 18】为了了解小学生的体能情况, 抽取了某小学同年级部分学生进行跳绳测试, 将 所得的数据整理后画出频率分布直方图(如下图) ,已知图中从左到右的前三个小 组的频率分别是0.1 0.3 0.4,第一小组的频数是5 求第四小组的频率和参加这次测试的学生人数; 在这次测试中,学生跳绳次数的中位数落在第几小组内? 参加这次
28、测试跳绳次数在100次以上为优秀, 试估计该校此年级跳绳成绩优秀率 是多少? 【学而思高中数学讲义】 【例 19】为了让学生了解环保知识, 增强环保意识, 某中学举行了一次“环保知识竞赛”, 共有 900 名学生参加了这次竞赛 为了解本次竞赛成绩情况,从中抽取了部分学 生的成绩(得分均为整数,满分为 100 分)进行统计 请你根据尚未完成并有局 部污损的频率分布表和频数分布直方图,解答下列问题: 填充频率分布表的空格(将答案直接填在表格内) ; 补全频数条形图; 若成绩在 755855 分的学生为二等奖,问获得二等奖的学生约为多少人? 【例 20】(2010 丰台一模) 某校高三(1)班的一次
29、数学测试成绩的茎叶图和频率分布直方图都受到不同程度的破坏, 但可见部分如下,据此解答如下问题 求全班人数及分数在80 , 90之间的频数; 估计该班的平均分数,并计算频率分布直方图中80 , 90间的矩形的高; 若要从分数在80 , 100之间的试卷中任取两份分析学生失分情况,在抽取的试卷中,求 至少有一份分数在90 , 100之间的概率 【例 21】某地区为了了解70 80岁老人的日平均睡眠时间(单位:h) 随机选择了50 位老人的进行调查下表是这50位老人日睡眠时间的频率分布表 序号 (i) 分组 (睡眠时间) 组中值 ( i G) 频数 (人数) 频率 ( i F) 14,5)4.560.12 25,6)5.5100.20 36,7)6.5200.40 【学而思高中数学讲义】 47,8)7.5100.20 58,98.540.08 在上述统计数据中,一部分计算见算法流程图(其中可用代替) , 则输出的S的值是