内容正文:
湘教版高中数学选择性必修第二册第四章统计测试卷
一、单项选择题:本题共8小题,每小题5分,共40分.在每小题给出的四个选项中,只有一项是符合题目要求的.
1.如图是根据变量x,y的观测数据得到的散点图,根据散点图可以判断变量x与y具有相关关系的图是( )
A.①② B.①③ C.②③④ D.③④
【答案】D
【分析】通过观察散点图可以知道,y随x的增大而减小,各点整体呈下降趋势,y与x负相关;y随x的增大而增大,各点整体呈上升趋势,y与x正相关.
【详解】图①②的点成片状分布,没有明显的相关关系;
图③可知,y随x的增大而减小,各点整体呈下降趋势,y与x负相关,
图④可知,y随x的增大而增大,各点整体呈上升趋势,y与x正相关.
故选:D.
2.如图,有6组数据,去掉哪组数据后(填字母代号),剩下的5组数据的线性相关性最大( )
A.A B.B C.C D.D
【答案】C
【分析】由线性相关的概念判断,
【详解】由散点图可得A,B,D,E,F五个点都分布在一条直线的附近且贴近某一条直线,则去掉C点后剩下的5组数据的线性相关性最大.
故选:C
3.下列说法正确的个数是( )
①线性相关系数越接近1,两个变量的线性相关程度越强;
②独立性检验可以100%确定两个变量之间是否具有某种关系;
③在回归分析中,可用残差图判断模型的拟合效果,残差点比较均匀地落在水平的带状区域中,说明这样的模型比较合适,带状区域的宽度越窄,说明模型的拟合精度越高;
④甲、乙两个模型的决定系数分别约为0.88和0.80,则模型甲的拟合效果更好.
A.1 B.2 C.3 D.4
【答案】C
【分析】根据线性相关系数,独立性检验,残差图及决定系数的概念分别判断即可.
【详解】线性相关系数越接近1,两个变量的线性相关程度越强,故①正确;
独立性检验并不能100%确定两个变量之间是否具有某种关系,故②错误;
回归分析中,可用残差图判断模型的拟合效果,残差点比较均匀地落在水平的带状区域中,说明这样的模型比较合适,带状区域的宽度越窄,说明模型的拟合精度越高,故③正确;
回归分析中,可用判断模型的拟合效果,越大,模型的拟合效果越好,故④正确;
故选:C.
4.下列说法中,正确的为( )
A.在研究数据的离散程度时,一组数据中添加新数据,其极差与标准差都可能变小
B.在研究变量间的相关关系时,两个变量的相关系数越小,则两者的线性相关程度越弱
C.在实施独立性检验时,显著增加分类变量的样本容量,随机变量的观测值会减小
D.在回归分析中,模型样本数据的值越大,其残差平方和就越小,拟合效果就越好
【答案】D
【分析】根据极差、标准差、相关系数、独立性检验的定义和概念逐项分析即可.
【详解】选项A:假设原数据为,其中最大值为,最小值为,极差为,
向其中添加一个新数据,当或时,极差变大,当时,极差不变,
标准差描述一组数据的离散程度,所以添加新数据后,其标准差可能变大、变小或不变,A说法错误;
选项B:在研究变量间的相关关系时,两个变量的相关系数的绝对值越小,两者的线性相关程度越弱,B说法错误;
选项C:在实施独立性检验时,随机变量的观测值与分类变量的相关关系有关,与样本容量无关,C说法错误;
选项D:由相关指数的定义可知值越大,其残差平方和就越小,拟合效果就越好,D说法正确;
故选:D
5.在研究变量与之间的相关关系时,进行实验后得到了一组样本数据,,…,,,利用此样本数据求得的经验回归方程为,现发现数据误差较大,剔除这对数据后,求得的经验回归方程为,且,则( )
A.13.5 B.14 C.14.5 D.15
【答案】A
【分析】由题意,求出剔除异常数据后的平均数,进而求出剔除异常数据前的平均数,根据回归直线必过样本中心点得到.
【详解】因为,剔除异常数据数据后, ,
因为点在直线上,所以,解得,
设利用原始数据求得的经验回归直线过点,
则,
因为,所以.
故选:A.
6.兰溪杨梅从5月15日起开始陆续上市,据调查统计,得到杨梅销售价格(单位:Q元/千克)与上市时间t(单位:天)的数据如下表所示:
时间t/(单位:天)
10
20
70
销售价格Q(单位:元/千克)
100
50
100
根据上表数据,从下列函数模型中选取一个描述杨梅销售价格Q与上市时间t的变化关系:.利用你选取的函数模型,在以下四个日期中,杨梅销售价格最低的日期为( )
A.6月5日 B.6月15日 C.6月25日 D.7月5日
【答案】C
【分析】根据表中数据,描述杨梅销售价格Q与上市时间t的变化关系不可能是常数函数、也不可能是单调函数,应选取进行描述,将表中数据代入可得,利用配方法结合日期可得答案.
【详解】根据表中数据,描述杨梅销售价格Q与上市时间t的变化关系不可能是常数函数、也不可能是单调函数,
函数在时均为单调函数,这与表格中的数据不吻合,
所以应选取进行描述,
将表中数据代入可得
,解得,所以,
,所以当时杨梅销售价格最低,
而6月5日时,6月15日时,6月25日时,7月5日时,
所以时杨梅销售价格最低.
故选:C.
7.某杂交水稻研究小组先培育出第一代杂交水稻,再由第一代培育出第二代,第二代培育出第三代,以此类推,且亲代与子代的每穗总粒数之间的关系如下表所示:
代数代码
1
2
3
4
总粒数
197
193
201
209
通过上面四组数据得到了与之间的线性回归方程是,预测第十代杂交水稻每穗的总粒数为( )
A.233 B.234 C.235 D.236
【答案】A
【分析】求出样本中心,然后确定回归直线方程,即可求解预测当时,的估计值.
【详解】由题意可知:,.
因为回归直线方程经过样本中心,所以,解得,
回归直线方程为:,
当时,的估计值为:.
故选:A.
8.某商店记录了某种产品近5个月的月销售量(千台)如下表,样本中心点为.由于保管不善,记录的5个数据中有两个数据看不清楚,现用代替,已知,则下列结论正确的是( )
第个月
1
2
3
4
5
月销售量
2.5
4
5
A.在确定的条件下,去掉样本点,则样本的相关系数增大
B.在确定的条件下,样本的相关系数
C.在确定的条件下,经过拟合,发现数据基本符合线性回归方程,则
D.在确定的条件下,经过拟合,发现数据基本符合线性回归方程,则可预计该款商品第6个月的销售量为6280台
【答案】D
【分析】根据回归直线方程过数据的样本中心点可判断A;根据月销售量随着的增大而增大可判断B;根据样本中心点在回归直线上可判断C;求出回归直线方程,则可预计该款商品第6个月的销售量可判断D.
【详解】对于A,因为回归直线方程过数据的样本中心点,
所以在确定的条件下,去掉样本点,则样本的相关系数不变,故A错误;
对于B,在确定的条件下,月销售量随着的增大而增大,
故样本的相关系数,故B错误;
对于C,在确定的条件下,样本中心点为在回归直线上,
可得,解得,故C错误;
对于D,由C得线性回归方程,
因为台,
则可预计该款商品第6个月的销售量为6280台,故D正确.
故选:D.
二、多项选择题:本题共3小题,每小题6分,共18分.在每小题给出的选项中,有多项符合题目要求.全部选对的得6分,有选错的得0分.
9.下列说法正确的有( )
A.已知两个变量具有线性相关关系,其回归直线方程为,若,,,则
B.线性相关系数越大,两个变量的线性相关性越强;反之,线性相关性越弱
C.在残差图中,残差点分布的水平带状区域越窄,说明模型的拟合精度越高
D.根据分类变量与的成对样本数据计算得到,依据的独立性检验(),没有充分证据推断零假设不成立,即可认为与独立
【答案】ACD
【分析】本题考查线性回归方程中回归直线方程、线性相关系数、残差图与独立性检验的知识,一一检验即可得到正确答案.
【详解】已知两个变量具有线性相关关系,其回归直线方程为,
若,,,则,因此A正确;
线性相关系数的范围在到之间,有正有负,相关有正相关和负相关,
相关系数的绝对值的大小越接近于1,两个变量的线性相关性越强;
反之,线性相关性越弱,因此B错误;
在残差图中,残差点分布的水平带状区域越窄,说明模型的拟合精度越高,因此C正确;
由独立性检验可知,没有充分证据推断原假设不成立,即认为与独立,因此D正确.
故选:ACD.
10.下列结论正确的是( )
A.一组数据7,8,8,9,11,13,15,17,20,22的第80百分位数为17
B.若随机变量,满足,则
C.若随机变量,且,则
D.根据分类变量与的成对样本数据,计算得到.依据的独立性检验,可判断与有关
【答案】CD
【分析】A应用百分位数求法判断;B由方差性质判断;C根据正态分布对称性求概率判断;D由独立检验的基本思想判断结论.
【详解】A:由,故第80百分位数为,错;
B:由方差的性质知:,错;
C:由正态分布性质,随机变量的正态曲线关于对称,
所以,对;
D:由题设,结合独立检验的基本思想,在小概率情况下与有关,对.
故选:CD
11.下列命题正确的是( )
A.若样本数据的方差为2,则数据的方差为8
B.已知互不相同的30个样本数据,若去掉其中最大和最小的数据,剩下28个数据的20%分位数不等于原样本数据的20%分位数
C.若A,B两组成对数据的样本相关系数分别为,,则A组数据比B组数据的线性相关程度更强
D.若决定系数的值越接近于1,则表示回归模型的拟合效果越好
【答案】ABD
【分析】对于A:根据方差的性质可得;对于B:根据百分数的定义可得;对于C:根据相关系数的性质可得;对于D:根据决定系数的性质可得.
【详解】对于A:若样本数据的方差为2,则数据的方差为,A正确;
对于B:设原本数据从小到大为,因为,所以原样本数据的20%分位数为,去掉最大值和最小值后剩余数据按从小到大排列为,因为,所以剩下28个数据的20%分位数为,故不一样,B正确;
对于C:,故B组数据比A组数据的线性相关程度更强,C错误;
对于D:若决定系数的值越接近于1,则表示回归模型的拟合效果越好,D正确;
故选:ABD.
三、填空题:本题共3小题,每小题5分,共15分.
12.样本相关系数:设由变量x和y获得的两组数据分别为和(i=1,2,…,n),其对应关系如下表所示:
变量x
…
变量y
…
两组数据和的线性相关系数是度量两个变量x与y之间线性相关程度的统计量,
其计算公式为 ,其中,,,它们分别是这两组数据的算术平均数.
【答案】
【分析】利用相关系的定义可得结论.
【详解】样本相关系数:设由变量和获得的两组数据分别为和(),其对应关系如下表所示:
变量
变量
两组数据和的线性相关系数是度量两个变量与之间线性相关程度的统计量,
其计算公式为.
故答案为:.
13.某地建立了农业科技图书馆,供农民免费借阅,收集了近5年的借阅数据如下表:
年份
2019
2020
2021
2022
2023
年份代码
1
2
3
4
5
年借阅量万册
4.9
5.1
5.5
5.7
5.8
根据上表,可得关于的线性回归方程为.则 .
【答案】
【分析】利用回归方程过样本中心点,代入计算即可求得
【详解】根据表格可知,
,,
代入,可得.
故答案为:
14.在独立性检验中,为了调查变量与变量的关系,经过计算得到,表示的意义是 (填序号).
①有的把握认为变量与变量没有关系;
②有的把握认为变量与变量有关系;
③有的把握认为变量与变量有关系;
④有的把握认为变量与变量没有关系.
【答案】③④
【分析】由独立性检验中观测值和临界值的意义,即可得出正确的答案.
【详解】在独立性检验中,由
表示的意义是:有的把握认为变量与变量没有关系,所以④正确;
即有的把握认为变量与变量有关系,所以③正确.
故答案为:③④
四、解答题:本题共5小题,共77分.解答应写出文字说明、证明过程或演算步骤.
15.(13分)随着我国老龄化进程不断加快,养老将会是未来每个人要面对的问题,而如何养老则是我国逐渐进入老龄化社会后,整个社会需要回答的问题.为了调查某地区老年人是否愿意参加养老机构,用简单随机抽样方法从该地区调查了500位老人,结果如下:
是否愿意参加
男
女
不愿意
50
50
愿意
150
250
(1)估计该地区男性老年人中,愿意参加养老机构的男性老年人的概率;
(2)依据小概率值的独立性检验,能否认为该地区的老年人是否愿意参加养老机构与性别有关?请解释所得结论的实际含义.
附:.
0.05
0.025
0.01
0.005
0.001
3.841
5.024
6.635
7.879
10.828
【答案】(1)
(2)答案见解析
【分析】(1)用频率估计概率即可
(2)计算,根据表中数据比较即可得出结论
【详解】(1)由统计数据可知,愿意参加养老机构的男性老年人为150,调查的男性老年人的总人数为200,
故男性老年人中愿意参加养老机构的频率为.根据频率稳定于概率的原理,估计该地区男性老年人中,愿意参加养老机构的男性老年人的概率为.
(2)假设:该地区的老年人是否愿意养老机构与性别无关.
根据列联表中的数据,经计算可得,
根据小概率值的独立性检验,推断不成立,即认为该地区的老年人是否愿意参加养老机构与性别有关,此推断犯错误的概率不大于0.025.
男性老年人愿意参加养老机构和不愿意参加养老机构的频率分别为和;
女性老年人愿意参加养老机构和不愿意参加养老机构的频率分别为和.
由此可见,女性老年人愿意参加养老机构的频率明显高于男性老年人愿意参加养老机构的频率.
根据频率稳定于概率的原理,可以推断该地区女性老年人愿意参加养老机构的概率明显高于男性老年人愿意参加养老机构的概率.
16.(15分)某单位最近组织了一次健身活动,活动分为登山组和游泳组,因为两个活动在同一时间段进行,所以每个职工只能参加其中的一个活动.在参加活动的职工中,男士90名,女士110名.
(1)根据统计数据,请在下面表格的空白处填写正确数字,并说明能否在犯错概率不超过0.05的前提下认为是否参加登山组活动与性别有关.
女士
男士
合计
登山组人数
40
游泳组人数
70
合计
附:,其中.
2.706
3.841
5.024
6.635
7.897
0.100
0.050
0.025
0.010
0.005
(2)将上述调查所得到的频率视为概率,现在从该单位参加活动的职工中,每次随机抽取1名职工,抽取3次,记被抽取的3名职工中参加登山组活动的人数为.若每次抽取的结果是相互独立的,求的分布列、数学期望和方差.
【答案】(1)表格见解析,能;(2)分布列见解析,,.
【分析】(1)根据题意得出列联表,再由公式计算得,可得结论;
(2)根据题意得,由此可求得期望和方差.
【详解】(1)根据题意得
女士
男士
合计
登山组人数
40
20
60
游泳组人数
70
70
140
合计
110
90
200
所以,
于是能在犯错概率不超过0.05的前提下认为是否参加登山组活动与性别有关.
(2)根据题意得,
所以;
;
;
,
于是的分布列如下:
0
1
2
3
0.343
0.441
0.189
0.027
故,.
17.(15分)人工智能对人们的生活有较大的影响,为了让老师更加重视人工智能,某校随机抽出30名男教师和20名女教师参加学校组织的“人工智能”相关知识问卷调查(满分100分),若分数为80分及以上的为优秀,其他为非优秀,统计并得到如下列联表:
男教师
女教师
总计
优秀
20
15
35
非优秀
10
5
15
总计
30
20
50
(1)根据小概率值的独立性检验,能否认为这次成绩是否优秀与性别有关?
(2)从样本中成绩非优秀的15名老师中,随机抽取2人进行调研,记抽出的2人中女老师的人数为,求的分布列和数学期望.
附:,其中.
0.1
0.05
0.01
0.001
2.706
3.841
6.635
10.828
【答案】(1)这次成绩是否优秀与性别无关.
(2)分布列见解析;期望为.
【分析】(1)由列联表中的数据,求得,结合附表,即可得到答案;
(2)根据题意,随机变量的可能取值为,求得相应的概率,列出分布列,求得其数学期望.
【详解】(1)解:由列联表中的数据,
可得,
因为,所以这次成绩是否优秀与性别无关.
(2)解:由题意得,随机变量的可能取值为,
则;;
所以随机变量的分布列为:
0
1
2
所以期望为.
18.(17分)人工智能(英语:Artificialintelligence,缩写为)亦称智械、机器智能,指由人制造出来的可以表现出智能的机器.通常人工智能是指通过普通计算机程序来呈现人类智能的技术.人工智能的核心问题包括建构能够跟人类似甚至超卓的推理、知识、规划、学习、交流、感知、移物、使用工具和操控机械的能力等.当前有大量的工具应用了人工智能,其中包括搜索和数学优化、逻辑推演.而基于仿生学、认知心理学,以及基于概率论和经济学的算法等等也在逐步探索当中.思维来源于大脑,而思维控制行为,行为需要意志去实现,而思维又是对所有数据采集的整理,相当于数据库.某中学计划在高一年级开设人工智能课程.为了解学生对人工智能是否感兴趣,随机从该校高一年级学生中抽取了400人进行调查,整理得到如下列联表:
感兴趣
不感兴趣
合计
男生
180
40
220
女生
120
60
180
合计
300
100
400
(1)依据小概率值的独立性检验,能否认为对人工智能是否感兴趣与性别有关联?
(2)从对人工智能感兴趣的学生中按性别采用分层抽样的方法随机抽取10人,再从这10人中随机抽取3人进行采访,记随机变量表示抽到的3人中女生的人数,求的分布列和数学期望.
附:,其中.
0.1
0.05
0.01
0.005
0.001
2.706
3.841
6.635
7.879
10.828
【答案】(1)答案见解析
(2)分布列见解析;.
【分析】(1)根据两个条件概率值求出列联表中的数据,利用卡方公式计算的值,再与对应的小概率值比较即得结论;
(2)先利用分层抽样确定所抽取男生、女生人数,再利超几何概率公式计算即得分布列与期望;
【详解】(1)零假设为:学生对人工筸能是否感兴趣与性别无关.
根据列联表计算可得:,
根据小概率值的独立性检验,我们推断不成立,即认为学生对人工筸能是否感兴趣与性别有关联,此推断犯错误的概率不大于.
(2)从对人工智能感兴趣的学生中按性别采用分层抽样的方法随机抽取10人,
其中抽取男生人,抽取女生人;
根据已知条件的可能取值为:;
,,
,;
.
19.(17分)第24届冬奥会于2022年2月4日在北京市和张家口市联合举行,此项赛事大大激发了国人冰雪运动的热情.某滑雪场在冬奥会期间开业,下表统计了该滑雪场开业第天的滑雪人数(单位:百人)的数据.
天数代码
1
2
3
4
5
滑雪人数(百人)
9
11
14
26
20
经过测算,若一天中滑雪人数超过3500人时,当天滑雪场可实现盈利,请建立关于的回归方程,并预测该滑雪场开业的第几天开始盈利.
参考公式:线性回归方程的斜率和截距的最小二乘法估计分别为.
【答案】;.
【分析】
根据表中数据及平均数公式求出,从而求出回归方程,然后再根据一天中滑雪人数超过3500人时,当天滑雪场可实现盈利即可求解.
【详解】由题意可知,,,
所以
,
所以,
,
所以关于的回归方程为.
因为天中滑雪人数超过3500人时,当天滑雪场可实现盈利,即,解得,
所以根据回归方程预测,该该滑雪场开业的第天开始盈利.
学科网(北京)股份有限公司
$湘教版高中数学选择性必修第二册第四章统计测试卷
一、单项选择题:本题共8小题,每小题5分,共40分在每小题给出的四个选项中,只有一项是符合题
目要求的
1.如图是根据变量x,y的观测数据(x,y,)(=1,2,3,,10)得到的散点图,根据散点图可以判断变量x与y
具有相关关系的图是()
①
2
4
A.①②
B.①③
C.②③④
D.③④
【答案】D
【分析】通过观察散点图可以知道,y随x的增大而减小,各点整体呈下降趋势,y与x负相关;y随x的
增大而增大,各点整体呈上升趋势,y与x正相关,
【详解】图①②的点成片状分布,没有明显的相关关系:
图③可知,y随x的增大而减小,各点整体呈下降趋势,y与x负相关,
图④可知,y随x的增大而增大,各点整体呈上升趋势,y与x正相关.
故选:D
2.如图,有6组数据,去掉哪组数据后(填字母代号),剩下的5组数据的线性相关性最大()
y
F
C。
E
D
B
A.A
B.B
C.C
D.D
【答案】C
【分析】由线性相关的概念判断,
【详解】由散点图可得A,B,D,E,F五个点都分布在一条直线的附近且贴近某一条直线,则去掉C点
后剩下的5组数据的线性相关性最大.
故选:C
3.下列说法正确的个数是()
①线性相关系数越接近1,两个变量的线性相关程度越强:
②独立性检验可以100%确定两个变量之间是否具有某种关系:
③在回归分析中,可用残差图判断模型的拟合效果,残差点比较均匀地落在水平的带状区域中,说明这样
的模型比较合适,带状区域的宽度越窄,说明模型的拟合精度越高:
④甲、乙两个模型的决定系数R2分别约为0.88和0.80,则模型甲的拟合效果更好.
A.1
B.2
C.3
D.4
【答案】C
【分析】根据线性相关系数,独立性检验,残差图及决定系数的概念分别判断即可.
【详解】线性相关系数☑越接近1,两个变量的线性相关程度越强,故①正确:
独立性检验并不能100%确定两个变量之间是否具有某种关系,故②错误:
回归分析中,可用残差图判断模型的拟合效果,残差点比较均匀地落在水平的带状区域中,说明这样的模
型比较合适,带状区域的宽度越窄,说明模型的拟合精度越高,故③正确:
回归分析中,可用2判断模型的拟合效果,R越大,模型的拟合效果越好,故④正确:
故选:C
4.下列说法中,正确的为()
A.在研究数据的离散程度时,一组数据中添加新数据,其极差与标准差都可能变小
B.在研究变量间的相关关系时,两个变量的相关系数越小,则两者的线性相关程度越弱
C.在实施独立性检验时,显著增加分类变量的样本容量,随机变量的观测值k会减小
D.在回归分析中,模型样本数据的R2值越大,其残差平方和就越小,拟合效果就越好
【答案】D
【分析】根据极差、标准差、相关系数、独立性检验的定义和概念逐项分析即可」
【详解】选项A:假设原数据为x,x2,x3,xm,其中最大值为x2,最小值为x,,极差为x。-x,
向其中添加一个新数据x。,当,>x。或x<x,时,极差变大,当七2<x<x时,极差不变,
标准差描述一组数据的离散程度,所以添加新数据后,其标准差可能变大、变小或不变,A说法错误:
选项B:在研究变量间的相关关系时,两个变量的相关系数的绝对值越小,两者的线性相关程度越弱,B
说法错误:
选项C:在实施独立性检验时,随机变量K的观测值k与分类变量的相关关系有关,与样本容量无关,C
说法错误:
选项D:由相关指数的定义可知R2值越大,其残差平方和就越小,拟合效果就越好,D说法正确:
故选:D
5.在研究变量x与y之间的相关关系时,进行实验后得到了一组样本数据(x,),(x2,y2),,(x。,y6),
(6,27),利用此样本数据求得的经验回归方程为)=-1.5x+à,现发现数据(6,27)误差较大,剔除这对数据
后,求得的经验回归方程为少=-6x+21,且∑y=36,则ā=()
A.13.5
B.14
C.14.5
D.15
【答案】A
【分析】由题意,求出剔除异常数据后的平均数女x,进而求出剔除异常数据前的平均数y以x',根据回归
直线必过样本中心点得到à
【详解】因为立=36,刷除异常数据数据62)后,名36=6
因为点(,)在直线y=-6x+21上,所以6=-6x+21,解得x=2.5,
设利用原始数据求得的经验回归直线过点(x,y),
则7=6x+6=3,=6V+27
7
7
9
因为=-1.5x+à,所以a=9+1.5x3=13.5
故选:A
6.兰溪杨梅从5月15日起开始陆续上市,据调查统计,得到杨梅销售价格(单位:Q元/千克)与上市时
间t(单位:天)的数据如下表所示:
时间/(单位:天)
10
20
70
销售价格Q(单位:元/千克)
100
50
100
根据上表数据,从下列函数模型中选取一个描述杨梅销售价格Q与上市时间t的变化关系:
Q=t+b,Q=t2+bt+c,Q=a-b,Q=a.log,t.利用你选取的函数模型,在以下四个日期中,杨梅销售价格
最低的日期为()
A.6月5日
B.6月15日
C.6月25日
D.7月5日
【答案】C
【分析】根据表中数据,描述杨梅销售价格Q与上市时间的变化关系不可能是常数函数、也不可能是单
调函数,应选取Q=t2+bt+c进行描述,将表中数据代入Q=t2+bt+c可得Q=0.12-&+170,利用配
方法结合日期可得答案
【详解】根据表中数据,描述杨梅销售价格Q与上市时间的变化关系不可能是常数函数、也不可能是单
调函数,
函数Q=t+b,Q=a~b,Q=alog1在a≠0时均为单调函数,这与表格中的数据不吻合,
所以应选取Q=t+bt+c进行描述,
将表中数据(10,100),(20,50),(70,100)代入Q=at2+bt+c可得
100=100a+10b+c
a=0.1
50=400a+20b+c,解得b=-8,所以9=0.112-8t+170,
100=4900a+70b+c
c=170
Q=0.1(t-40)+10,所以当t=40时杨梅销售价格最低,
而6月5日时t=22,6月15日时t=32,6月25日时t=42,7月5日时t=52,
所以t=42时杨梅销售价格最低。
故选:C.
7.某杂交水稻研究小组先培育出第一代杂交水稻,再由第一代培育出第二代,第二代培育出第三代,以此
类推,且亲代与子代的每穗总粒数之间的关系如下表所示:
代数代码x
1
2
3
4
总粒数y
197
193
201
209
通过上面四组数据得到了x与y之间的线性回归方程是少=4.4x+à,预测第十代杂交水稻每穗的总粒数为
()
A.233
B.234
C.235
D.236
【答案】A
【分析】求出样本中心,然后确定回归直线方程,即可求解预测当x=10时,y的估计值
【详解】由题意可知:=1+2+3+4=2.5,丁=197+193+201+209-200.
4
4
因为回归直线方程经过样本中心,所以200=4.4×2.5+à,解得à=189,
回归直线方程为:)=4.4x+189,
当x=10时,y的估计值为:4.4×10+189=233
故选:A
8.某商店记录了某种产品近5个月的月销售量y(千台)如下表,样本中心点为(3,4).由于保管不善,记
录的5个数据中有两个数据看不清楚,现用m,n代替,已知3≤≤4,4≤n≤5,则下列结论正确的是()
第x个月
3
4
5
月销售量y
2.5
A.在m,确定的条件下,去掉样本点(3,4),则样本的相关系数"增大
B.在m,n确定的条件下,样本的相关系数r<0
C.在m,n确定的条件下,经过拟合,发现数据基本符合线性回归方程=0.76x+à,则a=1.7
D.在m,n确定的条件下,经过拟合,发现数据基本符合线性回归方程)=0.76x+à,则可预计该款商
品第6个月的销售量为6280台
【答案】D
【分析】根据回归直线方程过数据的样本中心点可判断A:根据月销售量y随着x的增大而增大可判断B:
根据样本中心点在回归直线上可判断C:求出回归直线方程,则可预计该款商品第6个月的销售量可判断
D
【详解】对于A,因为回归直线方程过数据的样本中心点(3,4),
所以在m,确定的条件下,去掉样本点(3,4),则样本的相关系数”不变,故A错误:
对于B,在m,确定的条件下,月销售量y随着x的增大而增大,
故样本的相关系数r>0,故B错误;
对于C,在m,确定的条件下,样本中心点为(3,4)在回归直线上,
可得4=0.76×3+a,解得a=1.72,故C错误:
对于D,由C得线性回归方程=0.76x+1.72,
因为少=(0.76×6+1.7)X1000=6260台,
则可预计该款商品第6个月的销售量为6280台,故D正确:
故选:D
二、多项选择题:本题共3小题,每小题6分,共18分在每小题给出的选项中,有多项符合题目要求.
全部选对的得6分,有选错的得0分.
9.下列说法正确的有()
A.己知两个变量具有线性相关关系,其回归直线方程为y=a+bx,若b=2,x=1,y=3,则a=1
B.线性相关系数r越大,两个变量的线性相关性越强:反之,线性相关性越弱
C.在残差图中,残差点分布的水平带状区域越窄,说明模型的拟合精度越高
D.根据分类变量X与Y的成对样本数据计算得到x2=3.218,依据=0.05的独立性检验(s=3.841),
没有充分证据推断零假设不成立,即可认为X与Y独立
【答案】ACD
【分析】本题考查线性回归方程中回归直线方程、线性相关系数、残差图与独立性检验的知识,一一检验
即可得到正确答案
【详解】已知两个变量具有线性相关关系,其回归直线方程为y=a+bx,
若b=2,x=1,y=3,则a=y-bx=1,因此A正确:
线性相关系数”的范围在-1到1之间,有正有负,相关有正相关和负相关,
相关系数的绝对值的大小越接近于1,两个变量的线性相关性越强:
反之,线性相关性越弱,因此B错误:
在残差图中,残差点分布的水平带状区域越窄,说明模型的拟合精度越高,因此C正确:
由独立性检验x2=3.218<3.841可知,没有充分证据推断原假设不成立,即认为X与Y独立,因此D正确
故选:ACD
10.下列结论正确的是()
A.一组数据7,8,8,9,11,13,15,17,20,22的第80百分位数为17
B.若随机变量5,7满足7=35-2,则D()=3D()-2
C.若随机变量5~N(4,o2),且P(5<6)=0.8,则P(2<5<6)=0.6
D.根据分类变量X与Y的成对样本数据,计算得到x2=4.712.依据=0.05的独立性检验
(xo.os=3.841),可判断X与Y有关
【答案】CD
【分析】A应用百分位数求法判断:B由方差性质判断:C根据正态分布对称性求概率判断:D由独立检
验的基本思想判断结论,
【详解】A:由10x80%=8,故第80百分位数为17+20
2
18.5,错:
B:由方差的性质知:D()=9D(5),错;
C:由正态分布性质,随机变量5的正态曲线关于=4对称,
所以P2<5<可=2x[P5<6-=0.6,对:
D:由题设X2=4.712>xs=3.841,结合独立检验的基本思想,在a=0.05小概率情况下X与Y有关,对,
故选:CD
11.下列命题正确的是()
A.若样本数据x,x2,,x。的方差为2,则数据2x-1,2x2-1,…,2x。-1的方差为8
B.已知互不相同的30个样本数据,若去掉其中最大和最小的数据,剩下28个数据的20%分位数不
等于原样本数据的20%分位数
C.若A,B两组成对数据的样本相关系数分别为4=0.97,r。=-0.99,则A组数据比B组数据的线
性相关程度更强
D.若决定系数R2的值越接近于1,则表示回归模型的拟合效果越好
【答案】ABD
【分析】对于A:根据方差的性质可得;对于B:根据百分数的定义可得:对于C:根据相关系数的性质
可得:对于D:根据决定系数的性质可得
【详解】对于A:若样本数据x,x2,,x。的方差为2,则数据2x1-1,2x2-1,2x。-1的方差为22×2=8,A
正确:
对于B:设原本数据从小到大为,,,x,x0,因为30×20%=6,所以原样本数据的209%分位数为。+x
2
去掉最大值x30和最小值x后剩余数据按从小到大排列为x,,x29,因为28×20%=5.6,所以剩下28个数
据的20%分位数为x2,故不一样,B正确:
对于C:<,故B组数据比A组数据的线性相关程度更强,C错误:
对于D:若决定系数R的值越接近于1,则表示回归模型的拟合效果越好,D正确:
故选:ABD
三、填空题;本题共3小题,每小题5分,共15分
12.样本相关系数:设由变量x和y获得的两组数据分别为x,和y(=1,2,,),其对应关系如下表
所示:
变量x
X2
Xi
X
变量y
ye
两组数据x,和y的线性相关系数是度量两个变量x与y之间线性相关程度的统计量,
其计算公式为r=
它们分别是这两组数据的算术平均数,
n
x-x)0y-)
【答案】
1=1
2-02w动
【分析】利用相关系的定义可得结论
【详解】样本相关系数:设由变量x和y获得的两组数据分别为x,和y(i=1,2,3,,n),其对应关系如下
表所示:
变量x
2
x
变量y
ys
9
两组数据x,和y,的线性相关系数是度量两个变量x与y之间线性相关程度的统计量,
2(x-00y-)
其计算公式为”=
②-立0w-列
2g-0-)
故答案为:
公--列
1=1
13.某地建立了农业科技图书馆,供农民免费借阅,
收集了近5年的借阅数据如下表:
年份
2019
2020
2021
2022
2023
年份代码x
1
2
3
4
5
年借阅量
4.9
5.1
5.5
5.7
5.8
y/万册
根据上表,可得y关于x的线性回归方程为y=0.24x+a.则a=
【答案】4.68
【分析】利用回归方程过样本中心点(x,y),代入计算即可求得à=4.68
【详解】根据表格可知,
x-1+2+3+4+5-3,y=49+51+55+5.7+5.854,
5
代入y=0.24x+a,可得a=4.68
故答案为:4.68
14.在独立性检验中,为了调查变量X与变量Y的关系,经过计算得到P(x2≥6.635)=0.01,表示的意义
是
(填序号).
①有99%的把握认为变量X与变量Y没有关系:
②有1%的把握认为变量X与变量Y有关系:
③有99%的把握认为变量X与变量Y有关系;
④有1%的把握认为变量X与变量Y没有关系.
【答案】③④
【分析】由独立性检验中观测值和临界值的意义,即可得出正确的答案
【详解】在独立性检验中,由P(x2≥6.635)=0.01
表示的意义是:有1%的把握认为变量X与变量Y没有关系,所以④正确:
即有99%的把握认为变量X与变量Y有关系,所以③正确。
故答案为:③④
四、解答题:本题共5小题,共77分解答应写出文字说明、证明过程或演算步骤
15.(13分)随着我国老龄化进程不断加快,养老将会是未来每个人要面对的问题,而如何养老则是我国
逐渐进入老龄化社会后,整个社会需要回答的问题.为了调查某地区老年人是否愿意参加养老机构,用简
单随机抽样方法从该地区调查了500位老人,结果如下:
是否愿意参加
男
女
不愿意
50
50
愿意
150
250
(1)估计该地区男性老年人中,愿意参加养老机构的男性老年人的概率:
(2)依据小概率值α=0.025的独立性检验,能否认为该地区的老年人是否愿意参加养老机构与性别有关?请
解释所得结论的实际含义,
n(ad-be)'
附:X=(a+b)c+d)(a+cb+d
0.05
0.025
0.01
0.005
0.001
Xa
3.841
5.024
6.635
7.879
10.828
【答案1)4
(2)答案见解析
【分析】(1)用频率估计概率即可
(2)计算x,根据表中数据比较即可得出结论
【详解】(1)由统计数据可知,愿意参加养老机构的男性老年人为150,调查的男性老年人的总人数为200,
故男性老年人中愿意参加养老机构的频率为}50-3
20041
根据频率稳定于概率的原理,估计该地区男性老年
人中,愿意参加养老机构的男性老年人的概率为
(2)假设H。:该地区的老年人是否愿意养老机构与性别无关.
根据列联表中的数据,经计算可得X-50050x250-50x150八-125.52085024X,
100×400×200×30024
根据小概率值α=0.025的独立性检验,推断H,不成立,即认为该地区的老年人是否愿意参加养老机构与
性别有关,此推断犯错误的概率不大于0.025.
男性老年人愿意参加养老机构和不愿意参加养老机构的频率分别为}和}
4
女性老年人愿意参加养老机构和不愿意参加养老机构的频率分别为和上」
6
6·
由此可见,女性老年人愿意参加养老机构的频率明显高于男性老年人愿意参加养老机构的频率,
根据频率稳定于概率的原理,可以推断该地区女性老年人愿意参加养老机构的概率明显高于男性老年人愿
意参加养老机构的概率
16.(15分)某单位最近组织了一次健身活动,活动分为登山组和游泳组,因为两个活动在同一时间段进
行,所以每个职工只能参加其中的一个活动.在参加活动的职工中,男士90名,女士110名.
(1)根据统计数据,请在下面表格的空白处填写正确数字,并说明能否在犯错概率不超过0.05的前提下
认为是否参加登山组活动与性别有关,
女士
男士
合计
登山组人数
40
游泳组人数
70
合计
n(ad-be)
附:X=a+b)c+d)(a+cb+d
其中n=a+b+c+d.
k
2.706
3.841
5.024
6.635
7.897湘教版高中数学选择性必修第二册第四章统计测试卷
一、单项选择题:本题共8小题,每小题5分,共40分在每小题给出的四个选项中,只有一项是符合题
目要求的.
1.如图是根据变量x,y的观测数据(x,y,)(=1,2,3,,10)得到的散点图,根据散点图可以判断变量x与y
具有相关关系的图是()
①
2
4
A.①②
B.①③
C.②③④
D.③④
2.如图,有6组数据,去掉哪组数据后(填字母代号),剩下的5组数据的线性相关性最大()
C。
E
D
B
A
x
A.A
B.B
C.C
D.D
3.下列说法正确的个数是()
①线性相关系数越接近1,两个变量的线性相关程度越强;
②独立性检验可以100%确定两个变量之间是否具有某种关系:
③在回归分析中,可用残差图判断模型的拟合效果,残差点比较均匀地落在水平的带状区域中,说明这样
的模型比较合适,带状区域的宽度越窄,说明模型的拟合精度越高;
④甲、乙两个模型的决定系数R2分别约为0.88和0.80,则模型甲的拟合效果更好.
A.1
B.2
C.3
D.4
4.下列说法中,正确的为()
A.在研究数据的离散程度时,一组数据中添加新数据,其极差与标准差都可能变小
B.在研究变量间的相关关系时,两个变量的相关系数越小,则两者的线性相关程度越弱
C.在实施独立性检验时,显著增加分类变量的样本容量,随机变量K的观测值k会减小
D.在回归分析中,模型样本数据的R值越大,其残差平方和就越小,拟合效果就越好
5.在研究变量x与y之间的相关关系时,进行实验后得到了一组样本数据(x,y),(x2,y2),,(x,y6),
(6,27),利用此样本数据求得的经验回归方程为少=-1.5x+à,现发现数据(6,27)误差较大,剔除这对数据
后,求得的经验回归方程为=6x+21,且2y-36,则à=()
=1
A.13.5
B.14
C.14.5
D.15
6.兰溪杨梅从5月15日起开始陆续上市,据调查统计,得到杨梅销售价格(单位:Q元/千克)与上市时
间t(单位:天)的数据如下表所示:
时间/(单位:天)
10
20
70
销售价格Q(单位:元/千克)
100
50
100
根据上表数据,从下列函数模型中选取一个描述杨梅销售价格Q与上市时间t的变化关系:
Q=t+b,Q=t2+bt+c,Q=b,Q=a.log t.利用你选取的函数模型,在以下四个日期中,杨梅销售价格
最低的日期为()
A.6月5日
B.6月15日
C.6月25日
D.7月5日
7.某杂交水稻研究小组先培育出第一代杂交水稻,再由第一代培育出第二代,第二代培育出第三代,以此
类推,且亲代与子代的每穗总粒数之间的关系如下表所示:
代数代码x
1
2
3
4
总粒数y
197
193
201
209
通过上面四组数据得到了x与y之间的线性回归方程是)=4.4x+à,预测第十代杂交水稻每穗的总粒数为
()
A.233
B.234
C.235
D.236
8.某商店记录了某种产品近5个月的月销售量y(千台)如下表,样本中心点为(3,4).由于保管不善,记
录的5个数据中有两个数据看不清楚,现用m,n代替,已知3≤m≤4,4≤n≤5,则下列结论正确的是()
第x个月
2
3
5
月销售量y
2.5
n
n
5
A.在m,n确定的条件下,去掉样本点(3,4),则样本的相关系数"增大
B.在m,n确定的条件下,样本的相关系数r<0
C.在m,n确定的条件下,经过拟合,发现数据基本符合线性回归方程)=0.76x+à,则à=1.7
D.在m,n确定的条件下,经过拟合,发现数据基本符合线性回归方程少=0.76x+à,则可预计该款商
品第6个月的销售量为6280台
二、多项选择题:本题共3小题,每小题6分,共18分在每小题给出的选项中,有多项符合题目要求.
全部选对的得6分,有选错的得0分.
9,下列说法正确的有()
A.己知两个变量具有线性相关关系,其回归直线方程为y=a+bx,若b=2,x=1,y=3,则a=1
B.线性相关系数r越大,两个变量的线性相关性越强;反之,线性相关性越弱
C.在残差图中,残差点分布的水平带状区域越窄,说明模型的拟合精度越高
D.根据分类变量X与Y的成对样本数据计算得到x2=3.218,依据=0.05的独立性检验(xs=3.841),
没有充分证据推断零假设不成立,即可认为X与Y独立
10.下列结论正确的是()
A.一组数据7,8,8,9,11,13,15,17,20,22的第80百分位数为17
B.若随机变量5,刀满足刀=35-2,则D()=3D(5)-2
C.若随机变量5~N(4,o2),且P(5<6)=0.8,则P(2<5<6)=0.6
D.根据分类变量X与Y的成对样本数据,计算得到x2=4.712.依据x=0.05的独立性检验
(xos=3.841),可判断X与Y有关
11.下列命题正确的是()
A.若样本数据x,x2,,x。的方差为2,则数据2x-1,2x2-1,,2x。-1的方差为8
B.已知互不相同的30个样本数据,若去掉其中最大和最小的数据,剩下28个数据的20%分位数不
等于原样本数据的20%分位数
C.若A,B两组成对数据的样本相关系数分别为”=0.97,”。=-0.99,则A组数据比B组数据的线
性相关程度更强
D.若决定系数R的值越接近于1,则表示回归模型的拟合效果越好
三、填空题:本题共3小题,每小题5分,共15分
12.样本相关系数:设由变量x和y获得的两组数据分别为x,和y(i=1,2,.,),其对应关系如下表
所示:
变量x
X2
4
$
Xs
x
变量y
ya
ye
yn
两组数据x,和y,的线性相关系数是度量两个变量x与y之间线性相关程度的统计量,
其计算公式为1,其中,《号∑x,出,它们分别是这两组数据的算术平均数
13.某地建立了农业科技图书馆,供农民免费借阅,收集了近5年的借阅数据如下表:
年份
2019
2020
2021
2022
2023
年份代码x
1
2
3
4
5
年借阅量
4.9
5.1
5.5
5.7
5.8
y/万册
根据上表,可得y关于x的线性回归方程为y=0.24x+a.则a=
14.在独立性检验中,为了调查变量X与变量Y的关系,经过计算得到P(x2≥6.635)=0.01,表示的意义
是
(填序号).
①有99%的把握认为变量X与变量Y没有关系:
②有1%的把握认为变量X与变量Y有关系;
③有99%的把握认为变量X与变量Y有关系:
④有1%的把握认为变量X与变量Y没有关系,
四、解答题:本题共5小题,共77分解答应写出文字说明、证明过程或演算步骤.
15.(13分)随着我国老龄化进程不断加快,养老将会是未来每个人要面对的问题,而如何养老则是我国
逐渐进入老龄化社会后,整个社会需要回答的问题.为了调查某地区老年人是否愿意参加养老机构,用简
单随机抽样方法从该地区调查了500位老人,结果如下:
是否愿意参加
男
女
不愿意
50
50
愿意
150
250
(1)估计该地区男性老年人中,愿意参加养老机构的男性老年人的概率;
(2)依据小概率值α=0.025的独立性检验,能否认为该地区的老年人是否愿意参加养老机构与性别有关?请
解释所得结论的实际含义.
n(ad-bc)'
附:X2=
(a+b)(c+d)(a+c)(b+d)
0.05
0.025
0.01
0.005
0.001
Xa
3.841
5.024
6.635
7.879
10.828
16.(15分)某单位最近组织了一次健身活动,活动分为登山组和游泳组,因为两个活动在同一时间段进
行,所以每个职工只能参加其中的一个活动.在参加活动的职工中,男士90名,女士110名.
(1)根据统计数据,请在下面表格的空白处填写正确数字,并说明能否在犯错概率不超过0.05的前提下
认为是否参加登山组活动与性别有关
女士
男士
合计
登山组人数
40
游泳组人数
70
合计
n(ad-be)
附:X2=
其中n=a+b+c+d.
(a+b)(c+d)(a+c)(b+d)
2.706
3.841
5.024
6.635
7.897
P(x2≥k)
0.100
0.050
0.025
0.010
0.005
(2)将上述调查所得到的频率视为概率,现在从该单位参加活动的职工中,每次随机抽取1名职工,抽取
3次,记被抽取的3名职工中参加登山组活动的人数为5.若每次抽取的结果是相互独立的,求5的分布列、
数学期望E()和方差D(5)
17.(15分)人工智能对人们的生活有较大的影响,为了让老师更加重视人工智能,某校随机抽出30名男
教师和20名女教师参加学校组织的“人工智能相关知识问卷调查(满分100分),若分数为80分及以上的
为优秀,其他为非优秀,统计并得到如下列联表:
男教师
女教师
总计
优秀
20
15
35
非优秀
10
5
15
总计
30
20
50
(1)根据小概率值=0.1的独立性检验,能否认为这次成绩是否优秀与性别有关?
(2)从样本中成绩非优秀的15名老师中,随机抽取2人进行调研,记抽出的2人中女老师的人数为X,求X
的分布列和数学期望,
附:x2=
n(ad-be)2
(a+b)(c+d)(a+c)(b+d)'
其中n=a+b+c+d.
0.1
0.05
0.01
0.001
2.706
3.841
6.635
10.828
18.(17分) 人工智能(英语:Artificial intelligence, 缩写为A I) 亦称智械、机器智能, 指由人制造出来的
可以表现出智能的机器.通常人工智能是指通过普通计算机程序来呈现人类智能的技术.人工智能的核心
问题包括建构能够跟人类似甚至超卓的推理、知识、规划、学习、交流、感知、移物、使用工具和操控机
械的能力等.当前有大量的工具应用了人工智能,其中包括搜索和数学优化、逻辑推演.而基于仿生学、
认知心理学,以及基于概率论和经济学的算法等等也在逐步探索当中.思维来源于大脑,而思维控制行为,
行为需要意志去实现,而思维又是对所有数据采集的整理,相当于数据库.某中学计划在高一年级开设人
工智能课程.为了解学生对人工智能是否感兴趣,随机从该校高一年级学生中抽取了400人进行调查,整
理得到如下列联表:
感兴趣
不感兴趣
合计
男生
180
40
220
女生
120
60
180
合计
300
100
400
(1)依据小概率值
α=0.001
1的独立性检验,能否认为对人工智能是否感兴趣与性别有关联?
(2)从对人工智能感兴趣的学生中按性别采用分层抽样的方法随机抽取10人,再从这10人中随机抽取3人
进行采访,记随机变量X表示抽到的3人中女生的人数,求
X
的分布列和数学期望.
$$x ^ { 2 } = \frac { n \left( a d - b c \right) ^ { 2 } } { \left( a + b \right) \left( c + d \right) \left( a + c \right) \left( b + d \right) } ,$$
n=a+b+c+d.
α
0.1
0.05
0.01
0.005
0.001
$$x _ { a }$$
2.706
3.841
6.635
7.879
10.828
19.(17分)第24届冬奥会于2022年2月4日在北京市和张家口市联合举行,此项赛事大大激发了国人
冰雪运动的热情某滑雪场在冬奥会期间开业,下表统计了该滑雪场开业第x天的滑雪人数y(单位:百人)
的数据
天数代码x
2
滑雪人数y(百人)
9
11
14
26
20
经过测算,若一天中滑雪人数超过3500人时,当天滑雪场可实现盈利,请建立y关于x的回归方程,并预
测该滑雪场开业的第几天开始盈利.
参考公式:线性回归方程)=bx+a的斜率和截距的最小二乘法估计分别为
24-(y-
6
,a=-m
2列
湘教版高中数学选择性必修第二册第四章统计测试卷
一、单项选择题:本题共8小题,每小题5分,共40分.在每小题给出的四个选项中,只有一项是符合题目要求的.
1.如图是根据变量x,y的观测数据得到的散点图,根据散点图可以判断变量x与y具有相关关系的图是( )
A.①② B.①③ C.②③④ D.③④
2.如图,有6组数据,去掉哪组数据后(填字母代号),剩下的5组数据的线性相关性最大( )
A.A B.B C.C D.D
3.下列说法正确的个数是( )
①线性相关系数越接近1,两个变量的线性相关程度越强;
②独立性检验可以100%确定两个变量之间是否具有某种关系;
③在回归分析中,可用残差图判断模型的拟合效果,残差点比较均匀地落在水平的带状区域中,说明这样的模型比较合适,带状区域的宽度越窄,说明模型的拟合精度越高;
④甲、乙两个模型的决定系数分别约为0.88和0.80,则模型甲的拟合效果更好.
A.1 B.2 C.3 D.4
4.下列说法中,正确的为( )
A.在研究数据的离散程度时,一组数据中添加新数据,其极差与标准差都可能变小
B.在研究变量间的相关关系时,两个变量的相关系数越小,则两者的线性相关程度越弱
C.在实施独立性检验时,显著增加分类变量的样本容量,随机变量的观测值会减小
D.在回归分析中,模型样本数据的值越大,其残差平方和就越小,拟合效果就越好
5.在研究变量与之间的相关关系时,进行实验后得到了一组样本数据,,…,,,利用此样本数据求得的经验回归方程为,现发现数据误差较大,剔除这对数据后,求得的经验回归方程为,且,则( )
A.13.5 B.14 C.14.5 D.15
6.兰溪杨梅从5月15日起开始陆续上市,据调查统计,得到杨梅销售价格(单位:Q元/千克)与上市时间t(单位:天)的数据如下表所示:
时间t/(单位:天)
10
20
70
销售价格Q(单位:元/千克)
100
50
100
根据上表数据,从下列函数模型中选取一个描述杨梅销售价格Q与上市时间t的变化关系:.利用你选取的函数模型,在以下四个日期中,杨梅销售价格最低的日期为( )
A.6月5日 B.6月15日 C.6月25日 D.7月5日
7.某杂交水稻研究小组先培育出第一代杂交水稻,再由第一代培育出第二代,第二代培育出第三代,以此类推,且亲代与子代的每穗总粒数之间的关系如下表所示:
代数代码
1
2
3
4
总粒数
197
193
201
209
通过上面四组数据得到了与之间的线性回归方程是,预测第十代杂交水稻每穗的总粒数为( )
A.233 B.234 C.235 D.236
8.某商店记录了某种产品近5个月的月销售量(千台)如下表,样本中心点为.由于保管不善,记录的5个数据中有两个数据看不清楚,现用代替,已知,则下列结论正确的是( )
第个月
1
2
3
4
5
月销售量
2.5
4
5
A.在确定的条件下,去掉样本点,则样本的相关系数增大
B.在确定的条件下,样本的相关系数
C.在确定的条件下,经过拟合,发现数据基本符合线性回归方程,则
D.在确定的条件下,经过拟合,发现数据基本符合线性回归方程,则可预计该款商品第6个月的销售量为6280台
二、多项选择题:本题共3小题,每小题6分,共18分.在每小题给出的选项中,有多项符合题目要求.全部选对的得6分,有选错的得0分.
9.下列说法正确的有( )
A.已知两个变量具有线性相关关系,其回归直线方程为,若,,,则
B.线性相关系数越大,两个变量的线性相关性越强;反之,线性相关性越弱
C.在残差图中,残差点分布的水平带状区域越窄,说明模型的拟合精度越高
D.根据分类变量与的成对样本数据计算得到,依据的独立性检验(),没有充分证据推断零假设不成立,即可认为与独立
10.下列结论正确的是( )
A.一组数据7,8,8,9,11,13,15,17,20,22的第80百分位数为17
B.若随机变量,满足,则
C.若随机变量,且,则
D.根据分类变量与的成对样本数据,计算得到.依据的独立性检验,可判断与有关
11.下列命题正确的是( )
A.若样本数据的方差为2,则数据的方差为8
B.已知互不相同的30个样本数据,若去掉其中最大和最小的数据,剩下28个数据的20%分位数不等于原样本数据的20%分位数
C.若A,B两组成对数据的样本相关系数分别为,,则A组数据比B组数据的线性相关程度更强
D.若决定系数的值越接近于1,则表示回归模型的拟合效果越好
三、填空题:本题共3小题,每小题5分,共15分.
12.样本相关系数:设由变量x和y获得的两组数据分别为和(i=1,2,…,n),其对应关系如下表所示:
变量x
…
变量y
…
两组数据和的线性相关系数是度量两个变量x与y之间线性相关程度的统计量,
其计算公式为 ,其中,,,它们分别是这两组数据的算术平均数.
13.某地建立了农业科技图书馆,供农民免费借阅,收集了近5年的借阅数据如下表:
年份
2019
2020
2021
2022
2023
年份代码
1
2
3
4
5
年借阅量万册
4.9
5.1
5.5
5.7
5.8
根据上表,可得关于的线性回归方程为.则 .
14.在独立性检验中,为了调查变量与变量的关系,经过计算得到,表示的意义是 (填序号).
①有的把握认为变量与变量没有关系;
②有的把握认为变量与变量有关系;
③有的把握认为变量与变量有关系;
④有的把握认为变量与变量没有关系.
四、解答题:本题共5小题,共77分.解答应写出文字说明、证明过程或演算步骤.
15.(13分)随着我国老龄化进程不断加快,养老将会是未来每个人要面对的问题,而如何养老则是我国逐渐进入老龄化社会后,整个社会需要回答的问题.为了调查某地区老年人是否愿意参加养老机构,用简单随机抽样方法从该地区调查了500位老人,结果如下:
是否愿意参加
男
女
不愿意
50
50
愿意
150
250
(1)估计该地区男性老年人中,愿意参加养老机构的男性老年人的概率;
(2)依据小概率值的独立性检验,能否认为该地区的老年人是否愿意参加养老机构与性别有关?请解释所得结论的实际含义.
附:.
0.05
0.025
0.01
0.005
0.001
3.841
5.024
6.635
7.879
10.828
16.(15分)某单位最近组织了一次健身活动,活动分为登山组和游泳组,因为两个活动在同一时间段进行,所以每个职工只能参加其中的一个活动.在参加活动的职工中,男士90名,女士110名.
(1)根据统计数据,请在下面表格的空白处填写正确数字,并说明能否在犯错概率不超过0.05的前提下认为是否参加登山组活动与性别有关.
女士
男士
合计
登山组人数
40
游泳组人数
70
合计
附:,其中.
2.706
3.841
5.024
6.635
7.897
0.100
0.050
0.025
0.010
0.005
(2)将上述调查所得到的频率视为概率,现在从该单位参加活动的职工中,每次随机抽取1名职工,抽取3次,记被抽取的3名职工中参加登山组活动的人数为.若每次抽取的结果是相互独立的,求的分布列、数学期望和方差.
17.(15分)人工智能对人们的生活有较大的影响,为了让老师更加重视人工智能,某校随机抽出30名男教师和20名女教师参加学校组织的“人工智能”相关知识问卷调查(满分100分),若分数为80分及以上的为优秀,其他为非优秀,统计并得到如下列联表:
男教师
女教师
总计
优秀
20
15
35
非优秀
10
5
15
总计
30
20
50
(1)根据小概率值的独立性检验,能否认为这次成绩是否优秀与性别有关?
(2)从样本中成绩非优秀的15名老师中,随机抽取2人进行调研,记抽出的2人中女老师的人数为,求的分布列和数学期望.
附:,其中.
0.1
0.05
0.01
0.001
2.706
3.841
6.635
10.828
18.(17分)人工智能(英语:Artificialintelligence,缩写为)亦称智械、机器智能,指由人制造出来的可以表现出智能的机器.通常人工智能是指通过普通计算机程序来呈现人类智能的技术.人工智能的核心问题包括建构能够跟人类似甚至超卓的推理、知识、规划、学习、交流、感知、移物、使用工具和操控机械的能力等.当前有大量的工具应用了人工智能,其中包括搜索和数学优化、逻辑推演.而基于仿生学、认知心理学,以及基于概率论和经济学的算法等等也在逐步探索当中.思维来源于大脑,而思维控制行为,行为需要意志去实现,而思维又是对所有数据采集的整理,相当于数据库.某中学计划在高一年级开设人工智能课程.为了解学生对人工智能是否感兴趣,随机从该校高一年级学生中抽取了400人进行调查,整理得到如下列联表:
感兴趣
不感兴趣
合计
男生
180
40
220
女生
120
60
180
合计
300
100
400
(1)依据小概率值的独立性检验,能否认为对人工智能是否感兴趣与性别有关联?
(2)从对人工智能感兴趣的学生中按性别采用分层抽样的方法随机抽取10人,再从这10人中随机抽取3人进行采访,记随机变量表示抽到的3人中女生的人数,求的分布列和数学期望.
附:,其中.
0.1
0.05
0.01
0.005
0.001
2.706
3.841
6.635
7.879
10.828
19.(17分)第24届冬奥会于2022年2月4日在北京市和张家口市联合举行,此项赛事大大激发了国人冰雪运动的热情.某滑雪场在冬奥会期间开业,下表统计了该滑雪场开业第天的滑雪人数(单位:百人)的数据.
天数代码
1
2
3
4
5
滑雪人数(百人)
9
11
14
26
20
经过测算,若一天中滑雪人数超过3500人时,当天滑雪场可实现盈利,请建立关于的回归方程,并预测该滑雪场开业的第几天开始盈利.
参考公式:线性回归方程的斜率和截距的最小二乘法估计分别为.
学科网(北京)股份有限公司
$