内容正文:
第八章 成对数据的统计分析单元测试卷(提升版)
(考试时间:120分钟,分值:150分)
注意事项:
1.答卷前,考生务必将自己的姓名、准考证号填写在答题卡上。
2.回答选择题时,选出每小题答案后,用铅笔把答题卡上对应题目的答案标号涂黑。如需改动,用橡皮擦干净后,再选涂其他答案标号。回答非选择题时,将答案写在答题卡上。写在本试卷上无效。
3.考试结束后,将本试卷和答题卡一并交回。
第一部分(选择题 共58分)
一、选择题:本题共8小题,每小题5分,共40分。在每小题给出的四个选项中,只有一项是符合题目要求的。
1.下列说法错误的是( )
A.在做回归分析时,可以用决定系数刻画模型的回归效果,若越大,则说明模型拟合的效果越好
B.可以用相关系数r刻画两个变量的相关程度强弱,r值越大两个变量的相关程度越强
C.残差图中,残差点所在的水平带状区域越窄,则回归方程的预报精确度越高
D.某物理量的测量结果服从正态分布,越大,该物理量在一次测量中在的概率越小
【答案】B
【分析】利用决定系数、相关系数、残差图、正态分布的相关概念与性质一一分析选项即可.
【详解】对于A,决定系数越接近1,说明模型对数据的拟合效果越好,
相反若越小,则说明模型拟合的效果越差,故A正确;
对于B,相关系数r的绝对值越接近1,说明两个变量的相关程度越强,故B错误;
对于C,残差图中,残差点所在水平带状区域越窄,说明残差波动越小,即对数据的预测误差越小,故C正确;
对于D,越大,则正态分布的曲线越扁平,数据的离散程度越大,
根据正态分布的对称性,某物理量的测量结果服从正态分布,
越大,该物理量在一次测量中在的概率越小,故D正确.
故选:B
2.已知变量和满足经验回归方程,且变量和之间的一组相关数据如下表所示,则下列说法错误的是( )
5
6
9
12
8
7
2.4
A. B.当时,
C.变量和呈负相关 D.该经验回归直线必过点
【答案】D
【分析】根据线性回归方程的性质判断即可.
【详解】选项A:因为变量和满足经验回归方程,又,,
所以,解得,故A正确;
选项B:因为变量和满足经验回归方程,
当时,,故B正确;
选项C:因为变量和满足经验回归方程,,
所以变量和呈负相关,故C正确;
选项D:由选项A知,,,该经验回归直线必过点,不一定过样本点,故D错误.
故选:D.
3.具有相关关系的变量x与y的一组样本数据如下,若已求得线性回归方程为,则去掉其中某对样本数据,样本相关系数r不会发生改变的是( )
(参考公式:相关系数
x
1
2
3
4
5
y
6
10
11
12
16
A. B. C. D.
【答案】C
【分析】先求得样本中心点,再结合相关系数公式判断即可.
【详解】由题知,,
所以数据的样本中心点为
所以去掉其中样本数据,样本相关系数r不会发生改变.
4.为比较甲、乙两所学校学生的数学水平,采用简单随机抽样的方法抽取100名学生.通过测验得到如下的列联表:
单位:人
学校
数学成绩
合计
不优秀
优秀
甲
40
10
50
乙
30
20
50
合计
70
30
100
附:,其中.
0.1
0.05
0.01
0.005
0.001
2.706
3.841
6.635
7.879
10.828
下列结论正确的是( )
A.依据小概率值的独立性检验,认为两校学生的数学成绩优秀率无差异
B.依据小概率值的独立性检验,认为两校学生的数学成绩优秀率有差异
C.依据小概率值的独立性检验,认为两校学生的数学成绩优秀率有差异
D.依据小概率值的独立性检验,认为两校学生的数学成绩优秀率有差异
【答案】B
【分析】根据独立性检验的基本思想,结合已知计算得,逐项进行分析即可求解.
【详解】零假设为:两校学生的数学成绩优秀率无差异,
A,若,因为,故有充分的证据推断不成立,
即两校学生的数学成绩优秀率有差异,故A错误;
B,若,因为,故有充分的证据推断不成立,
即两校学生的数学成绩优秀率有差异,故B正确;
C,若,因为,故没有充分的证据推断不成立,
即两校学生的数学成绩优秀率无差异,故C错误;
D,若,因为,故没有充分的证据推断不成立,
即两校学生的数学成绩优秀率无差异,故D错误.
故选:B
5.读万卷书,行万里路.随着我国教育模式由“应试教育”向“素质教育”转变,研学旅行作为一种传统而现代的素质教育手段被广泛关注.某校对“是否喜欢参加暑期研学旅行与学生性别的关系”进行了一次调查,其中被调查的男、女生人数相同,男生中喜欢参加暑期研学旅行的人数占男生人数的,女生中喜欢参加暑期研学旅行的人数占女生人数的.若有95%的把握认为是否喜欢参加暑期研学旅行与学生性别有关,则被调查的学生中,男生的人数不可能为( )
A.25 B.45 C.60 D.75
【答案】A
【分析】根据条件设男生人数为,再根据条件列出列联表,计算,解不等式.
【详解】依题意,设男生的人数为,可列出2×2列联表如下所示:
是否喜欢参加暑期研学旅行
性别
总计
男生
女生
喜欢
不喜欢
总计
则=.
由题意知,即,得,所以.
又,所以结合选项知B,C,D项都可以.
6.现有10个样本数据,,…,,可得经验回归方程为,且,若去掉一个数据点后,可以得到新的经验回归方程为,则实数的值为( )
A.1 B. C. D.2
【答案】A
【详解】根据回归直线过样本中心点,代入得:
,所以原个样本的值总和为:,
去掉后,剩余个样本的值总和为:,值总和为:
因此新的样本中心点为:,
因为新的经验回归方程为,回归直线必过新的样本中心点,代入得:
,解得:.
7.为考察两个变量x,y的相关性,搜集数据如表,则两个变量的线性相关程度( )
x
5
10
15
20
25
y
103
105
110
111
114
(参考数据:,,,≈15.8,≈9.01)
A.很强 B.很弱
C.无相关 D.不确定
【答案】A
【分析】先计算线性相关系数 ,再通过 ()的绝对值判断相关强度( 越接近1,线性相关程度越强).
【详解】解析:由题可知样本量 ,所以:
=15,
=108.6,
又因为:,,,,≈15.8,
所以:
=,
因为相关系数很接近于1,故两个变量的线性相关程度很强.
答案:A.
8.用模型拟合一组数据,令,若根据样本数据计算可得,,且与的经验回归方程为,则( )(参考数据,)
A.1.2 B.0.92 C.0.3 D.0.4
【答案】D
【分析】根据给定的数据求出样本中心点,求出即可.
【详解】由,,
则,解得,因此,
由两边取对数,得,又,
所以,又因为,所以.
二、选择题:本题共3小题,每小题6分,共18分.在每小题给出的选项中,有多项符合题目要求.全部选对的得6分,部分选对的得部分分,有选错的得0分.
9.下列命题中正确的是( )
A.决定系数越大,残差平方和越小,模型拟合效果越好
B.若回归方程为,则变量y与x成负相关
C.某校高三年级男生的身高(单位:cm)近似服从,随机选择一名该校高三年级的男生,则(若,则,)
D.样本相关系数的取值范围为,刻画了样本点集中于某条直线的程度,当时,只表明成对样本数据间没有线性相关关系
【答案】ABD
【详解】决定系数越大,对应分式越小,分母为定值(对已知数据而言,与经验回归方程无关),则分子残差平方和越小,模型拟合效果越好,故A正确;
由回归方程可知,两个变量呈现线性相关,且随着x的增大,y减小,所以变量y与x成负相关,所以B正确;
因为学生身高近似服从正态分布,故均值为,标准差为,而范围在均值170的右侧距离到之间的区间,所以根据正态分布对称性可知:,所以可得
,故C错误;
样本相关系数的取值范围为,刻画了样本点集中于某条直线的程度(线性相关性),当时,只表明成对样本数据间没有线性相关关系,但是不排除其他相关关系,故D正确.
10.某医学研究团队为探究新型降压药的疗效与患者年龄的关联,将120名高血压患者按年龄分为“中青年组(<60岁)”和“老年组(岁)”,记录用药后的疗效(“有效”“无效”),得到如下列联表:
患者
疗效
总计
有效
无效
中青年组
10
40
50
老年组
40
30
70
总计
50
70
120
附:,其中.
0.10
0.05
0.025
0.01
2.706
3.841
5.024
6.635
则下列说法中正确的有( )
A.若在“老年组”中按疗效分层抽样抽取7人,再从这7人中随机抽取2人,则至少抽到1名“无效”患者的概率为
B.从所有患者中随机抽取1人,设事件“该人在中青年组”,事件“该药对此人有效”,则事件A与B相互独立
C.根据小概率值的独立性检验,认为“降压药疗效与患者年龄有关”,且该推断犯错误的概率不超过
D.若将列联表中“中青年组有效”的人数改为15,“中青年组无效”的人数改为35,则所得值比原值大
【答案】AC
【分析】选项A,用分层抽样先确定抽出的“有效”和“无效”人数,再做组合概率;选项B,用独立事件定义检验是否等于;选项C,计算列联表的值,与临界值比较;选项D分别计算修改前后的值大小.
【详解】选项A,老年组中有效与无效的人数比为
按疗效分层抽样抽取7人,则应抽到:4人有效,3人无效,
再从这 7 人中随机抽取 2 人,至少抽到 1 名无效患者的概率为所以 A 正确;
选项B,设事件:表示“该人在中青年组”,事件:表示“该药对此人有效”,
则而
若相互独立,则应有
显然所以事件与不相互独立,B 错误;
选项C,由题中列联表,
所以
即
因为所以根据小概率值的独立性检验,
可以认为“降压药疗效与患者年龄有关”,且该推断犯错误的概率不超过,所以C正确;
选项D,若将“中青年组有效”改为 15,“中青年组无效”改为 35,
则新列联表中
此时
即,而原来的
所以修改后的值比原来的小,D 错误.
11.已知相关系数,y关于x的经验回归方程中斜率和截距的最小二乘估计公式分别为,,残差平方和为.已知变量x与变量y的部分数据,建立由最小二乘法得到的两个回归模型:以x为自变量,y为因变量,得出的经验回归方程为;以y为自变量,x为因变量,得出的经验回归方程为.若两个模型的计算均无误,则下列判断正确的是( )
A.若已知变量x的方差,则可知变量y的标准差
B.若不给定其他信息,则也可得知变量x与变量y各自的平均值
C.若不给定其他信息,则也可得知变量x与变量y的相关系数
D.若已知变量x的标准差,则可知以y为自变量的回归模型的残差平方和
【答案】ABC
【分析】A 选项通过推导可得,若已知变量x的方差,即可求得,进而代入前式求得,故正确;B 选项可通过联立两个回归方程的截距公式解出样本均值和,故正确;C 选项利用回归斜率乘积与相关系数的关系,结合斜率符号确定,故正确;D 选项因残差平方和需要原始数据或更多统计量,仅靠x的标准差无法计算,故错误。
【详解】对于C,由所给公式得,且回归系数为负数,故相关系数,C正确.
对于A,设变量x与变量y的标准差分别为,,
,,
标准差,
变形可得,
将其代入到得,
整理得,将其代入到,
整理得,代入已知数据得,
即,若已知变量x的方差,即可求得,进而代入上式求得,A正确.
对于B,经验回归直线经过样本中心点,
代入两个回归方程得与,解得,,
故不给定其他信息也可得知变量x与变量y各自的平均值,B正确.
对于D,设以y为自变量的经验回归方程为(其中),
则变量x的残差平方和为
,
由于样本量n未知,故无法算出残差平方和的具体数值,D错误.
第二部分(非选择题 共92分)
三、填空题:本题共3小题,每小题5分,共15分。
12.某商家统计了某商品最近5个月销量,如表所示,若与线性相关,且经验回归方程为,
时间
1
2
3
4
5
销量万只
5
4.5
4
3.5
2.5
给出下列说法:
①由题中数据可知,变量与负相关
②当时,残差为
③可以预测当时销量约为万只
④经验回归方程中
其中正确的是__________(填序号).
【答案】①③④
【分析】根据表格中销量与时间的变化规律可判断①;利用表格分别求出销量与时间的平均数,得样本中心点,代入回归方程求出判断④;进而推得线性回归方程,再利用残差定义,计算判断②;利用线性回归方程赋值计算即可判断③.
【详解】由经验回归方程,可知回归直线的斜率,即变量与负相关,同时结合表格,可知销量随着的增大而减小,故①正确;
又由表格可得,,
因样本中心点在回归方程上,则得,故④正确;
则回归方程为,当时,,此时残差为,故②错误;
当时,代入回归方程可得,即可以预测当时销量约为万只,故③正确.
13.小坤统计了“喜欢学习数学”和“性别为男性”的关系,统计男,女同学分别为60,40名,在男生中随机抽取三名同学,其中喜欢数学的人数恰有一人的概率为,则男生中喜欢数学的人数(大于男生中不喜欢数学的人数)为_________经过计算,认为有的概率认为“喜欢学习数学”和“性别为男性”有关,则女同学中喜欢学习数学的人数的最大值为_________(精确到1)
0.05
0.025
0.01
0.005
0.001
k
3.841
5.024
6.635
7.879
10.828
【答案】 50 23
【分析】设男生中喜欢数学的人数为人,由超几何分布的概率公式计算即可,设女生中喜欢数学的人数为人,由独立性检验的原理中的公式计算求解即可.
【详解】由题意可知,男同学有人,设男生中喜欢数学的人数为人,则且.
在男生中随机抽取三名同学,其中喜欢数学的人数恰有一人的概率为,
故,整理可得,
因为且,解得.
设女生中喜欢数学的人数为人,
则
男生
女生
合计
喜欢数学
50
不喜欢数学
10
合计
60
40
100
经过计算,认为有的概率认为“喜欢学习数学”和“性别为男性”有关,
则,即,
解得,
故最大值为.
故答案为:50;23.
14.将某保护区分为面积大小相近的多个区域,用简单随机抽样的方法抽取其中个区域,统计这些区域内的某种水源指标和某植物分布的数量,得到样本,且其相关系数,记关于的线性回归公式为.经计算可知:,,,则______.
x
1
2
3
5
7
10
11
20
25
30
y
9.02
5.27
4.06
3.03
2.59
2.28
2.21
1.89
1.80
1.75
【答案】
【分析】利用相关系数与回归系数的关系,结合已知数据计算.需要先求出,再通过求出分子,最后代入公式得到.
【详解】因为,,所以.
由,
解得,所以.
故答案为:
四、解答题:本题共5小题,共77分。解答应写出文字说明、证明过程或演算步骤。
15.随着科技的发展,人工智能生成的虚拟角色正逐步取代传统的真人直播带货.某公司使用虚拟角色直播带货后销售金额逐步提升,根据该公司使用虚拟角色直播带货后18个月的销售金额的情况统计,得到一组样本数据,其中和分别表示月份编号和销售金额数量(单位:万元),并计算得, .
(1)求样本的相关系数(精确到0.01),并推断销售金额(单位:万元)和月份编号是否线性相关(当时,即可认为线性相关);
(2)已知这18个月中有10个月的销售金额高于平均数,从这18个月中随机抽取2个月的销售金额,记抽到销售金额高于平均数的月份数为,求随机变量的分布列.
附:相关系数.
【答案】(1),具有很强的正相关性
(2)
0
1
2
【分析】(1)由条件结合相关系数公式求出相关系数,根据相关系数性质判断结论;
(2)由条件确定的可能取值,再求取各值的概率,由此可得其分布列.
【详解】(1)样本的相关系数为:
由于相关系数,故销售金额(单位:万元)和月份编号具有很强的正相关性;
(2)由题意得:的可能取值为0,1,2,
18个月中有10个月的销售金额高于平均数,
所以,
,
,
所以的分布列为:
0
1
2
16.科研人员为研究白鼠在注射某种抗生素24小时后体内抗生素残留率与注射剂量之间的关系,测得一组实验数据如表:
剂量
1.0
2.0
3.0
4.0
5.0
6.0
7.0
8.0
残留率
0.07
0.12
0.18
0.25
0.28
0.30
0.35
0.45
(1)根据以上数据计算得样本相关系数,表明抗生素残留率与注射抗生素剂量的线性相关程度较高,请建立关于的经验回归方程;
(2)当数据对应的残差的绝对值时,称该数据为“正常数据”.现从这8个实验数据中随机抽取4个,用X表示抽到“正常数据”的个数,求的分布列及均值.
参考公式:经验回归方程中斜率和截距的最小二乘估计分别为:
,;参考数据:,.
【答案】(1)
(2)
X
0
1
2
3
4
均值为
【分析】(1)根据数据求出,根据公式即可求出答案;
(2)判断个数据中有多少个“正常数据”,再根据超几何分布公式即可列出分布列,利用期望公式即可求出均值.
【详解】(1)由表知,,
,
所以,
,
所以关于的经验回归方程为.
(2)由已知,
,
,
,
,
,
,
,
,
即有4组数据为“正常数据”,
所以X的可能取值为,
则,,
,,,
所以的分布列为:
X
0
1
2
3
4
P
故数学期望.
17.水体富营养化导致藻类大量繁殖,以2017年中国太湖蓝藻爆发为例:5月初监测发现湖体中蓝藻细胞密度为每升50万个,随着气温升高至25-30℃且氮磷营养盐浓度超标(总磷浓度达),蓝藻进入增长期.5月10日细胞密度增至每升200万个,5月15日突破每升800万个,5月20日达到每升3200万个,形成面积超150平方公里的绿色水华带.此次爆发导致湖区溶解氧骤降至以下,大量鱼类死亡,自来水厂被迫停产,所以对水资源的保护刻不容缓.现对某区域的藻类面积y(单位:平方公里)与时间x(单位:年)的关系,进行监测,得到如下数据:
x/年
1
2
3
4
5
6
7
y/平方公里
6
11
21
34
66
101
196
根据以上数据,绘制成如图所示的散点图:
观察散点图,两个变量不具有线性相关关系,现考虑用对数函数模型和指数函数模型分别对两个变量的关系进行拟合.
(1)根据散点图判断与(a,b,c,d均为常数)哪一个更适合作为藻类面积y(单位:平方公里)与时间x(单位:年)的关系的回归方程类型(给出判断即可,不必说明理由);
(2)根据(1)的判断结果及表中的数据,求出y关于x的回归方程.
参考数据:
62.14
1.54
2535
50.12
3.47
其中,
参考公式:对于一组数据,,…,其回归直线的斜率和截距的最小二乘估计公式分别为,.
【答案】(1)更适合;
(2).
【分析】(1)由散点图的递增趋势选择更适宜的模型;
(2)先根据所取模型进行线性变换,再代入公式求解回归模型.
【详解】(1)由散点图得,藻类面积随时间的增加其增长速度越来越快,
所以更适宜作为藻类面积y与时间x的关系的回归方程类型.
(2)由,两边同时取常用对数得,
设,,,则,
由,,
得,
则,
因此,即
,
所以y关于x的回归方程为.
18.中国民间传统文化丰富多彩,涵盖了生活的方方面面,从节庆习俗、民间艺术、传统技艺到宗教信仰和民间文学等.某文化公司在某地开展中国民间传统文化宣传活动,活动期间调查了参加活动的市民对中国民间传统文化的了解程度,前5天调查情况数据如下:
宣传天数
1
2
3
4
5
不了解的人数
108
100
92
80
70
(1)若对中国民间传统文化不了解的人数与宣传天数之间满足线性回归关系,求变量关于变量的回归方程;
(2)从前5天的调查表中随机抽取100份调查表,整理得如下列联表:
性别
对中国民间传统文化了解的程度
合计
了解
不了解
老年
40
10
50
青年
30
20
50
合计
70
30
100
(i)依据显著性水平进行独立性检验,能否认为是否了解中国民间传统文化与年龄有关?
(ii)按分层随机抽样的方式,在上述“了解”的调查表中,随机抽取7份调查表,再从这7份调查表中任意抽取3份,记为抽到的调查表来自青年调查表的份数,求的分布及期望.
附:回归方程中斜率和截距的最小二乘法公式分别为,,
独立性检验常用小概率值和相应的临界值:,
0.05
0.01
0.005
3.841
6.635
7.879
【答案】(1);
(2)(i)是否了解中国民间传统文化与年龄有关;
(ii)
0
1
2
3
.
【分析】(1)结合题干和最小二乘法求解回归方程即可;
(2)(i)计算独立性检验的统计量,对比题干显著水平做出判断;
(ii)根据分层抽样确定来自青年调查表的份数,列举随机变量的可能取值,求解对应概率,进而列出分布列并求解期望.
【详解】(1)根据题干可知,
,,,
,
,
,
,
所以关于的回归方程为:
(2)(i)假设:是否了解中国民间传统文化与年龄无关;
由题知显著性水平:,即;
统计量:
,
因为,故拒绝原假设,即是否了解中国民间传统文化与年龄有关;
(ii)按分层抽样抽取老年调查表4份,青年调查表3份,
,
.
所以的分布列为:
0
1
2
3
期望:
19.人工智能中的文生视频模型Sora(以下简称Sora),能够根据用户的文本提示创建最长60秒的逼真视频.为调查Sora的应用是否会对视频从业人员的数量产生影响,某学校研究小组随机抽取了150名视频从业人员进行调查,结果如下表所示.
Sora的应用情况
视频从业人员
合计
减少
未减少
应用
54
72
没有应用
42
合计
90
150
(1)根据所给数据完成题中表格,依据的独立性检验,判断Sora的应用与视频从业人员的减少有关?
(2)某公司视频部现有员工100人,公司拟开展Sora培训,分三轮进行,每位员工第一轮至第三轮培训达到“优秀”的概率分别为,,,每轮相互独立,有两轮及以上获得“优秀”的员工才能应用Sora.
①求员工经过培训能应用Sora的概率;
②已知开展Sora培训前,员工每人每年平均为公司创造利润6万元;开展Sora培训后,能应用Sora的员工每人每年平均为公司创造利润10万元;Sora培训平均每人每年成本为1万元.根据公司发展需要,计划先将视频部的部分员工随机调至其他部门,然后对剩余员工开展Sora培训,现要求培训后视频部的年利润不低于员工调整前的年利润,则视频部最多可以调多少人到其他部门?
附:其中.
0.010
0.005
0.001
6.635
7.879
10.828
【答案】(1)
Sora的应用情况
视频从业人员
合计
减少
未减少
应用
54
18
72
没有应用
36
42
78
合计
90
60
150
有的把握认为Sora的应用与视频从业人员的减少有关.
(2)(i)(ii)14人
【分析】(1)分析数据关系,完善列联表,提出零假设,计算,比较其与临界值大小,判断结论;
(2)(i)设“员工第i轮获得优秀”,“员工经过培训能应用Sora”,
结合互斥事件概率加法公式,独立事件概率乘法公式求结论;
(ii)设视频部调人至其他部门,为培训后视频部能应用Sora的人数,则,由条件列不等式可求结论.
【详解】(1)依题意,列联表如下:
Sora的应用情况
视频从业人员
合计
减少
未减少
应用
54
18
72
没有应用
36
42
78
合计
90
60
150
零假设:Sora的应用与视频从业人员的减少独立,Sora的应用前后视频从业人员无差异,
由列联表中数据得,.
根据小概率值的的独立性检验,推断不成立,
所以有的把握认为Sora的应用与视频从业人员的减少有关;
(2)(i)设"员工第i轮获得优秀",且相互独立.
设"员工经过培训能应用Sora",
则
故员工经过培训能应用Sora的概率是.
(ii)设视频部调人至其他部门,为培训后视频部能应用Sora的人数,
则,因此,
调整后视频部的年利润:(万元).
令,解得,又,所以.
因此,视频部最多可以调14人到其他部门.
2 / 20
1 / 20
学科网(北京)股份有限公司
$
第八章 成对数据的统计分析单元测试卷(提升版)
(考试时间:120分钟,分值:150分)
注意事项:
1.答卷前,考生务必将自己的姓名、准考证号填写在答题卡上。
2.回答选择题时,选出每小题答案后,用铅笔把答题卡上对应题目的答案标号涂黑。如需改动,用橡皮擦干净后,再选涂其他答案标号。回答非选择题时,将答案写在答题卡上。写在本试卷上无效。
3.考试结束后,将本试卷和答题卡一并交回。
第一部分(选择题 共58分)
一、选择题:本题共8小题,每小题5分,共40分。在每小题给出的四个选项中,只有一项是符合题目要求的。
1.下列说法错误的是( )
A.在做回归分析时,可以用决定系数刻画模型的回归效果,若越大,则说明模型拟合的效果越好
B.可以用相关系数r刻画两个变量的相关程度强弱,r值越大两个变量的相关程度越强
C.残差图中,残差点所在的水平带状区域越窄,则回归方程的预报精确度越高
D.某物理量的测量结果服从正态分布,越大,该物理量在一次测量中在的概率越小
2.已知变量和满足经验回归方程,且变量和之间的一组相关数据如下表所示,则下列说法错误的是( )
5
6
9
12
8
7
2.4
A. B.当时,
C.变量和呈负相关 D.该经验回归直线必过点
3.具有相关关系的变量x与y的一组样本数据如下,若已求得线性回归方程为,则去掉其中某对样本数据,样本相关系数r不会发生改变的是( )
(参考公式:相关系数
x
1
2
3
4
5
y
6
10
11
12
16
A. B. C. D.
4.为比较甲、乙两所学校学生的数学水平,采用简单随机抽样的方法抽取100名学生.通过测验得到如下的列联表:
单位:人
学校
数学成绩
合计
不优秀
优秀
甲
40
10
50
乙
30
20
50
合计
70
30
100
附:,其中.
0.1
0.05
0.01
0.005
0.001
2.706
3.841
6.635
7.879
10.828
下列结论正确的是( )
A.依据小概率值的独立性检验,认为两校学生的数学成绩优秀率无差异
B.依据小概率值的独立性检验,认为两校学生的数学成绩优秀率有差异
C.依据小概率值的独立性检验,认为两校学生的数学成绩优秀率有差异
D.依据小概率值的独立性检验,认为两校学生的数学成绩优秀率有差异
5.读万卷书,行万里路.随着我国教育模式由“应试教育”向“素质教育”转变,研学旅行作为一种传统而现代的素质教育手段被广泛关注.某校对“是否喜欢参加暑期研学旅行与学生性别的关系”进行了一次调查,其中被调查的男、女生人数相同,男生中喜欢参加暑期研学旅行的人数占男生人数的,女生中喜欢参加暑期研学旅行的人数占女生人数的.若有95%的把握认为是否喜欢参加暑期研学旅行与学生性别有关,则被调查的学生中,男生的人数不可能为( )
A.25 B.45 C.60 D.75
是否喜欢参加暑期研学旅行
性别
总计
男生
女生
喜欢
不喜欢
总计
6.现有10个样本数据,,…,,可得经验回归方程为,且,若去掉一个数据点后,可以得到新的经验回归方程为,则实数的值为( )
A.1 B. C. D.2
7.为考察两个变量x,y的相关性,搜集数据如表,则两个变量的线性相关程度( )
x
5
10
15
20
25
y
103
105
110
111
114
(参考数据:,,,≈15.8,≈9.01)
A.很强 B.很弱
C.无相关 D.不确定
8.用模型拟合一组数据,令,若根据样本数据计算可得,,且与的经验回归方程为,则( )(参考数据,)
A.1.2 B.0.92 C.0.3 D.0.4
二、选择题:本题共3小题,每小题6分,共18分.在每小题给出的选项中,有多项符合题目要求.全部选对的得6分,部分选对的得部分分,有选错的得0分.
9.下列命题中正确的是( )
A.决定系数越大,残差平方和越小,模型拟合效果越好
B.若回归方程为,则变量y与x成负相关
C.某校高三年级男生的身高(单位:cm)近似服从,随机选择一名该校高三年级的男生,则(若,则,)
D.样本相关系数的取值范围为,刻画了样本点集中于某条直线的程度,当时,只表明成对样本数据间没有线性相关关系
10.某医学研究团队为探究新型降压药的疗效与患者年龄的关联,将120名高血压患者按年龄分为“中青年组(<60岁)”和“老年组(岁)”,记录用药后的疗效(“有效”“无效”),得到如下列联表:
患者
疗效
总计
有效
无效
中青年组
10
40
50
老年组
40
30
70
总计
50
70
120
附:,其中.
0.10
0.05
0.025
0.01
2.706
3.841
5.024
6.635
则下列说法中正确的有( )
A.若在“老年组”中按疗效分层抽样抽取7人,再从这7人中随机抽取2人,则至少抽到1名“无效”患者的概率为
B.从所有患者中随机抽取1人,设事件“该人在中青年组”,事件“该药对此人有效”,则事件A与B相互独立
C.根据小概率值的独立性检验,认为“降压药疗效与患者年龄有关”,且该推断犯错误的概率不超过
D.若将列联表中“中青年组有效”的人数改为15,“中青年组无效”的人数改为35,则所得值比原值大
11.已知相关系数,y关于x的经验回归方程中斜率和截距的最小二乘估计公式分别为,,残差平方和为.已知变量x与变量y的部分数据,建立由最小二乘法得到的两个回归模型:以x为自变量,y为因变量,得出的经验回归方程为;以y为自变量,x为因变量,得出的经验回归方程为.若两个模型的计算均无误,则下列判断正确的是( )
A.若已知变量x的方差,则可知变量y的标准差
B.若不给定其他信息,则也可得知变量x与变量y各自的平均值
C.若不给定其他信息,则也可得知变量x与变量y的相关系数
D.若已知变量x的标准差,则可知以y为自变量的回归模型的残差平方和
第二部分(非选择题 共92分)
三、填空题:本题共3小题,每小题5分,共15分。
12.某商家统计了某商品最近5个月销量,如表所示,若与线性相关,且经验回归方程为,
时间
1
2
3
4
5
销量万只
5
4.5
4
3.5
2.5
给出下列说法:
①由题中数据可知,变量与负相关
②当时,残差为
③可以预测当时销量约为万只
④经验回归方程中
其中正确的是__________(填序号).
13.小坤统计了“喜欢学习数学”和“性别为男性”的关系,统计男,女同学分别为60,40名,在男生中随机抽取三名同学,其中喜欢数学的人数恰有一人的概率为,则男生中喜欢数学的人数(大于男生中不喜欢数学的人数)为_________经过计算,认为有的概率认为“喜欢学习数学”和“性别为男性”有关,则女同学中喜欢学习数学的人数的最大值为_________(精确到1)
0.05
0.025
0.01
0.005
0.001
k
3.841
5.024
6.635
7.879
10.828
14.将某保护区分为面积大小相近的多个区域,用简单随机抽样的方法抽取其中个区域,统计这些区域内的某种水源指标和某植物分布的数量,得到样本,且其相关系数,记关于的线性回归公式为.经计算可知:,,,则______.
x
1
2
3
5
7
10
11
20
25
30
y
9.02
5.27
4.06
3.03
2.59
2.28
2.21
1.89
1.80
1.75
四、解答题:本题共5小题,共77分。解答应写出文字说明、证明过程或演算步骤。
15.随着科技的发展,人工智能生成的虚拟角色正逐步取代传统的真人直播带货.某公司使用虚拟角色直播带货后销售金额逐步提升,根据该公司使用虚拟角色直播带货后18个月的销售金额的情况统计,得到一组样本数据,其中和分别表示月份编号和销售金额数量(单位:万元),并计算得, .
(1)求样本的相关系数(精确到0.01),并推断销售金额(单位:万元)和月份编号是否线性相关(当时,即可认为线性相关);
(2)已知这18个月中有10个月的销售金额高于平均数,从这18个月中随机抽取2个月的销售金额,记抽到销售金额高于平均数的月份数为,求随机变量的分布列.
附:相关系数.
16.科研人员为研究白鼠在注射某种抗生素24小时后体内抗生素残留率与注射剂量之间的关系,测得一组实验数据如表:
剂量
1.0
2.0
3.0
4.0
5.0
6.0
7.0
8.0
残留率
0.07
0.12
0.18
0.25
0.28
0.30
0.35
0.45
(1)根据以上数据计算得样本相关系数,表明抗生素残留率与注射抗生素剂量的线性相关程度较高,请建立关于的经验回归方程;
(2)当数据对应的残差的绝对值时,称该数据为“正常数据”.现从这8个实验数据中随机抽取4个,用X表示抽到“正常数据”的个数,求的分布列及均值.
参考公式:经验回归方程中斜率和截距的最小二乘估计分别为:
,;参考数据:,.
17.水体富营养化导致藻类大量繁殖,以2017年中国太湖蓝藻爆发为例:5月初监测发现湖体中蓝藻细胞密度为每升50万个,随着气温升高至25-30℃且氮磷营养盐浓度超标(总磷浓度达),蓝藻进入增长期.5月10日细胞密度增至每升200万个,5月15日突破每升800万个,5月20日达到每升3200万个,形成面积超150平方公里的绿色水华带.此次爆发导致湖区溶解氧骤降至以下,大量鱼类死亡,自来水厂被迫停产,所以对水资源的保护刻不容缓.现对某区域的藻类面积y(单位:平方公里)与时间x(单位:年)的关系,进行监测,得到如下数据:
x/年
1
2
3
4
5
6
7
y/平方公里
6
11
21
34
66
101
196
根据以上数据,绘制成如图所示的散点图:
观察散点图,两个变量不具有线性相关关系,现考虑用对数函数模型和指数函数模型分别对两个变量的关系进行拟合.
(1)根据散点图判断与(a,b,c,d均为常数)哪一个更适合作为藻类面积y(单位:平方公里)与时间x(单位:年)的关系的回归方程类型(给出判断即可,不必说明理由);
(2)根据(1)的判断结果及表中的数据,求出y关于x的回归方程.
参考数据:
62.14
1.54
2535
50.12
3.47
其中,
参考公式:对于一组数据,,…,其回归直线的斜率和截距的最小二乘估计公式分别为,.
18.中国民间传统文化丰富多彩,涵盖了生活的方方面面,从节庆习俗、民间艺术、传统技艺到宗教信仰和民间文学等.某文化公司在某地开展中国民间传统文化宣传活动,活动期间调查了参加活动的市民对中国民间传统文化的了解程度,前5天调查情况数据如下:
宣传天数
1
2
3
4
5
不了解的人数
108
100
92
80
70
(1)若对中国民间传统文化不了解的人数与宣传天数之间满足线性回归关系,求变量关于变量的回归方程;
(2)从前5天的调查表中随机抽取100份调查表,整理得如下列联表:
性别
对中国民间传统文化了解的程度
合计
了解
不了解
老年
40
10
50
青年
30
20
50
合计
70
30
100
(i)依据显著性水平进行独立性检验,能否认为是否了解中国民间传统文化与年龄有关?
(ii)按分层随机抽样的方式,在上述“了解”的调查表中,随机抽取7份调查表,再从这7份调查表中任意抽取3份,记为抽到的调查表来自青年调查表的份数,求的分布及期望.
附:回归方程中斜率和截距的最小二乘法公式分别为,,
独立性检验常用小概率值和相应的临界值:,
0.05
0.01
0.005
3.841
6.635
7.879
19.人工智能中的文生视频模型Sora(以下简称Sora),能够根据用户的文本提示创建最长60秒的逼真视频.为调查Sora的应用是否会对视频从业人员的数量产生影响,某学校研究小组随机抽取了150名视频从业人员进行调查,结果如下表所示.
Sora的应用情况
视频从业人员
合计
减少
未减少
应用
54
72
没有应用
42
合计
90
150
(1)根据所给数据完成题中表格,依据的独立性检验,判断Sora的应用与视频从业人员的减少有关?
(2)某公司视频部现有员工100人,公司拟开展Sora培训,分三轮进行,每位员工第一轮至第三轮培训达到“优秀”的概率分别为,,,每轮相互独立,有两轮及以上获得“优秀”的员工才能应用Sora.
①求员工经过培训能应用Sora的概率;
②已知开展Sora培训前,员工每人每年平均为公司创造利润6万元;开展Sora培训后,能应用Sora的员工每人每年平均为公司创造利润10万元;Sora培训平均每人每年成本为1万元.根据公司发展需要,计划先将视频部的部分员工随机调至其他部门,然后对剩余员工开展Sora培训,现要求培训后视频部的年利润不低于员工调整前的年利润,则视频部最多可以调多少人到其他部门?
附:其中.
0.010
0.005
0.001
6.635
7.879
10.828
2 / 20
1 / 20
学科网(北京)股份有限公司
$