内容正文:
专题22 统计与成对数据的统计分析
题型01 随机抽样
1.(2026·上海金山·二模)为了了解申辉中学所有学生的每天平均体育运动时间,随机调查了该校100名学生,发现他们每天平均体育运动时间为h.这里的总体是( )
A.该校所有学生 B.该校所有学生的每天平均体育运动时间
C.所调查的100名学生 D.所调查的100名学生的每天平均体育运动时间
2.(2026·湖北·模拟预测)某科研数据库包含5000个海水样本,其中一半来自中层海域,若按分层抽样抽取200个样本进行分析,则应抽取中层海域的样本数为( )
A.50 B.100 C.200 D.250
3.(25-26高三下·青海西宁·月考)某校高三年级有男生490人,女生510人,张华按男生、女生进行分层,按比例分配的分层随机抽样的方法,抽取100人测量身高,则抽取的男生人数为______.
4.(2026·重庆·一模)某地区有高中教师300人,初中教师800人,小学教师1100人,为调查某次教师培训的成效,采用分层抽样的方法从这些教师中抽取一个容量为44的样本进行访问,则小学教师应抽取( )
A.6人 B.16人 C.22人 D.28人
题型02 统计图表
5.(2026·甘肃兰州·一模)(多选)某校高一年级开设了文学社、科创社、体育社、艺术社、辩论社五类社团,每名同学最多参加一个社团,对参加社团活动的情况进行统计调查,统计信息如图(1),(2),其中参加体育社和艺术社的人数相等,为了解社团活动开展情况,采用分层抽样的方法在参加社团活动的学生中任意抽取20名学生做问卷调查.
根据以上信息,下列说法正确的是( )
A.艺术社的学生人数有120人
B.文学社和辩论社参加问卷调查的学生人数共有5人
C.从参加社团的学生中任选1人,已知该学生不是文学社成员,则该学生是科创社成员的概率为
D.调查结果显示文学社、科创社的满意率均为0.7,其他社团的满意率均为0.9,则社团活动总体满意率为0.81
6.(25-26高三下·贵州遵义·月考)中国营养学会把走路称为“最简单、最优良的锻炼方式”,它不仅可以帮助减肥,还可以增强心肺功能、血管弹性、肌肉力量等.如图为甲、乙两人在同一星期内每日步数的折线统计图,则下列结论中正确的是( )
A.这一星期内乙的每日步数的中位数为12970
B.甲的每日步数星期三比星期二增加了1倍以上
C.这一星期内甲的每日步数的平均值大于乙
D.这一星期内甲的每日步数的极差小于乙
7.(2026·辽宁抚顺·一模)(多选)年我国粮食产量(单位:万吨)如图所示,下列结论正确的是( )
A.年我国粮食产量逐年增加
B.年我国粮食产量的中位数为万吨
C.年我国粮食产量的极差为万吨
D.年我国粮食产量与年份负相关
8.(2026·内蒙古包头·二模)为了了解学生的基本情况,某学校对一次高三质量预测数学考试成绩进行汇总(所有学生的数学成绩都不低于30分),整理后得到如下图所示的频率分布直方图:
(1)求频率分布直方图中的值,并估计该校学生数学成绩的第70百分位数;
(2)若该校高三学生共有1200人,从中依据按比例分配分层抽样的方法从等级分数介于80至100之间的学生中抽出8人,再从这8人中选出3人,记为3人中分数在的人数,求的分布列和数学期望.
9.(2026·云南玉溪·二模)为调查社区居民对社区工作的满意度,在社区内抽取名居民进行问卷调查,将收集到的数据分成五组,绘制出如下频率分布直方图,若的频率为,的值为( )
A., B., C., D.,
10.(2026·四川眉山·二模)(多选)为评估某款“端侧AI芯片”在不同模型架构下的推理延迟表现,研发团队在固定输入长度(128tokens)的条件下,对200个公开的深度学习模型进行了单次推理延迟测试(单位:).测试结果经异常值剔除后,得到如图所示的频率分布直方图,其中分组区间为,,,,,则下列结论正确的是( )
A.样本中延迟在内的模型个数为60
B.估计样本的中位数落在区间内
C.估计样本的平均数约为22.5
D.该分布呈现出右边“拖尾”形态,说明大部分模型的延迟较低
题型03 平均数、方差、百分位数
11.(2026·河北保定·二模)(多选)已知平均数和方差分别是和,设一组数据
的平均数和方差分别是和,另一组数据的平均数和方差分别是和,则下列说法正确的是( )
A. B.
C.若,则 D.若且,则
12.(2026·湖北孝感·二模)已知数列是各项均为正数的等差数列,且公差;数列是各项均为正数的等比数列,且公比,若项数均为项,下列说法正确的个数是( )
①数据,,,…,的平均数是;
②数据,,,…,的平均数是;
③若,,则数据,,,…,的中位数大于数据,,,…,的中位数;
④若,,则数据,,,…,的平均数大于数据,,,…,的平均数.
A.1 B.2 C.3 D.4
13.(2026·广东惠州·二模)(多选)下列命题正确的是( )
A.数据4,4,4,6,6,7,8,8的众数是4
B.数据7,9,12,15,9,14,18的极差是11
C.数据2,3,3,5,7,8,9的第分位数是6
D.数据的平均数为2,方差为4,则数据,的平均数为5,方差为16
14.(2026·云南昆明·二模)(多选)已知一组数据由6个正整数构成,且同时满足以下条件:①平均数为10;②中位数为9;③8是唯一的众数;④极差为12,则这组数据( )
A.必含有9 B.恰含有2个8
C.方差是定值 D.第25百分位数为8
15.(2026·广西北海·一模)(多选)已知一组数据依次为:12,16,16,4,0,2,2,10,12,16,关于这一组数据,下列说法正确的是( )
A.极差是16 B.平均数是9
C.第70百分位数是12 D.方差是270
16.(2026高三下·内蒙古鄂尔多斯·专题练习)某AI公司有男性30人,女性10人,在一次知识竞技团建中,男性平均成绩为110分,方差为55,女性平均成绩为130分,方差为95,则在这次团建中,该公司的平均成绩和方差分别为( )
A.120分,75 B.120分,20 C.115分,65 D.115分,140
题型04 回归分析
17.(2026高三下·山东青岛·专题练习)已知线性相关的两个变量,的取值如表所示,如果其线性回归方程为,那么当时的残差为( )
3
4
6
7
20
40
60
A.2 B. C.3 D.
18.(2026·辽宁大连·一模)(多选)某人工智能公司从某年起连续7年的利润情况如下表所示:
第x年
1
2
3
4
5
6
7
利润y/亿元
2.9
3.3
3.6
4.4
4.8
5.2
5.9
根据表中的数据得到y关于x的回归直线方程,则( )
A.y与x之间的相关系数
B.回归系数的意义是x增大一个单位,增大0.5个单位
C.第8年的利润一定为6.3亿元
D.第6年利润的残差为亿元
19.(2026·安徽铜陵·模拟预测)已知变量和有较强的线性相关关系,根据下表中两个变量间的相关数据可以得到经验回归方程为,则( )
A.经验回归直线必过点
B.
C.当时,预测值
D.当时,样本点对应的残差为
20.(2026·湖南怀化·一模)我国新能源汽车迅速崛起,成为推动绿色革命的核心引擎.某品牌新能源汽车公司为了抢占更多的市场份额,计划加大广告投入.该公司近5年的年广告费(单位:百万元)和年销售量(单位:百万辆)关系如图所示:
令,数据经过初步处理得:.现有①和②两种模型作为年销售量关于年广告费的回归分析模型,其中均为常数.
(1)请从样本相关系数的角度,分析哪一个模型拟合程度更好?
(2)为刺激消费,省出台了以下补贴政策:每购买一辆新能源汽车,补贴6000元.若甲、乙两人近期在省购买一辆该新能源汽车的概率分别为,其中,每人最多购买一辆.求该省对甲、乙两人补贴总金额的期望值的取值范围.
参考数据:.
相关系数.
21.(2026·江苏南京·一模)为研究昼夜温差(单位:)与某植物种子当日的百粒发芽数(单位:粒)之间的关系,实验室记录了6天的每日昼夜温差与种子当日的百粒发芽数,如下表所示:
日期编号
1
2
3
4
5
6
温差
9
13
11
15
10
14
百粒发芽数
23
28
26
31
25
29
(1)根据表中的数据,计算样本相关系数(精确到0.01);
(2)求百粒发芽数关于温差的经验回归方程,并估计昼夜温差为时,这种植物种子当日的百粒发芽数.
参考公式:相关系数,
,,
参考数据:,,,.
22.(2026高三·全国·专题练习)水体富营养化导致藻类大量繁殖,以2017年中国太湖蓝藻爆发为例:5月初监测发现湖体中蓝藻细胞密度为每升50万个,随着气温升高至25-30℃且氮磷营养盐浓度超标(总磷浓度达),蓝藻进入增长期.5月10日细胞密度增至每升200万个,5月15日突破每升800万个,5月20日达到每升3200万个,形成面积超150平方公里的绿色水华带.此次爆发导致湖区溶解氧骤降至以下,大量鱼类死亡,自来水厂被迫停产,所以对水资源的保护刻不容缓.现对某区域的藻类面积y(单位:平方公里)与时间x(单位:年)的关系,进行监测,得到如下数据:
x/年
1
2
3
4
5
6
7
y/平方公里
6
11
21
34
66
101
196
根据以上数据,绘制成如图所示的散点图:
观察散点图,两个变量不具有线性相关关系,现考虑用对数函数模型和指数函数模型分别对两个变量的关系进行拟合.
(1)根据散点图判断与(a,b,c,d均为常数)哪一个更适合作为藻类面积y(单位:平方公里)与时间x(单位:年)的关系的回归方程类型(给出判断即可,不必说明理由);
(2)根据(1)的判断结果及表中的数据,求出y关于x的回归方程.
参考数据:
62.14
1.54
2535
50.12
3.47
其中,
参考公式:对于一组数据,,…,其回归直线的斜率和截距的最小二乘估计公式分别为,.
23.(2026·江西·一模)随着科技的发展,人工智能生成的虚拟角色正逐步取代传统的真人直播带货.某公司使用虚拟角色直播带货后销售金额逐步提升,根据该公司使用虚拟角色直播带货后18个月的销售金额的情况统计,得到一组样本数据,其中和分别表示月份编号和销售金额数量(单位:万元),并计算得, .
(1)求样本的相关系数(精确到0.01),并推断销售金额(单位:万元)和月份编号是否线性相关(当时,即可认为线性相关);
(2)已知这18个月中有10个月的销售金额高于平均数,从这18个月中随机抽取2个月的销售金额,记抽到销售金额高于平均数的月份数为,求随机变量的分布列.
附:相关系数.
题型05 独立性检验
24.(2026·上海·二模)某工厂为判断两种不同的操作方法是否对生产某种零件的合格个数有影响,收集了相关数据,绘制了列联表,设原假设:两种不同的操作方法对生产该种零件的合格个数没有影响,计算出统计量,已知,则在显著性水平下,推断的结论为________.(用“拒绝”或“接受”填空)
25.(2026·天津·一模)近年中国新能源汽车进入高速发展时期,为了了解消费者的购车类型与地域是否具有相关性,某品牌汽车商随机调查了甲、乙两地各200名消费者,并用等高堆积条形图直观地展示调查结果如下图所示,经计算得到.
车型与地区
下表是独立性检验中几个常用的小概率值和相应的临界值.
0.05
0.01
0.005
0.001
3.841
6.635
7.879
10.828
下列说法正确的是( )
A.在所调查的甲地购车者中,若按比例分层随机抽样抽取20人,则新能源车主有8人
B.在所调查的乙地购车者中,购买燃油车的人数比新能源车的多20人
C.依据的独立性检验,即消费者的购车类型与地域有关联,此推断犯错误的概率不大于0.001
D.依据的独立性检验,即消费者的购车类型与地域无关联,此推断犯错误的概率不大于0.001
26.(2026·湖北荆州·一模)(多选)某校为了了解本校学生在寒假期间参加社会实践活动的情况,随机调查了100名学生,得到如下列联表(单位:人):( )
男生
女生
合计
参加了社会实践活动
30
40
70
未参加社会实践活动
20
10
30
合计
50
50
100
附,其中n=a+b+c+d;
A.依据小概率值的独立性检验,认为学生是否参加社会实践活动与性别无关
B.从男生中随机抽取1人,其参加了社会实践活动的概率为
C.随机抽取1人,若抽取到的是参加了社会实践的学生,则这名学生是男生的概率为
D.按性别用分层抽样的方法从参加社会实践活动的学生中抽取7人,再从这7人中抽取2人,则这2人中至少有一名男生的概率为
27.(2026高三·全国·专题练习)为了了解疾病是否与性别有关,在某医院随机地对入院的50人进行了问卷调查,得到了如下的列联表:则认为疾病与性别有关的把握约为( )
患疾病
不患疾病
总计
男
20
5
25
女
10
15
25
总计
30
20
50
0.05
0.01
0.005
0.001
3.841
6.635
7.879
10.828
A. B. C. D.
28.(2026·重庆沙坪坝·模拟预测)重庆城市足球超级联赛(简称 “渝超”)引发了广泛关注. 某地区随机抽取了部分市民,调查他们对赛事的关注情况, 得到如下表格:
性别
不关注赛事
关注赛事
男性
女性
(1)根据小概率值 的独立性检验,能否认为关注 “渝超” 赛事与性别有关?
(2)现从被调查的关注赛事的市民中,按照性别比例采用分层抽样的方法随机抽取 3 名市民参加 “渝超” 赛事知识问答. 已知男性、女性市民顺利完成知识问答的概率分别为 , 每个人是否顺利完成相互独立.求3人中顺利完成知识问答的总人数的分布列及其期望.
附:.
29.(24-25高三下·山东德州·开学考试)人工智能中的文生视频模型Sora(以下简称Sora),能够根据用户的文本提示创建最长60秒的逼真视频.为调查Sora的应用是否会对视频从业人员的数量产生影响,某学校研究小组随机抽取了150名视频从业人员进行调查,结果如下表所示.
Sora的应用情况
视频从业人员
合计
减少
未减少
应用
54
72
没有应用
42
合计
90
150
(1)根据所给数据完成题中表格,依据的独立性检验,判断Sora的应用与视频从业人员的减少有关?
(2)某公司视频部现有员工100人,公司拟开展Sora培训,分三轮进行,每位员工第一轮至第三轮培训达到“优秀”的概率分别为,,,每轮相互独立,有两轮及以上获得“优秀”的员工才能应用Sora.
①求员工经过培训能应用Sora的概率;
②已知开展Sora培训前,员工每人每年平均为公司创造利润6万元;开展Sora培训后,能应用Sora的员工每人每年平均为公司创造利润10万元;Sora培训平均每人每年成本为1万元.根据公司发展需要,计划先将视频部的部分员工随机调至其他部门,然后对剩余员工开展Sora培训,现要求培训后视频部的年利润不低于员工调整前的年利润,则视频部最多可以调多少人到其他部门?
附:其中.
0.010
0.005
0.001
6.635
7.879
10.828
30.(25-26高三上·河北沧州·月考)为了探究职场人士每季度进行职业技能培训的时长(单位:小时)和他们的季度绩效评分(单位:分)的关系,某调研机构开展了调查,得到如下数据:
3
6
9
12
15
70
80
84
96
100
(1)若该组数据中与之间的关系可用线性回归模型进行拟合,求关于的经验回归方程;
(2)基于上述调查,某企业推行员工职业技能培训计划,经过一个季度的实施后,抽样调查了200位员工,按照参与职业技能培训与季度绩效提升情况得到如下列联表,请将表格补充完整,并依据的独立性检验,分析“参与职业技能培训与绩效提升”是否有关.
单位:人
绩效未提升
绩效提升
合计
参与职业技能培训
100
150
未参与职业技能培训
30
合计
参考公式:经验回归方程中斜率和截距的最小二乘估计公式分别为,,
其中.
0.1
0.05
0.01
0.005
0.001
2.706
3.841
6.635
7.879
10.828
强化训练
1.(2026·宁夏银川·二模)一组互不相等的数据从小到大排列为,去掉后,则下列选项正确的是( )
A.极差变大 B.平均数变大
C.中位数变小 D.分位数变小
2.(2026·云南曲靖·一模)一个盒子中装有大小相同、质地均匀的6个小球,这6个小球分别标有编号1,2,3,4,5,6,现从盒中有放回地任取一个球并记下编号,共取4次,得到一组编号组成的数据,若该组数据的平均数为2,则( )
A.中位数可能为3 B.众数可能为4
C.极差可能为5 D.方差可能为1
3.(2026高三·全国·专题练习)某高中2024年的高考考生人数是2023年高考考生人数的1.5倍.为了更好地对比该校考生的升学情况,统计了该校2023年和2024年高考分数达线情况,得到如图所示扇形统计图:
下列结论正确的是( )
A.该校2024年与2023年的本科达线人数比为6:5
B.该校2024年与2023年的专科达线人数比为6:7
C.2024年该校本科达线人数增加了80%
D.2024年该校不上线的人数有所减少
4.(2026·河北·一模)为了给顾客提供更好的服务,某饭店对2025年的营业情况进行了盘点,发现顾客平均每次的消费金额(单位:元)都在内,整理统计数据得到如图所示的频率分布直方图,则下列结论中正确的是( )
A.
B.顾客平均每次的消费金额的中位数小于元
C.顾客平均每次的消费金额的极差介于元至 元之间
D.顾客平均每次的消费金额的平均数为 元
5.(2026·天津河西·一模)下列说法中错误的有( )
①回归直线恒过点,且至少过一个样本点;
②根据列联表中的数据计算得出,而,则“两个分类变量有关联”此推断犯错误的概率不大于0.01;
③回归分析时,可以用决定系数刻画模型的回归效果,越大,则拟合的效果越好;
④若随机变量服从正态分布,若则实数
A.1个 B.2个 C.3个 D.4个
6.(25-26高三下·重庆·月考)具有相关关系的变量x与y的一组样本数据如下,若已求得线性回归方程为,则去掉其中某对样本数据,样本相关系数r不会发生改变的是( )
(参考公式:相关系数
x
1
2
3
4
5
y
6
10
11
12
16
A. B. C. D.
7.(25-26高三上·江西南昌·期末)(多选)下列说法正确的是( )
A.样本甲中有件样品,其方差为,样本乙中有件样品,其方差为,则由甲,乙组成的总体样本的方差为
B.一组数据,,,,的经验回归方程为,则当时,残差为
C.一组数据,,,的均值为,标准差为s,则数据,,…,的均值为
D.按从小到大排序的两组数据:甲组数据为;乙组数据为,.则甲组数据的第30百分位数和乙组数据的第40百分位数之和为75
8.(2026高三·全国·专题练习)(多选)为了解阅读量多少与幸福感强弱之间的关系,一个调查机构根据所得到的数据,绘制了如下的列联表(个别数据暂用字母表示):
阅读情况
幸福感强弱
幸福感强
幸福感弱
总计
阅读量多
18
72
阅读量少
36
78
总计
90
60
150
计算得,则下面的选项正确的为( )
A.有99%的把握认为“阅读量多少与幸福感强弱无关”
B.
C.有99%的把握认为“阅读量多少与幸福感强弱有关”
D.
9.(2026·四川成都·二模)(多选)已知数据的平均数为M,中位数为N,方差为P,极差为Q,设,得到新数据,则对于所得新数据,下列说法一定正确的是( )
A.平均数是3M B.中位数是
C.方差是9P D.极差是
10.(2026·山西运城·二模)(多选)已知一组数据由5个正整数组成,且这组数据中至少有1个8,则关于这组数据的描述可能是( )
A.中位数为3且平均数为5 B.平均数为4且众数为4
C.平均数为4且方差为3.2 D.中位数为5且方差不小于7.2
11.(2026·湖北随州·一模)某车间为了规定工时定额,需要确定加工零件所花费的时间,为此进行了5次试验.得到数据如下表:
零件个数x
10
20
30
40
50
加工时间y(min)
53
65
71
76
85
根据上表可得经验回归方程中的,则经验回归方程中___________;据此估计,加工的零件个数为60时所花费的时间为__________min.
12.(25-26高三下·安徽滁州·开学考试)考察棉花种子经过处理与是否生病之间的关系得到如下表所示的数据:
经处理的种子数粒
未经处理的种子数粒
合计粒
得病
不得病
合计
根据以上数据,则统计量的观测值是__________.
13.(2026·西藏拉萨·二模)某公司的生产车间有3台核心加工设备,分别为成型机(记为设备A)、调试机(记为设备B)、测试机(记为设备C),三台设备各自独立工作,设同时发生故障的设备数为随机变量.
(1)若三台设备同时运行,每台设备发生故障的概率均为,求“至少有1台设备发生故障的条件下,恰好有1台设备发生故障”的概率;(结果保留三位有效数字)
(2)为验证设备A与设备B的工作独立性,该公司随机抽取了次设备运行记录,得到如下列联表(单位:次):
设备A
设备B
合计
故障
正常
故障
30
70
100
正常
60
40
100
合计
90
110
200
根据小概率值的独立性检验,分析设备A的故障与设备B的故障是否有关.
附:,
14.(2026·上海静安·二模)下表是某品牌净化器的年销售量与年份的统计表.
年份
2021
2022
2023
2024
2025
年份代码x
1
2
3
4
5
年销售量у(万台)
2
3.5
2.5
8
9
(1)用计算器计算净化器的年销售量y关于年份代码x的线性回归方程;(回归系数计算结果保留两位小数)
(2)为了调查A、B两地区人群对该品牌净化器的了解情况,调查机构在A、B两地区的人群中分别进行品牌知晓情况的问卷调查.统计知晓与不知晓的人数,得到如下2×2列联表.
知晓
不知晓
合计
A地区
80
20
100
B地区
40
60
100
合计
120
80
200
试根据表中数据判断A、B两地区的人群对该品牌净化器的知晓情况是否有显著差异.(规定显著水平)
附:关于回归方程,回归系数的计算公式,其中为样本点的中心;的计算公式;
0.05
0.01
0.001
k
3.841
6.635
10.828
15.(2026·河北沧州·二模)某新能源汽车4S店在某平台开启了直播销售,星期一至星期五的五个工作日内,直播时长x(小时)与直播时在线观看人数y(百人)如下表:
星期
一
二
三
四
五
直播时长x(小时)
2
5
6
4
8
直播时在线观看人数y(百人)
4
8
9
7
16
附:样本相关系数
经验回归方程中斜率和截距的最小二乘法估计公式分别为:,,,,.
(1)试根据样本相关系数r的值判断该直播的在线观看人数y(百人)与直播时长x(小时)的线性相关性的强弱(若,则认为y与x的线性相关性较强;若,则认为y与x的线性相关性较弱).
(2)利用最小二乘法求出y关于x的经验回归方程,并预测直播时长为10小时时的在线观看人数.
16.(2026·广东佛山·二模)近年我国人工智能大模型发展迅猛,其中语言模型(处理、理解和生成人类语言)和多模态模型(处理、理解和生成文本、图像、音视频等)是其中两个重要的领域,某研究机构对2025年某区域的企业发布的所有大模型中随机抽取了14款进行标准化测试,由测试数据得到下面的散点图:
(1)用频率估计概率,根据2025年该区域的企业发布大模型的分布情况,估计该区域2026发布的大模型是多模态模型的概率;
(2)若t为时间变量,y为分数,根据多模态模型数据(,2,3,4,5,6,表示2025年1月份,表示2025年6月份,…),计算得,,.
(i)建立y关于t的线性回归方程;
(ii)根据语言模型的数据建立的回归方程为,该区域的某家企业在2026年4月发布了1款标准化测试得分为68分的大模型,定义统计量,Q值越小的大模型发生的可能性越大,则该款大模型更有可能是语言模型还是多模态模型,并说明理由.
附:回归直线的斜率和截距的最小二乘估计公式分别为,,.
2 / 8
1 / 8
学科网(北京)股份有限公司
$
专题22 统计与成对数据的统计分析
题型01 随机抽样
1.(2026·上海金山·二模)为了了解申辉中学所有学生的每天平均体育运动时间,随机调查了该校100名学生,发现他们每天平均体育运动时间为h.这里的总体是( )
A.该校所有学生 B.该校所有学生的每天平均体育运动时间
C.所调查的100名学生 D.所调查的100名学生的每天平均体育运动时间
【答案】B
【详解】根据总体的概念可得,这里的总体是该校所有学生的每天平均体育运动时间.故选项B正确.
2.(2026·湖北·模拟预测)某科研数据库包含5000个海水样本,其中一半来自中层海域,若按分层抽样抽取200个样本进行分析,则应抽取中层海域的样本数为( )
A.50 B.100 C.200 D.250
【答案】B
【详解】由题意,样本中应抽取中层海域的样本数为个.
3.(25-26高三下·青海西宁·月考)某校高三年级有男生490人,女生510人,张华按男生、女生进行分层,按比例分配的分层随机抽样的方法,抽取100人测量身高,则抽取的男生人数为______.
【答案】49
【分析】先算抽样比,再求男生抽取人数.
【详解】总人数:,所以抽样比:,
所以抽取的男生人数为.
4.(2026·重庆·一模)某地区有高中教师300人,初中教师800人,小学教师1100人,为调查某次教师培训的成效,采用分层抽样的方法从这些教师中抽取一个容量为44的样本进行访问,则小学教师应抽取( )
A.6人 B.16人 C.22人 D.28人
【答案】C
【分析】由抽样比即可计算求解.
【详解】由题可得抽样比为.
所以小学教师应抽取人.
故选:C
题型02 统计图表
5.(2026·甘肃兰州·一模)(多选)某校高一年级开设了文学社、科创社、体育社、艺术社、辩论社五类社团,每名同学最多参加一个社团,对参加社团活动的情况进行统计调查,统计信息如图(1),(2),其中参加体育社和艺术社的人数相等,为了解社团活动开展情况,采用分层抽样的方法在参加社团活动的学生中任意抽取20名学生做问卷调查.
根据以上信息,下列说法正确的是( )
A.艺术社的学生人数有120人
B.文学社和辩论社参加问卷调查的学生人数共有5人
C.从参加社团的学生中任选1人,已知该学生不是文学社成员,则该学生是科创社成员的概率为
D.调查结果显示文学社、科创社的满意率均为0.7,其他社团的满意率均为0.9,则社团活动总体满意率为0.81
【答案】ABD
【详解】对于A,因为文学社有60人占比为,所以五类社团总人数为人,
辩论社有90人,占比应为,所以体育社和艺术社共占比为,
又因为体育社和艺术社的人数相等,所以两社团分别占比为,
可知艺术社的学生人数有人,即A正确;
对于B,文学社和辩论社共人,分层抽样比为,
因此文学社和辩论社参加问卷调查的学生人数共有人,即B正确;
对于C,根据已有分析可知该学生不是文学社成员的概率为,又因为是科创社成员的概率为,
因此在该学生不是文学社成员的条件下,该学生是科创社成员的概率为,即C错误;
对于D,依题意可知社团活动总体满意率为,即D正确.
6.(25-26高三下·贵州遵义·月考)中国营养学会把走路称为“最简单、最优良的锻炼方式”,它不仅可以帮助减肥,还可以增强心肺功能、血管弹性、肌肉力量等.如图为甲、乙两人在同一星期内每日步数的折线统计图,则下列结论中正确的是( )
A.这一星期内乙的每日步数的中位数为12970
B.甲的每日步数星期三比星期二增加了1倍以上
C.这一星期内甲的每日步数的平均值大于乙
D.这一星期内甲的每日步数的极差小于乙
【答案】C
【分析】利用折线图的性质、中位数、平均数、极差的定义逐项判断即可.
【详解】对于A,这一星期内乙的每日步数从小到大为:,,,,,,,中位数为,故A错误;
对于B,甲星期三走步,星期二走 步,没有增加倍以上,故B错误;
对于C,甲每日步数的平均值为:,
乙每日步数的平均值为:,
这一星期内甲的每日步数的平均值大于乙,故C正确;
对于D,这一星期内甲的每日步数的极差为:,
这一星期内乙的每日步数的极差为:,
这一星期内甲的每日步数的极差大于乙,故D错误.
7.(2026·辽宁抚顺·一模)(多选)年我国粮食产量(单位:万吨)如图所示,下列结论正确的是( )
A.年我国粮食产量逐年增加
B.年我国粮食产量的中位数为万吨
C.年我国粮食产量的极差为万吨
D.年我国粮食产量与年份负相关
【答案】AB
【分析】利用条形图结合中位数、极差以及相关性逐项判断即可.
【详解】对于A选项,年我国粮食产量逐年增加,A正确.
对于B选项,年我国粮食产量的中位数为万吨,B正确.
对于C选项,年我国粮食产量的极差为万吨,C错误.
对于D选项,年我国粮食产量与年份正相关,D错误.
8.(2026·内蒙古包头·二模)为了了解学生的基本情况,某学校对一次高三质量预测数学考试成绩进行汇总(所有学生的数学成绩都不低于30分),整理后得到如下图所示的频率分布直方图:
(1)求频率分布直方图中的值,并估计该校学生数学成绩的第70百分位数;
(2)若该校高三学生共有1200人,从中依据按比例分配分层抽样的方法从等级分数介于80至100之间的学生中抽出8人,再从这8人中选出3人,记为3人中分数在的人数,求的分布列和数学期望.
【答案】(1),75
(2)的分布列为
1
2
3
【分析】(1)根据频率分布直方图中矩形面积之和为1可求得,再由百分位数的定义计算可得结果;
(2)根据分层抽样求出相应区间的人数,再计算出相应概率可得出分布列和期望.
【详解】(1)由题意得,
解得.
因为,
,
所以该校学生数学成绩的第70百分位数位于内,设其为,
则,解得.
故估计该校学生数学成绩的第70百分位数为75.
(2)因为两组数据的频率之比为,
所以8人中等级分数位于内的人数分别为6,2.
由题意知的所有可能取值为1,2,3,
,,;
所以的分布列为
1
2
3
所以.
9.(2026·云南玉溪·二模)为调查社区居民对社区工作的满意度,在社区内抽取名居民进行问卷调查,将收集到的数据分成五组,绘制出如下频率分布直方图,若的频率为,的值为( )
A., B., C., D.,
【答案】A
【分析】根据频率分布直方图的性质计算即可求解.
【详解】已知的频率为,组距为,因此,解得.
又因为所有组频率和为,因此,
代入,计算得 ,则,
因此,.
10.(2026·四川眉山·二模)(多选)为评估某款“端侧AI芯片”在不同模型架构下的推理延迟表现,研发团队在固定输入长度(128tokens)的条件下,对200个公开的深度学习模型进行了单次推理延迟测试(单位:).测试结果经异常值剔除后,得到如图所示的频率分布直方图,其中分组区间为,,,,,则下列结论正确的是( )
A.样本中延迟在内的模型个数为60
B.估计样本的中位数落在区间内
C.估计样本的平均数约为22.5
D.该分布呈现出右边“拖尾”形态,说明大部分模型的延迟较低
【答案】AD
【分析】求各组频率,即可判断A;对于B:根据中位数的定义分析判断;对于C:结合加权平均数公式运算求解;对于D:结合频率分布直方图分析判断即可.
【详解】由频率分布直方图可知每组的频率依次为:,,,,.
对于选项A:样本中延迟在内的模型个数为,故A正确;
对于选项B:因为,,
所以估计样本的中位数落在区间内,故B错误;
对于选项C:估计样本的平均数约为,故C错误;
对于选项D:该分布峰值在左侧低延迟区间,频率随延迟增大逐渐降低,
所以呈现右拖尾形态,说明大部分模型的延迟较低,故D正确.
题型03 平均数、方差、百分位数
11.(2026·河北保定·二模)(多选)已知平均数和方差分别是和,设一组数据
的平均数和方差分别是和,另一组数据的平均数和方差分别是和,则下列说法正确的是( )
A. B.
C.若,则 D.若且,则
【答案】AC
【分析】利用数据的平均数和方差的公式及性质计算即可.
【详解】已知原数据,平均数,总和;
方差,由方差公式,得.
由方差变形公式,代入得,
整理得,A正确;
新数据共个数,总和,平均数.
方差,B错误;
由方差性质,数据的方差,已知,
代入得,解得,C正确;
的平均数,时.
已知,得,
即,D错误.
12.(2026·湖北孝感·二模)已知数列是各项均为正数的等差数列,且公差;数列是各项均为正数的等比数列,且公比,若项数均为项,下列说法正确的个数是( )
①数据,,,…,的平均数是;
②数据,,,…,的平均数是;
③若,,则数据,,,…,的中位数大于数据,,,…,的中位数;
④若,,则数据,,,…,的平均数大于数据,,,…,的平均数.
A.1 B.2 C.3 D.4
【答案】C
【分析】根据等差、等比数列的性质,结合平均数、中位数的概念逐项判断即可.
【详解】对于①选项,设的前项和为,,
所以数据,,,…,的平均数是,故①选项正确:
对于②选项,当时,取为2,4,8,平均数为,故②选项错误;
对于③选项,,,,…,的中位数是,,,,…,的中位数是,
,故③选项正确;
对于④选项,易知点在直线上,点在曲线上,
因为,所以如下图所示:
由图可知,当时,,
所以数列的前项和大于数列的前项和,
所以数列的前项的平均数比的前项的平均数大,④选项正确.
13.(2026·广东惠州·二模)(多选)下列命题正确的是( )
A.数据4,4,4,6,6,7,8,8的众数是4
B.数据7,9,12,15,9,14,18的极差是11
C.数据2,3,3,5,7,8,9的第分位数是6
D.数据的平均数为2,方差为4,则数据,的平均数为5,方差为16
【答案】ABD
【分析】根据众数的概念,可判断A的正误;根据极差的求法,可判断B的正误;根据百分位数的求法,可判断C的正误;根据平均数、方差的性质,可判断D的正误.
【详解】选项A:数据4,4,4,6,6,7,8,8的众数是4,故A正确;
选项B:数据7,9,12,15,9,14,18的极差是18-7=11,故B正确;
选项C:数据2,3,3,5,7,8,9共7个,,
则该组数据的第分位数为7,故C错误;
选项D:数据,的平均数为,
方差为,故D正确.
14.(2026·云南昆明·二模)(多选)已知一组数据由6个正整数构成,且同时满足以下条件:①平均数为10;②中位数为9;③8是唯一的众数;④极差为12,则这组数据( )
A.必含有9 B.恰含有2个8
C.方差是定值 D.第25百分位数为8
【答案】BD
【分析】首先分析数据的情况,结合中位数,平均数,众数,极差定义分类计算即可判断各个选项.
【详解】这组数据一共有6个数,中位数为9,从小到大排列,中间2个数的平均数为9,
又有唯一的众数为8,则有三个8或两个8,
若有三个8,则从小到大排列这组数据为、8、8、10、、,且,
又极差为12,所以,则,
又因为平均数为10,则,即,与矛盾,所以数据不合题意舍去;
所以恰有两个8,其余数字均出现一次,B选项正确;
则从小到大排列这组数据为、8、8、10、、,且平均数为10,
则,所以,
又极差为12,所以,则,
最小数字可以是,则,,数据为,
方差为;
最小数字可以是,则,,数据为,
方差为;
则这组数据可以不含有9,A选项错误;C选项错误;
因为,所以第25百分位数是这组数据从小到大排列的第二个数8,D选项正确;
15.(2026·广西北海·一模)(多选)已知一组数据依次为:12,16,16,4,0,2,2,10,12,16,关于这一组数据,下列说法正确的是( )
A.极差是16 B.平均数是9
C.第70百分位数是12 D.方差是270
【答案】AB
【详解】由题意,极差是,故A正确;
平均数是,故B正确;
方差是
,故D错误;
将这组数据从小到大排序为:0,2,2,4,10,12,12,16,16,16,
因为,所以这组数据的第70百分位数是第7个数和第8个数的平均值,
即为,故C错误.
16.(2026高三下·内蒙古鄂尔多斯·专题练习)某AI公司有男性30人,女性10人,在一次知识竞技团建中,男性平均成绩为110分,方差为55,女性平均成绩为130分,方差为95,则在这次团建中,该公司的平均成绩和方差分别为( )
A.120分,75 B.120分,20 C.115分,65 D.115分,140
【答案】D
【详解】因为某AI公司有男性30人,女性10人,男性平均成绩为110分,方差为55,女性平均成绩为130分,方差为95,
所以该公司的平均成绩为分,
该公司成绩的方差为.
题型04 回归分析
17.(2026高三下·山东青岛·专题练习)已知线性相关的两个变量,的取值如表所示,如果其线性回归方程为,那么当时的残差为( )
3
4
6
7
20
40
60
A.2 B. C.3 D.
【答案】A
【详解】由表格可得,
因样本中心点满足回归方程,
故有,解得.
当时,,
此时残差为.
18.(2026·辽宁大连·一模)(多选)某人工智能公司从某年起连续7年的利润情况如下表所示:
第x年
1
2
3
4
5
6
7
利润y/亿元
2.9
3.3
3.6
4.4
4.8
5.2
5.9
根据表中的数据得到y关于x的回归直线方程,则( )
A.y与x之间的相关系数
B.回归系数的意义是x增大一个单位,增大0.5个单位
C.第8年的利润一定为6.3亿元
D.第6年利润的残差为亿元
【答案】ABD
【详解】由可知y与x之间的相关系数,故A正确;
回归系数的意义是x增大一个单位,增大0.5个单位,故B正确;
将代入回归方程,得 ,
第8年的利润估计约为6.3亿元,第8年的利润不一定为6.3亿元,故C错误;
将代入回归方程,得 ,
由表可知实际值为5.2,残差为, 故D正确;
19.(2026·安徽铜陵·模拟预测)已知变量和有较强的线性相关关系,根据下表中两个变量间的相关数据可以得到经验回归方程为,则( )
A.经验回归直线必过点
B.
C.当时,预测值
D.当时,样本点对应的残差为
【答案】D
【详解】对于A,因为,,
所以经验回归直线必过点,A错误;
对于B,因为经验回归方程为过点,
所以,解得,B错误;
对于C,将代入经验回归方程得,C错误;
对于D,当时,实际值,预测值,
所以残差为,D正确.
20.(2026·湖南怀化·一模)我国新能源汽车迅速崛起,成为推动绿色革命的核心引擎.某品牌新能源汽车公司为了抢占更多的市场份额,计划加大广告投入.该公司近5年的年广告费(单位:百万元)和年销售量(单位:百万辆)关系如图所示:
令,数据经过初步处理得:.现有①和②两种模型作为年销售量关于年广告费的回归分析模型,其中均为常数.
(1)请从样本相关系数的角度,分析哪一个模型拟合程度更好?
(2)为刺激消费,省出台了以下补贴政策:每购买一辆新能源汽车,补贴6000元.若甲、乙两人近期在省购买一辆该新能源汽车的概率分别为,其中,每人最多购买一辆.求该省对甲、乙两人补贴总金额的期望值的取值范围.
参考数据:.
相关系数.
【答案】(1)模型②的拟合程度更好
(2)元
【分析】(1)利用公式分别求出模型①和②的相关系数,结合相关系数的意义即可判断哪一个模型拟合程度更好;
(2)根据已知得该省对甲、乙两人补贴总金额的期望值为,结合二次函数的性质求范围.
【详解】(1)设模型①和②的相关系数分别为,
由题意可得:,
,
所以,由相关系数的意义可得,模型②的拟合程度更好.
(2)由题意,甲乙买车的总数量可能值为,
,
,
,
该省对甲、乙两人买车数量期望值为,
所以两人补贴总金额期望值为,,
由在上单调递增,则,
所以.
21.(2026·江苏南京·一模)为研究昼夜温差(单位:)与某植物种子当日的百粒发芽数(单位:粒)之间的关系,实验室记录了6天的每日昼夜温差与种子当日的百粒发芽数,如下表所示:
日期编号
1
2
3
4
5
6
温差
9
13
11
15
10
14
百粒发芽数
23
28
26
31
25
29
(1)根据表中的数据,计算样本相关系数(精确到0.01);
(2)求百粒发芽数关于温差的经验回归方程,并估计昼夜温差为时,这种植物种子当日的百粒发芽数.
参考公式:相关系数,
,,
参考数据:,,,.
【答案】(1)
(2),
【分析】(1)根据条件,直接计算,即可求解;
(2)根据条件,直接求出,即可求出线性回归方程,再将代入,即可求解.
【详解】(1)相关系数.
(2)由题意得,,
所以,,
所以所求的经验回归方程是,
当时,,
故当昼夜温差为时,这种植物种子当日百粒发芽数为.
22.(2026高三·全国·专题练习)水体富营养化导致藻类大量繁殖,以2017年中国太湖蓝藻爆发为例:5月初监测发现湖体中蓝藻细胞密度为每升50万个,随着气温升高至25-30℃且氮磷营养盐浓度超标(总磷浓度达),蓝藻进入增长期.5月10日细胞密度增至每升200万个,5月15日突破每升800万个,5月20日达到每升3200万个,形成面积超150平方公里的绿色水华带.此次爆发导致湖区溶解氧骤降至以下,大量鱼类死亡,自来水厂被迫停产,所以对水资源的保护刻不容缓.现对某区域的藻类面积y(单位:平方公里)与时间x(单位:年)的关系,进行监测,得到如下数据:
x/年
1
2
3
4
5
6
7
y/平方公里
6
11
21
34
66
101
196
根据以上数据,绘制成如图所示的散点图:
观察散点图,两个变量不具有线性相关关系,现考虑用对数函数模型和指数函数模型分别对两个变量的关系进行拟合.
(1)根据散点图判断与(a,b,c,d均为常数)哪一个更适合作为藻类面积y(单位:平方公里)与时间x(单位:年)的关系的回归方程类型(给出判断即可,不必说明理由);
(2)根据(1)的判断结果及表中的数据,求出y关于x的回归方程.
参考数据:
62.14
1.54
2535
50.12
3.47
其中,
参考公式:对于一组数据,,…,其回归直线的斜率和截距的最小二乘估计公式分别为,.
【答案】(1)更适合;
(2).
【分析】(1)由散点图的递增趋势选择更适宜的模型;
(2)先根据所取模型进行线性变换,再代入公式求解回归模型.
【详解】(1)由散点图得,藻类面积随时间的增加其增长速度越来越快,
所以更适宜作为藻类面积y与时间x的关系的回归方程类型.
(2)由,两边同时取常用对数得,
设,,,则,
由,,
得,
则,
因此,即
,
所以y关于x的回归方程为.
23.(2026·江西·一模)随着科技的发展,人工智能生成的虚拟角色正逐步取代传统的真人直播带货.某公司使用虚拟角色直播带货后销售金额逐步提升,根据该公司使用虚拟角色直播带货后18个月的销售金额的情况统计,得到一组样本数据,其中和分别表示月份编号和销售金额数量(单位:万元),并计算得, .
(1)求样本的相关系数(精确到0.01),并推断销售金额(单位:万元)和月份编号是否线性相关(当时,即可认为线性相关);
(2)已知这18个月中有10个月的销售金额高于平均数,从这18个月中随机抽取2个月的销售金额,记抽到销售金额高于平均数的月份数为,求随机变量的分布列.
附:相关系数.
【答案】(1),具有很强的正相关性
(2)
0
1
2
【分析】(1)由条件结合相关系数公式求出相关系数,根据相关系数性质判断结论;
(2)由条件确定的可能取值,再求取各值的概率,由此可得其分布列.
【详解】(1)样本的相关系数为:
由于相关系数,故销售金额(单位:万元)和月份编号具有很强的正相关性;
(2)由题意得:的可能取值为0,1,2,
18个月中有10个月的销售金额高于平均数,
所以,
,
,
所以的分布列为:
0
1
2
题型05 独立性检验
24.(2026·上海·二模)某工厂为判断两种不同的操作方法是否对生产某种零件的合格个数有影响,收集了相关数据,绘制了列联表,设原假设:两种不同的操作方法对生产该种零件的合格个数没有影响,计算出统计量,已知,则在显著性水平下,推断的结论为________.(用“拒绝”或“接受”填空)
【答案】拒绝
【详解】在独立性检验中,当计算出的统计量大于给定显著性水平对应的临界值时,样本数据出现的概率小于,
属于小概率事件,根据小概率原理,我们拒绝原假设,认为两个变量之间存在显著关联,
本题中,所以拒绝,即认为两种操作方法对合格个数有影响.
25.(2026·天津·一模)近年中国新能源汽车进入高速发展时期,为了了解消费者的购车类型与地域是否具有相关性,某品牌汽车商随机调查了甲、乙两地各200名消费者,并用等高堆积条形图直观地展示调查结果如下图所示,经计算得到.
车型与地区
下表是独立性检验中几个常用的小概率值和相应的临界值.
0.05
0.01
0.005
0.001
3.841
6.635
7.879
10.828
下列说法正确的是( )
A.在所调查的甲地购车者中,若按比例分层随机抽样抽取20人,则新能源车主有8人
B.在所调查的乙地购车者中,购买燃油车的人数比新能源车的多20人
C.依据的独立性检验,即消费者的购车类型与地域有关联,此推断犯错误的概率不大于0.001
D.依据的独立性检验,即消费者的购车类型与地域无关联,此推断犯错误的概率不大于0.001
【答案】C
【分析】借助分层随机抽样定义计算可得A;分别计算出购买燃油车的人数与购买新能源车的人数可得B;利用独立性检验定义可得C、D.
【详解】对A:,故新能源车主有人,故A错误;
对B:购买燃油车的人数为,
购买新能源车的人数为,
则购买燃油车的人数比新能源车的多人,故B错误;
对C、D:依据的独立性检验,即消费者的购车类型与地域有关联,
由,故此推断犯错误的概率不大于,故C正确、D错误.
26.(2026·湖北荆州·一模)(多选)某校为了了解本校学生在寒假期间参加社会实践活动的情况,随机调查了100名学生,得到如下列联表(单位:人):( )
男生
女生
合计
参加了社会实践活动
30
40
70
未参加社会实践活动
20
10
30
合计
50
50
100
附,其中n=a+b+c+d;
A.依据小概率值的独立性检验,认为学生是否参加社会实践活动与性别无关
B.从男生中随机抽取1人,其参加了社会实践活动的概率为
C.随机抽取1人,若抽取到的是参加了社会实践的学生,则这名学生是男生的概率为
D.按性别用分层抽样的方法从参加社会实践活动的学生中抽取7人,再从这7人中抽取2人,则这2人中至少有一名男生的概率为
【答案】BCD
【详解】零假设为:参加社会实践活动与性别无关联,
则,
依据小概率值的独立性检验,我们推断不成立,
即认为参加社会实践活动与性别有关联,此推断犯错误的概率不大于,故A错误.
从男生中随机抽取1人,其参加了社会实践活动的概率为,故B正确.
记事件表示抽到的学生是参加社会实践的学生,则,
记事件表示抽到的学生是男生,,
所以,故C正确.
按性别用分层抽样的方法从参加社会实践的学生中抽取7人,
则7人中有男生人,有女生人,
从这7人中抽取2人有种取法,全为女生的取法有,
所以从这7人中抽取2人全为女生的概率为,
所以从这7人中抽取2人,这2人中至少有一名男生的概率为,故D正确.
27.(2026高三·全国·专题练习)为了了解疾病是否与性别有关,在某医院随机地对入院的50人进行了问卷调查,得到了如下的列联表:则认为疾病与性别有关的把握约为( )
患疾病
不患疾病
总计
男
20
5
25
女
10
15
25
总计
30
20
50
0.05
0.01
0.005
0.001
3.841
6.635
7.879
10.828
A. B. C. D.
【答案】C
【分析】根据所给的列联表数据计算,将其与临界值表进行比较,即可得到答案.
【详解】由公式得,
故有的把握认为疾病与性别有关,
故选:C
28.(2026·重庆沙坪坝·模拟预测)重庆城市足球超级联赛(简称 “渝超”)引发了广泛关注. 某地区随机抽取了部分市民,调查他们对赛事的关注情况, 得到如下表格:
性别
不关注赛事
关注赛事
男性
女性
(1)根据小概率值 的独立性检验,能否认为关注 “渝超” 赛事与性别有关?
(2)现从被调查的关注赛事的市民中,按照性别比例采用分层抽样的方法随机抽取 3 名市民参加 “渝超” 赛事知识问答. 已知男性、女性市民顺利完成知识问答的概率分别为 , 每个人是否顺利完成相互独立.求3人中顺利完成知识问答的总人数的分布列及其期望.
附:.
【答案】(1)认为关注 “渝超” 赛事与性别有关
(2)
0
1
2
3
【分析】(1)整理列联表数据代入卡方统计量公式计算,对比临界值得出结论;
(2)确定分层抽样人数,确定随机变量取值,分情况计算概率,列出分布列并求期望.
【详解】(1)整理列联表数据如下:
性别
不关注赛事
关注赛事
合计
男性
女性
合计
根据卡方公式:
,
已知小概率值,对应临界值,
,
根据的独立性检验,认为关注 “渝超” 赛事与性别有关.
(2)关注赛事的市民中,男性人,女性人,性别比例,则抽取3人时,男性2人,女性1人;
表示顺利完成问答总人数,取值为:,
已知男性完成概率,未完成概率,女性完成概率,未完成概率,且相互独立;
则;
;
;
;
0
1
2
3
数学期望为:
.
29.(24-25高三下·山东德州·开学考试)人工智能中的文生视频模型Sora(以下简称Sora),能够根据用户的文本提示创建最长60秒的逼真视频.为调查Sora的应用是否会对视频从业人员的数量产生影响,某学校研究小组随机抽取了150名视频从业人员进行调查,结果如下表所示.
Sora的应用情况
视频从业人员
合计
减少
未减少
应用
54
72
没有应用
42
合计
90
150
(1)根据所给数据完成题中表格,依据的独立性检验,判断Sora的应用与视频从业人员的减少有关?
(2)某公司视频部现有员工100人,公司拟开展Sora培训,分三轮进行,每位员工第一轮至第三轮培训达到“优秀”的概率分别为,,,每轮相互独立,有两轮及以上获得“优秀”的员工才能应用Sora.
①求员工经过培训能应用Sora的概率;
②已知开展Sora培训前,员工每人每年平均为公司创造利润6万元;开展Sora培训后,能应用Sora的员工每人每年平均为公司创造利润10万元;Sora培训平均每人每年成本为1万元.根据公司发展需要,计划先将视频部的部分员工随机调至其他部门,然后对剩余员工开展Sora培训,现要求培训后视频部的年利润不低于员工调整前的年利润,则视频部最多可以调多少人到其他部门?
附:其中.
0.010
0.005
0.001
6.635
7.879
10.828
【答案】(1)
Sora的应用情况
视频从业人员
合计
减少
未减少
应用
54
18
72
没有应用
36
42
78
合计
90
60
150
有的把握认为Sora的应用与视频从业人员的减少有关.
(2)(i)(ii)14人
【分析】(1)分析数据关系,完善列联表,提出零假设,计算,比较其与临界值大小,判断结论;
(2)(i)设“员工第i轮获得优秀”,“员工经过培训能应用Sora”,
结合互斥事件概率加法公式,独立事件概率乘法公式求结论;
(ii)设视频部调人至其他部门,为培训后视频部能应用Sora的人数,则,由条件列不等式可求结论.
【详解】(1)依题意,列联表如下:
Sora的应用情况
视频从业人员
合计
减少
未减少
应用
54
18
72
没有应用
36
42
78
合计
90
60
150
零假设:Sora的应用与视频从业人员的减少独立,Sora的应用前后视频从业人员无差异,
由列联表中数据得,.
根据小概率值的的独立性检验,推断不成立,
所以有的把握认为Sora的应用与视频从业人员的减少有关;
(2)(i)设"员工第i轮获得优秀",且相互独立.
设"员工经过培训能应用Sora",
则
故员工经过培训能应用Sora的概率是.
(ii)设视频部调人至其他部门,为培训后视频部能应用Sora的人数,
则,因此,
调整后视频部的年利润:(万元).
令,解得,又,所以.
因此,视频部最多可以调14人到其他部门.
30.(25-26高三上·河北沧州·月考)为了探究职场人士每季度进行职业技能培训的时长(单位:小时)和他们的季度绩效评分(单位:分)的关系,某调研机构开展了调查,得到如下数据:
3
6
9
12
15
70
80
84
96
100
(1)若该组数据中与之间的关系可用线性回归模型进行拟合,求关于的经验回归方程;
(2)基于上述调查,某企业推行员工职业技能培训计划,经过一个季度的实施后,抽样调查了200位员工,按照参与职业技能培训与季度绩效提升情况得到如下列联表,请将表格补充完整,并依据的独立性检验,分析“参与职业技能培训与绩效提升”是否有关.
单位:人
绩效未提升
绩效提升
合计
参与职业技能培训
100
150
未参与职业技能培训
30
合计
参考公式:经验回归方程中斜率和截距的最小二乘估计公式分别为,,
其中.
0.1
0.05
0.01
0.005
0.001
2.706
3.841
6.635
7.879
10.828
【答案】(1)
(2)表格见解析,有关
【分析】(1)根据统计表格中的数据,分别求得相应的数据,利用公式求得和的值,即可求解;
(2)根据题意,补充完成的列联表,利用公式求得的值,结合附表,即可得到结论.
【详解】(1)解:由表格中的数据,可得,,
且,,
所以,则,
所以关于的经验回归方程为.
(2)解:根据题意,补充的列联表:
绩效未提升
绩效提升
合计
参与职业技能培训
50
100
150
未参与职业技能培训
30
20
50
合计
80
120
200
零假设为:参与职业技能培训与绩效提升无关,
由表格数据,可得,
所以依据小概率值的独立性检验,我们可以推断不成立,
即认为参与职业技能培训与绩效提升有关,此推断犯错误的概率不大于.
强化训练
1.(2026·宁夏银川·二模)一组互不相等的数据从小到大排列为,去掉后,则下列选项正确的是( )
A.极差变大 B.平均数变大
C.中位数变小 D.分位数变小
【答案】B
【分析】分别求出原数据和新数据的极差、平均数、中位数和分位数,再结合数据对比大小即可.
【详解】已知原数据从小到大排列为 ,去掉后新数据为 ,
选项A,原数据极差:,新数据极差:,
由,可得,极差变小,A错误;
选项B,原数据平均数 ,新数据平均数 ,
作差得:(为原数据总和),
因为,所以,
即,平均数变大,B正确;
选项C,原数据的中位数是,新数据的中位数是,
因为,所以,中位数变大,C错误;
选项D,原数据:,不是整数,取第5个数,即原数据的80%分位数为;
新数据:,是整数,取第4、5个数的平均数,即新数据的80%分位数为,
因为,所以,80%分位数变大,D错误.
2.(2026·云南曲靖·一模)一个盒子中装有大小相同、质地均匀的6个小球,这6个小球分别标有编号1,2,3,4,5,6,现从盒中有放回地任取一个球并记下编号,共取4次,得到一组编号组成的数据,若该组数据的平均数为2,则( )
A.中位数可能为3 B.众数可能为4
C.极差可能为5 D.方差可能为1
【答案】D
【分析】由该组数据中位数为3时得到该组数据情况不满足和为8即可判断A;由该组数据和为8得到数据4出现的次数情况即可分析求解判断B;由极差为5得到该组数据情况不满足和为8即可判断C;通过举例可判断D.
【详解】设该组数据从小到大排列为,且,,
则由题,
对A,当该组数据中位数为3时,则该组数据满足,
则该组数据的和,与该组数据的和为8矛盾,故A错误;
对B,因为该组数据和为8,所以该组数据4的个数至多为一个,
当该组数据有一个数据4时,则另三个数据的和为4,故该组数据只能为,
此时该组数据众数为1,故该组数据众数不可能为4,故B错误;
对C,若该组数据的极差为5,则该组数据至少有一个6和一个1,
则该组数据的和,与该组数据的和为8矛盾,
所以该组数据极差不可能为5,故C错误;
对D,当该组数据为时,
该组数据方差为,故D正确.
3.(2026高三·全国·专题练习)某高中2024年的高考考生人数是2023年高考考生人数的1.5倍.为了更好地对比该校考生的升学情况,统计了该校2023年和2024年高考分数达线情况,得到如图所示扇形统计图:
下列结论正确的是( )
A.该校2024年与2023年的本科达线人数比为6:5
B.该校2024年与2023年的专科达线人数比为6:7
C.2024年该校本科达线人数增加了80%
D.2024年该校不上线的人数有所减少
【答案】C
【分析】根据扇形统计图及各人数的百分比进行计算即可.
【详解】不妨设2023年的高考人数为a,则2024年的高考人数为.
由图可知2023年本科达线人数为,2024年本科达线人数为,
故2024年与2023年的本科达线人数比为9:5,故A不正确;
本科达线人数增加了,故C正确;
2023年专科达线人数为,2024年专科达线人数为,
所以2024年与2023年的专科达线人数比为9:7,故B错误;
2023年不上线人数为,2024年不上线人数也是,不上线的人数无变化,故D错误.
故选:C.
4.(2026·河北·一模)为了给顾客提供更好的服务,某饭店对2025年的营业情况进行了盘点,发现顾客平均每次的消费金额(单位:元)都在内,整理统计数据得到如图所示的频率分布直方图,则下列结论中正确的是( )
A.
B.顾客平均每次的消费金额的中位数小于元
C.顾客平均每次的消费金额的极差介于元至 元之间
D.顾客平均每次的消费金额的平均数为 元
【答案】C
【详解】对于A,因为,故,故A错误;
对于B,因为前三组的频率之和为,
前四组的频率之和为,
故中位数在中,故中位数大于,故B错误;
对于C,设顾客平均每次的消费金额的极差,则,
故,故C正确;
对于D,顾客平均每次的消费金额的平均数为:
(元),
故D错误.
5.(2026·天津河西·一模)下列说法中错误的有( )
①回归直线恒过点,且至少过一个样本点;
②根据列联表中的数据计算得出,而,则“两个分类变量有关联”此推断犯错误的概率不大于0.01;
③回归分析时,可以用决定系数刻画模型的回归效果,越大,则拟合的效果越好;
④若随机变量服从正态分布,若则实数
A.1个 B.2个 C.3个 D.4个
【答案】A
【分析】利用回归直线的特点可判断①;利用独立性检验可判断②;利用决定系数与模型拟合效果的关系可判断③;利用正态分布对称性和性质可判断④.
【详解】对于①,回归直线恒过点,不一定过样本点,故①错误;
对于②,根据列联表中的数据计算得出,而,
则有的把握认为两个分类变量有关系,则“两个分类变量有关联”此推断犯错误的概率不大于0.01,故②正确;
对于③,在做回归分析时,可以用决定系数刻画模型的回归效果,若越大,则说明模型拟合的效果越好,故③正确;
对于④,由随机变量,其正态曲线关于直线对称,
由,若,则,即得,
所以,故④正确.
综上,错误的只有①.
6.(25-26高三下·重庆·月考)具有相关关系的变量x与y的一组样本数据如下,若已求得线性回归方程为,则去掉其中某对样本数据,样本相关系数r不会发生改变的是( )
(参考公式:相关系数
x
1
2
3
4
5
y
6
10
11
12
16
A. B. C. D.
【答案】C
【分析】先求得样本中心点,再结合相关系数公式判断即可.
【详解】由题知,,
所以数据的样本中心点为
所以去掉其中样本数据,样本相关系数r不会发生改变.
7.(25-26高三上·江西南昌·期末)(多选)下列说法正确的是( )
A.样本甲中有件样品,其方差为,样本乙中有件样品,其方差为,则由甲,乙组成的总体样本的方差为
B.一组数据,,,,的经验回归方程为,则当时,残差为
C.一组数据,,,的均值为,标准差为s,则数据,,…,的均值为
D.按从小到大排序的两组数据:甲组数据为;乙组数据为,.则甲组数据的第30百分位数和乙组数据的第40百分位数之和为75
【答案】BC
【分析】由总体样本方差计算公式可判断A,由残差概念可判断B,由均值、标准差概念可判断C,由百分位数概念可判断D.
【详解】对于A,记样本甲,乙的平均数分别为,由甲乙组成的总体样本的平均数为,
则甲乙组成的总体样本的方差为,故A不正确;
对于B,由题意,得,,
则,所以.
令,则,所以残差为,故B正确.
对于C,
,
所以数据,,…,的均值为,故C正确.
对于D,因为,所以甲组数据的第30百分位数为31,
乙组数据的第40百分位数是,故D错误.
8.(2026高三·全国·专题练习)(多选)为了解阅读量多少与幸福感强弱之间的关系,一个调查机构根据所得到的数据,绘制了如下的列联表(个别数据暂用字母表示):
阅读情况
幸福感强弱
幸福感强
幸福感弱
总计
阅读量多
18
72
阅读量少
36
78
总计
90
60
150
计算得,则下面的选项正确的为( )
A.有99%的把握认为“阅读量多少与幸福感强弱无关”
B.
C.有99%的把握认为“阅读量多少与幸福感强弱有关”
D.
【答案】CD
【分析】先根据列联表的总计关系求出和,再通过值与临界值比较判断相关性.
【详解】对于A,,所以有99%的把握认为“阅读量多少与幸福感强弱有关”,故A错误,C正确;
对于B,,故B错误;
对于D,,故D正确,
故选:CD.
9.(2026·四川成都·二模)(多选)已知数据的平均数为M,中位数为N,方差为P,极差为Q,设,得到新数据,则对于所得新数据,下列说法一定正确的是( )
A.平均数是3M B.中位数是
C.方差是9P D.极差是
【答案】BC
【分析】根据题意,结合数据的平均数、中位数、方差和极差的定义与计算方法,结合,逐项求解判断,即可得到答案.
【详解】对于A,由数据的平均数为,可得,
新数据的平均数为
,所以A错误;
对于B,由数据的中位数为,
将新数据从小到大排序,因为,所以新数据的排序和原数据的排序相同,
所以新数据的中位数为,所以B正确;
对于C,由数据的方差为,
设新数据的方差为,因为新数据满足,可得,所以C正确;
对于D,由原数据的极差为,可得,
因为新数据满足,则新数据的极差为,所以D错误.
10.(2026·山西运城·二模)(多选)已知一组数据由5个正整数组成,且这组数据中至少有1个8,则关于这组数据的描述可能是( )
A.中位数为3且平均数为5 B.平均数为4且众数为4
C.平均数为4且方差为3.2 D.中位数为5且方差不小于7.2
【答案】ABD
【分析】举出符合要求的例子可得A、B、D;利用平均数与方差定义计算可得C.
【详解】对A:若这组数据为2,3,3,8,9,则其中位数为3且平均数为5,故A正确;
对B:若这组数据为1,3,4,4,8,则其平均数为4且众数为4,B正确;
对C:若这组数据的平均数为4,且至少有1个8,
则要使得方差最小,这五个数为3,3,3,3,8,
此时这组数据的方差,故C错误;
对D:若这组数据为2,2,5,8,8,则其中位数为5,
平均数为,方差,故D正确.
11.(2026·湖北随州·一模)某车间为了规定工时定额,需要确定加工零件所花费的时间,为此进行了5次试验.得到数据如下表:
零件个数x
10
20
30
40
50
加工时间y(min)
53
65
71
76
85
根据上表可得经验回归方程中的,则经验回归方程中___________;据此估计,加工的零件个数为60时所花费的时间为__________min.
【答案】 47.5 92.5
【分析】由题中数据可得,,根据经验回归直线必过样本中心点可得,代入运算求解即可.
【详解】由题意可得,,
因为经验回归直线必过样本中心点,且,
则,解得,
即,当时,则,
故估计加工的零件个数为60时,所花费的时间为92.5 min.
12.(25-26高三下·安徽滁州·开学考试)考察棉花种子经过处理与是否生病之间的关系得到如下表所示的数据:
经处理的种子数粒
未经处理的种子数粒
合计粒
得病
不得病
合计
根据以上数据,则统计量的观测值是__________.
【答案】
【分析】由的公式计算.
【详解】,
故答案为:0.164
13.(2026·西藏拉萨·二模)某公司的生产车间有3台核心加工设备,分别为成型机(记为设备A)、调试机(记为设备B)、测试机(记为设备C),三台设备各自独立工作,设同时发生故障的设备数为随机变量.
(1)若三台设备同时运行,每台设备发生故障的概率均为,求“至少有1台设备发生故障的条件下,恰好有1台设备发生故障”的概率;(结果保留三位有效数字)
(2)为验证设备A与设备B的工作独立性,该公司随机抽取了次设备运行记录,得到如下列联表(单位:次):
设备A
设备B
合计
故障
正常
故障
30
70
100
正常
60
40
100
合计
90
110
200
根据小概率值的独立性检验,分析设备A的故障与设备B的故障是否有关.
附:,
【答案】(1)
(2)设备A的故障与设备B的故障有关.
【详解】(1)设“至少有1台设备发生故障的条件下”为事件,
“恰好有1台设备发生故障”为事件,
则,而,
故.
(2)设设备A的故障与设备B的故障无关,
则,
故依据小概率值的独立性检验否定,
即设备A的故障与设备B的故障有关.
14.(2026·上海静安·二模)下表是某品牌净化器的年销售量与年份的统计表.
年份
2021
2022
2023
2024
2025
年份代码x
1
2
3
4
5
年销售量у(万台)
2
3.5
2.5
8
9
(1)用计算器计算净化器的年销售量y关于年份代码x的线性回归方程;(回归系数计算结果保留两位小数)
(2)为了调查A、B两地区人群对该品牌净化器的了解情况,调查机构在A、B两地区的人群中分别进行品牌知晓情况的问卷调查.统计知晓与不知晓的人数,得到如下2×2列联表.
知晓
不知晓
合计
A地区
80
20
100
B地区
40
60
100
合计
120
80
200
试根据表中数据判断A、B两地区的人群对该品牌净化器的知晓情况是否有显著差异.(规定显著水平)
附:关于回归方程,回归系数的计算公式,其中为样本点的中心;的计算公式;
0.05
0.01
0.001
k
3.841
6.635
10.828
【答案】(1)
(2)在犯错误的概率不超过0.05 的前提下,认为A、B两地区的人群对该品牌净化的知晓情况有显著差异
【分析】(1)计算出样本中心以及回归系数和,即可求解;
(2)利用列联表中的数据,代入公式计算观测值,并与临界值3.841进行比较,从而判断两个分类变量是否有关.
【详解】(1)由表可知,样本中心 为:
.
.则 .
所以,净化器的年销售量 关于年份代码 的线性回归方程为:.
(2)根据 列联表中的数据,计算 的观测值:
.
因为 ,
所以,在犯错误的概率不超过 0.05 的前提下,认为 A、B 两地区的人群对该品牌净化器的知晓情况有显著差异.
15.(2026·河北沧州·二模)某新能源汽车4S店在某平台开启了直播销售,星期一至星期五的五个工作日内,直播时长x(小时)与直播时在线观看人数y(百人)如下表:
星期
一
二
三
四
五
直播时长x(小时)
2
5
6
4
8
直播时在线观看人数y(百人)
4
8
9
7
16
附:样本相关系数
经验回归方程中斜率和截距的最小二乘法估计公式分别为:,,,,.
(1)试根据样本相关系数r的值判断该直播的在线观看人数y(百人)与直播时长x(小时)的线性相关性的强弱(若,则认为y与x的线性相关性较强;若,则认为y与x的线性相关性较弱).
(2)利用最小二乘法求出y关于x的经验回归方程,并预测直播时长为10小时时的在线观看人数.
【答案】(1)y与x具有较强的线性相关性.
(2),18.3(百人).
【分析】(1)根据已知数据结合样本相关系数的计算公式,即可求得答案;
(2)利用最小二乘法求出,即可得y关于x的经验回归方程,将代入经验回归方程即可得答案.
【详解】(1)依题意,,,
所以,
又,则,
又,
所以,
因为,所以y与x具有较强的线性相关性.
(2)依题意可得,
,
所以y关于x的经验回归方程为
将代入经验回归方程得(百人),
故预测直播时长为10小时时的在线观看人数为18.3(百人).
16.(2026·广东佛山·二模)近年我国人工智能大模型发展迅猛,其中语言模型(处理、理解和生成人类语言)和多模态模型(处理、理解和生成文本、图像、音视频等)是其中两个重要的领域,某研究机构对2025年某区域的企业发布的所有大模型中随机抽取了14款进行标准化测试,由测试数据得到下面的散点图:
(1)用频率估计概率,根据2025年该区域的企业发布大模型的分布情况,估计该区域2026发布的大模型是多模态模型的概率;
(2)若t为时间变量,y为分数,根据多模态模型数据(,2,3,4,5,6,表示2025年1月份,表示2025年6月份,…),计算得,,.
(i)建立y关于t的线性回归方程;
(ii)根据语言模型的数据建立的回归方程为,该区域的某家企业在2026年4月发布了1款标准化测试得分为68分的大模型,定义统计量,Q值越小的大模型发生的可能性越大,则该款大模型更有可能是语言模型还是多模态模型,并说明理由.
附:回归直线的斜率和截距的最小二乘估计公式分别为,,.
【答案】(1)
(2)(i);(ii)该款大模型更有可能是语言模型.
【分析】(1)依据图示可以得到多模态模型的个数与总数作比值;(2) (i)根据线性回归模型的计算公式代入数据;(ii)分别计算两款模型的值,比较即可;
【详解】(1)由2025年的数据可知,随机抽取了14款大模型,其中多模态模型有6款,用频率估计概率,多模态模型的频率为,所以该区域2026发布的大模型是多模态模型的概率为.
(2)(i) 因为,,,
表示2025年1月份,表示2025年6月份,所以
所以,
所以,根据,
所以y关于t的线性回归方程为:
(ii) 已知2026年4月,则,计算多模态模型的预测值和残差,,残差为:,
所以.再计算语言模型的预测值和残差,,残差为:,,所以,所以根据值越小的大模型发生的可能性越大,所以该款大模型更有可能是语言模型.
2 / 8
1 / 8
学科网(北京)股份有限公司
$