内容正文:
■成都经济技术开发区实验中学校 杜海洋
从近五年全国卷的考查情况来看,本节
是高考的热点,主要以解答题形式出现,经常
与概率知识综合出题,一般难度为中等。它
可能以选择题、填空题形式出现,难度不大,
如2023年上海卷第14题(4分),2023年天
津卷第7题(5分);也可能以应用题的方式
出现,如2023年甲卷(文科)第19题(12分),
2022年Ⅰ卷第20题(12分)等,其中多与经
济、生活实际相联系,需要同学们在复杂的题
目描述中找出数量关系,建立数学模型,并且
运用数学模型解决实际问题。这部分知识要
求同学们从过去的单变量观察阶段转变到多
变量的数据理性分析推断阶段,往往聚焦数
学核心素养,以解决生产生活中的实际问题
为背景,考查同学们的必备知识与关键能力,
深受命题者的青睐。下面对成对数据的统计
分析考查的常见题型及解题策略进行总结。
一、变量间的相关关系
例 1 对四组数据进行统计,获得以下
4幅散点图(如图1,2,3,4所示),将四组数
据相应的相关系数进行比较,则( )。
图1 图2 图3 图4
A.r2<r4<0<r3<r1
B.r4<r2<0<r1<r3
C.r4<r2<0<r3<r1
D.r2<r4<0<r1<r3
解析:由散点图可知,图1、3中为正相
关,图2、4中为负相关,图1、2中变量相关性
较强,所以r1>0,r2<0,r3>0,r4<0,且
|r1|,|r2|与|r3|,|r4|相比较,其值更大,即
r2<r4<0<r3<r1,选A。
例 2 某同学在研究变量x,y 之间的
相关关系时,得到如表1所示的数据,并采用
最小二乘法得到了线性回归方程ŷ=̂bx+̂a,
则( )。
表1
x 4.8 5.8 7 8.3 9.1
y 2.8 4.1 7.2 9.1 11.8
A.̂a>0,̂b>0 B.̂a>0,̂b<0
C.̂a<0,̂b<0 D.̂a<0,̂b>0
图5
解析:画出散点图
如图5所示。
从而可以看出ŷ=
b̂x+̂a 中,̂b>0,̂a<0。
故选D。
方法总结:
判定两个变量正、
负相关的方法如下。
(1)画散点图:点的分布从左下角到右上
角,两个变量正相关;点的分布从左上角到右
下角,两个变量负相关。
(2)样本相关系数:当r>0时,正相关;
当r<0时,负相关;|r|越接近于1,相关性
越强。
(3)经验回归方程:当b̂>0时,正相关;
当b̂<0时,负相关。
81
解题篇 经典题突破方法
高二数学 2024年6月
二、一元线性回归模型
例 3 某公司一种型号的产品近期销
售情况如表2所示。
表2
月份x 2 3 4 5 6
销售额y(万元)15.1 16.3 17.0 17.2 18.4
根据表2可得到回归直线 方 程 ŷ=
0.75x+̂a,据此估计,该公司7月份这种型
号产品的销售额为( )。
A.18.85万元 B.19.3万元
C.19.25万元 D.19.05万元
解析:由表中数据可得x=
1
5
(2+3+4+
5+6)=4,y=
1
5
(15.1+16.3+17+17.2+
18.4)=16.8。因为回归直线过样本点的中心,
所以16.8=0.75×4+̂a,解得â=13.8。
回归直线方程为ŷ=0.75x+13.8,则该
公司7月 份 这 种 型 号 产 品 的 销 售 额 y=
0.75×7+13.8=19.05(万元)。选D。
例 4 已知x,y 取表3中的数值,若
x,y 具有线性相关关系,线性回归方程为
ŷ=0.95x+2.6,则a=( )。
表3
x 0 1 3 4
y a 4.3 4.8 6.7
A.2.2 B.2.4 C.2.5 D.2.6
解析:由题意可知,x=
0+1+3+4
4 =2
,
y=
a+4.3+4.8+6.7
4 =
a+15.8
4
,故样本中
心(x,y)为 2,
a+15.8
4 。
代入回归方程得
a+15.8
4 =0.95×2+
2.6,解得a=2.2。故选A。
方法总结:
求经验回归方程的步骤如下。
三、非线性回归
例 5 已知一组成对数据(xi,yi)(i=
1,2,…,6)中y 关于x 的一元非线性回归方
程为y=bx2+1,已知∑
6
i=1
x2i=12,∑
6
i=1
xi=4,
∑
6
i=1
yi=18,则b=( )。
A.-1 B.1 C.-
9
2 D.
9
2
解析:y 关于x 的一元非线性回归方程
为y=bx2+1,可设t=x2,则回归直线方程
为ŷ=̂bt+1。又因为∑
6
i=1
x2i=12,∑
6
i=1
yi=18,
所以
1
6∑
6
i=1
x2i=2,
1
6∑
6
i=1
yi=3,即样本中心为
(2,3)。将样本中心(2,3)代入回归直线方程
ŷ=̂bt+1,可得3=2̂b+1,解得b̂=1,即b=
1。选B。
例 6 表4为某外来生物物种入侵某
河流生态后的前3个月繁殖数量y(单位:百
只)的数据,通过相关理论进行分析知,可用
回归模型y=e1+at(a∈R)对y 与t的关系进
行拟合,则根据该回归模型,预测第7个月该
物种的繁殖数量为( )。
表4
第t个月 1 2 3
繁殖数量y e1.4 e2.2 e2.4
A.e3 百只 B.e3.5 百只
C.e4 百只 D.e4.5 百只
解析:将回归模型两边取自然对数ln
y
=1+at,并令u=ln
y,由此构建一个u 与t
的回归直线模型,根据回归直线必过中心点
(t,u),可求出a 值,利用所得回归模型进行
预测。
由题意知y=e1+at,两边取自然对数得
ln
y=1+at。令u=ln
y,则u=1+at。u=
(ln
y1+ln
y2+ln
y3)×
1
3=2
,t=(t1+t2+
t3)×
1
3=2
。因为回归直线必过样本点的中
心,所以2=2a+1,得a=
1
2
,即u=1+
t
2
,
则y=e
1+t2。
91
解题篇 经典题突破方法
高二数学 2024年6月
当t=7时,y=e4.5。故选D。
方法总结:
对于非线性回归分析问题,应先进行变
量代换,求出代换后的回归直线方程,再求非
线性回归方程,换元法变成一元线性回归
模型。
四、列联表与独立性检验
图6
例 7
某制药公司为
了研究某种治
疗高血压的药
物在饭前和饭
后服用的药效
差异,随机抽
取了200名高
血压患者开展
试验,其中100名患者饭前服药,另外100名
患者饭后服药,随后观察药效,将试验数据绘
制成如图6所示的等高条形图。已知χ2=
n(ad-bc)2
(a+b)(c+d)(a+c)(b+d)
,其中,n=a+
b+c+d,且P(χ2>6.635)=0.01,则下列说
法正确的是( )。
A.饭前服药的患者中,药效强的频率为
4
5
B.药效弱的患者中,饭后服药的频率为
7
10
C.在犯错误的概率不超过0.01的条件
下,可以认为这种药物饭前和饭后服用的药
效有差异
D.在犯错误的概率不超过0.01的条件
下,不能认为这种药物饭前和饭后服用的药
效有差异
解析:对于选项A,饭前服药的100名患
者中,药效强的有80人,所以频率为
4
5
,故A
正确。对于选项B,饭前服药的有20人药效
弱,饭后服药的有70人药效弱,所以药效弱
的有90名患者,饭后服药的频率为
7
9
,B错
误。 对 于 选 项 C,D, 因 为 χ2 =
200×(80×70-20×30)2
100×100×110×90 =
5
000
99 ≈50.505>
6.635,所以在犯错误的概率不超过0.01的
条件下,可以认为这种药物饭前和饭后服用
的药效有差异,C正确,D错误。故选AC。
例 8 随着北京2022年冬奥会的举
行,全民对冰雪项目的热情被进一步点燃。
为调查某城市居民对冰雪运动的了解情况,
随机抽取了该市120名市民进行统计,得到
如表5所示的2×2列联表。
表5
男 女 合计
了解冰雪运动 m p 70
不了解冰雪运动 n q 50
合计 60 60 120
已知从参与调查的男性市民中随机选取
1名,抽到了解冰雪运动的概率为
2
3
。
(1)直接写出m,n,p,q的值。
(2)能否根据小概率值α=0.1的独立性
检验,认为该市居民了解冰雪运动与性别有
关? 请说明理由。
附:χ2=
n(ad-bc)2
(a+b)(c+d)(a+c)(b+d)
,
其中,n=a+b+c+d。
表6
α 0.1000.0500.0100.005 0.001
xα 2.7063.8416.6357.879 10.828
解析:(1)由题意知,m=60×
2
3=40
,故
n=60-m=20,p=70-m=30,q=50-n=
30。所以m=40,n=20,p=30,q=30。
(2)能。理 由 如 下:由 题 意 知,χ2 =
120×(40×30-20×30)2
70×50×60×60 =
24
7 ≈3.429>
2.706。根据小概率值α=0.1的独立性检
验,认为该市居民了解冰雪运动与性别有关。
方法总结:
1.比较几个分类变量有关联的可能性大
小的方法。
(1)通过计算χ2 的大小判断,χ2 的值越
02
解题篇 经典题突破方法
高二数学 2024年6月
大,两个变量有关联的可能性越大。
(2)通过计算|ad-bc|的大小判断,
|ad-bc|的值越大,两个变量有关联的可能
性越大。
2.独立性检验的一般步骤。
(1)根据样本数据制成2×2列联表;
(2 ) 根 据 公 式 χ2 =
n(ad-bc)2
(a+b)(c+d)(a+c)(b+d)
计算χ2;
(3)比较χ2 的值与临界值xα 的大小关
系,作统计推断。
五、误差分析
例 9 某学校一同学研究温差x℃与
本校当天新增感冒人数y 的关系,该同学记
录了5天的数据如表7所示。
表7
x(℃) 5 6 8 9 12
y 17 20 25 28 35
经过拟合,发现基本符合经验回归方程
ŷ=2.6x+̂a,则( )。
A.样本中心点为(8,25)
B.̂a=4.2
C.当x=5时,残差为-0.2
D.若去掉样本点(8,25),则样本的相关
系数r增大
解析:x=
5+6+8+9+12
5 =8
,y=
17+20+25+28+35
5 =25
,所以样本中心点
为(8,25),则25=2.6×8+̂a,̂a=4.2,选项
A、B正确。则ŷ=2.6x+4.2,当x=5时,
ŷ=2.6×5+4.2=17.2,对应残差为17-
17.2=-0.2,所以选项 C正确。由于r=
∑
n
i=1
(xi-x)(yi-y)
∑
n
i=1
(xi-x)2·∑
n
i=1
(yi-y)2
,(x3,y3)=(8,
25)=(x,y),故x3-x=y3-y=0。若去掉
样本点(8,25),则样本的相关系数r不变,D
选项错误。故选ABC。
例 10 下列关于概率统计说法中正
确的是( )。
A.两个变量x,y 的相关系数为r,则
|r|越小,x 与y 之间的相关性越弱
B.设随机变量ξ服从正态分布N(0,1),
若P(ξ>1)=p,则P(-1<ξ<0)=1-2p
C.在回归分析中,R2 为0.99的模型比
R2 为0.88的模型拟合得更好
D.某人在10次答题中,答对题数为 X,
X~B(10,0.7),则答对7题的概率最大
解析:对于选项 A,两个变量x,y 的相
关系数为r,|r|越小,x 与y 之间的相关性越
弱,故A正确。对于选项B,因为P(ξ>1)=
p,所以P(-1<ξ<0)=P(0<ξ<1)=
1
2-
p,故B错误。对于选项C,R2 越接近1,模
型拟合越好,且0.99>0.88,故C正确。对
于选项D,因为X~B(10,0.7),所以数学期
望为10×0.7=7,说明答对7题的概率最大,
故D正确。故选ACD。
方法总结:
残差和相关指数的策略方法。
对于响应变量y,通过观测得到的数据
称为观测值yi,通过回归方程得到的ŷ 称为
预测值,观测值减去预测值等于残差,̂ei 称为
相应于点(xi,yi)的残差,即有êi=yi-̂yi。
残差是随机误差的估计结果,通过对残差的
分析可以判断模型刻画数据的效果以及判断
原始数据中是否存在可疑数据等,通过残差
平方和Q=∑
n
i=1
(yi-̂yi)2 分析,残差平方之和
越小,说明选用的模型的拟合效果越好;反
之,不合适。
纵观近几年高考的概率与统计试题,成
对数据的统计分析占有相当高的比重,而且
命题形式也逐步趋于平稳,注重落实《中国
高考评价体系》中四层四翼的考核要求。试
题命制背景多与生产生活实际紧密联系,文
字量大、信息多,对同学们的阅读理解能力、
信息获取能力和批判性思维能力有较高的
要求。因此,希望同学们在学习中注重提高
用数学概念、原理解读具体问题和提炼有用
信息的能力,强化运算求解能力和统计推断
思维。
(责任编辑 徐利杰)
12
解题篇 经典题突破方法
高二数学 2024年6月