内容正文:
第3节 成对数据的统计分析
第九章 统计与成对数据的统计分析
1.了解样本相关系数的统计含义.
2.了解一元线性回归模型和2×2列联表,会运用这些方法解决简单的实际问题.
课标要求
索引
内容索引
知识诊断自测
01
考点聚焦突破
02
03
课时对点精练
索引
3
知识诊断自测
01
1.变量的相关关系
(1)相关关系:若两个变量有关系,但又没有确切到可由其中的一个去精确地决定另一个的程度,这种关系称为相关关系;
(2)相关关系的分类:_________和_________;
(3)线性相关:如果两个变量的取值呈现正相关或负相关,而且散点落在____________附近,就称这两个变量线性相关.
正相交
负相关
一条直线
索引
5
2.样本相关系数
对于变量x和变量y,设经过随机抽样获得的成对样本数据为(x1,y1),(x2,y2),…,(xn,yn),若x与y存在线性相关关系,可用样本相关系数r定量分析它们的相关程度的强弱.
(1)样本相关系数r=;
索引
6
(2)样本相关系数r的性质
①当r>0时,称成对样本数据___相关;当r<0时,称成对样本数据___相关;当r=0时,称成对样本数据间没有线性相关关系;
②样本相关系数r的取值范围为__________________.当|r|越接近1时,成对样本数据的线性相关程度越___;当|r|越接近0时,成对样本数据的线性相关程度越___.
正
负
[-1,1]
强
弱
索引
7
3.一元线性回归模型
(1)经验回归方程为=x+,其中=_________________=_______________,
=________;
(2)通过求Q=(yi-bxi-a)2的最小值而得到经验回归直线的方法,即使得样本数据的点到回归直线的距离的平方和最小,这一方法叫做最小二乘法.
-
索引
8
4.判断回归模型的拟合效果
由成对样本数据(xi,yi)(i=1,2,…,n)按照最小二乘法得到经验回归方程x+,其中y叫做观测值,叫做预测值,残差=y-.相对于样本点(xi,yi)的随机误差=yi-=yi-(xi+).
(1)残差分析法
①作残差图:作图时纵坐标为______,横坐标可以选为样本编号,或xi数据,或yi数据,这样作出的图形称为残差图;
残差
索引
9
②残差分析:(ⅰ)定型分析:残差点比较均匀地落在水平的带状区域中,说明选用的模型比较合适,这样的带状区域的宽度越窄,说明模型拟合精度越高,经验回归方程的预报精度越高.
(ⅱ)定量分析:利用残差平方和,残差平方和越小,模型的拟合效果越好.
(2)决定系数(R2)法:R2=1-(其中yi).R2的值越趋近于1,模型的拟合效果越好.
索引
10
5.列联表与独立性检验
(1)关于分类变量X和Y的抽样数据的2×2列联表
X Y 合计
Y=0 Y=1
X=0 a b a+b
X=1 c d c+d
合计 a+c b+d n=a+b+c+d
记n=a+b+c+d,则随机变量χ2=.
索引
11
(2)独立性检验
基于小概率值α的检验规则是:
当χ2≥xα时,我们就推断H0不成立,即认为X和Y不独立,该推断犯错误的概率不超过α;
当χ2<xα时,我们没有充分证据推断H0不成立 ,可以认为X和Y独立.
下表给出了χ2独立性检验中几个常用的小概率值和相应的临界值
α 0.1 0.05 0.01 0.005 0.001
xα 2.706 3.841 6.635 7.879 10.828
索引
12
常用结论与微点提醒
1.求解经验回归方程的关键是确定回归系数,应充分利用回归直线过样本点的中心().
2.根据χ2的值可以判断两个分类变量有关的可信程度,若χ2越大,则两个分类变量有关的把握越大.
3.回归分析和独立性检验都是基于成对样本观测数据进行估计或推断,得出的结论都可能犯错误.
索引
13
1.思考辨析(在括号内打“√”或“×”)
(1)散点图是判断两个变量相关关系的一种重要方法和手段.( )
(2)经验回归直线x+至少经过(x1,y1),(x2,y2),…,(xn,yn)中的一个点.( )
(2)x+必过样本点中心(),但它可能不过任何一个样本点.
诊断自测 概念思考辨析+教材经典改编
√
×
索引
14
(3)样本相关系数的绝对值越接近1,成对样本数据的线性相关程度越强.( )
(4)事件X,Y关系越密切,则由观测数据计算得到的χ2的值越小.( )
(4)χ2的值越大,相关性越强,关系越密切.
×
√
索引
15
2.(人教B选修二P121T3原题)已知变量x和y满足关系y=-0.1x+1,变量y与z正相关.下列结论中正确的是( )
A.x与y负相关,x与z负相关
B.x与y正相关,x与z正相关
C.x与y正相关,x与z负相关
D.x与y负相关,x与z正相关
A
因为-0.1<0,所以x与y负相关,
又因为变量y与z正相关,所以x与z负相关.
索引
16
3.(苏教选修二P169T1改编)某小吃店的日盈利y(单位:百元)与当天平均气温x(单位:℃)之间有如下数据:
x/℃ -2 -1 0 1 2
y/百元 5 4 2 2 1
甲、乙、丙3位同学对上述数据进行了分析,发现y与x之间具有线性相关关系,下列回归方程正确的是( )
A.=-x+2.8 B.=-x+3
C.=-1.2x+2.6 D.=x-0.8
A
索引
17
计算得(-2-1+0+1+2)=0,
(5+4+2+2+1)=2.8,
回归直线必过(0,2.8),故只有A项满足.
索引
18
4.(人教A选修三P139T3改编)根据分类变量x与y的观测数据,计算得到χ2=3.974.依据α=0.05的独立性检验,结论为x与y________(填独立、不独立),这个结论犯错误的概率不超过____________.
附:
不独立
因为3.974>3.841,所以假设不成立,即认为x,y不独立,
这个结论犯错误的概率不超过0.05.
α 0.050 0.010 0.001
xα 3.841 6.635 10.828
0.05
索引
19
考点聚焦突破
02
20
例1 (1)(2026·西安质检)如图所示的散点图中,两个变量的相关关系为正相关的是( )
D
考点一 成对数据的相关性
图象上升时,两变量为正相关,选项D符合题意.
索引
(2)在一组样本数据(x1,y1),(x2,y2),…,(xn,yn)(n≥2,x1,x2,…,xn不全相等)的散点图中,若所有样本点(xi,yi)(i=1,2,…,n)都在直线y=-x+1上,则这组样本数据的样本相关系数为( )
A.-1 B.0
C.- D.1
A
因为样本点都在直线y=-x+1上,呈现完全负相关,样本相关系数为-1.
索引
感悟提升
判定两个变量相关性的方法
(1)画散点图:若点的分布从左下角到右上角,则两个变量正相关;若点的分布从左上角到右下角,则两个变量负相关.
(2)样本相关系数:当r>0时,正相关;当r<0时,负相关;|r|越接近1,线性相关性越强.
(3)经验回归方程:当>0时,正相关;当<0时,负相关.
索引
训练1 (1)(2024·上海卷)已知沿海地区气温和海水表层温度相关,且样本相关系数为正数,对此描述正确的是( )
A.沿海地区气温高,海水表层温度就高
B.沿海地区气温高,海水表层温度就低
C.随着沿海地区气温由低到高,海水表层温度呈上升趋势
D.随着沿海地区气温由低到高,海水表层温度呈下降趋势
C
因为沿海地区气温和海水表层温度相关,且样本相关系数为正数,
所以随着沿海地区气温由低到高,海水表层温度呈上升趋势,故选C.
索引
(2)为了比较甲、乙、丙、丁四组数据的线性相关程度的强弱,小明分别计算了甲、乙、丙、丁四组数据的样本相关系数,其数值分别为-0.95,-0.87,0.76,0.92,则这四组数据中线性相关程度最强的是____________组数据.
甲
r绝对值越大,线性相关程度越强.
索引
1.教材母题 (1)(人教A选修三P101例2)有人收集了某城市居民年收入(所有居民在一年内收入的总和)与A商品销售额的10年数据,如表所示.
相关系数与散点图的联系 教考衔接
第n年 1 2 3 4 5 6 7 8 9 10
居民年收
入/亿元 32.2 31.1 32.9 35.8 37.1 38.0 39.0 43.0 44.6 46.0
A商品销
售额/万元 25.0 30.0 34.0 37.0 39.0 41.0 42.0 44.0 48.0 51.0
画出散点图,推断成对样本数据是否线性相关,并通过样本相关系数推断A商品销售额与居民年收入的相关程度和变化趋势的异同.
索引
(2)(湘教选修二P166T1)对四组数据进行统计,获得以下散点图(如图),将四组数据相应的相关系数进行比较,正确的有( )
A.r2<r4<0<r3<r1
B.r4<r2<0<r1<r3
C.r4<r2<0<r3<r1
D.r2<r4<0<r1<r3
索引
2.散点图与样本相关系数在反映两个随机变量之间的线性相关关系及相关程度时具有相同的作用:r的符号反映了相关关系的正负性,在散点图中则表现为上升或下降;|r|的大小反映了线性相关的强弱程度,在散点图中的表现为数据点集中于一条直线附近的程度.
索引
典例 (2024·天津卷)下列图中,线性相关系数最大的是( )
A
索引
选项A中的散点有明显的从左下角到右上角沿直线分布的趋势,且散点集中在一条直线的附近,故选项A中的线性相关系数最大.
索引
角度1 线性回归分析
例2 (2026·新乡模拟)氮氧化物是一种常见的大气污染物,如图为我国2015年至2023年氮氧化物排放量(单位:万吨)的折线图,其中年份代码1~9分别对应年份2015~2023.
考点二 回归分析
已知yi≈12 000,≈1 100,≈7.7,tiyi≈51 800.
索引
(1)可否用一元线性回归模型拟合y与t的关系?请分别根据折线图和样本相关系数加以说明;
从折线图看,各点落在一条直线附近,因而可以用线性回归模型拟合y与t的关系,由题意知×(1+2+3+4+5+6+7+8+9)=5,
样本相关系数r=≈≈-0.97.
故可以用线性回归模型拟合y与t的关系.
索引
(2)若根据所给数据建立经验回归方程=-138t+2 026,可否用此方程来预测2026年和2036年我国的氮氧化物排放量?请说明理由.
附:样本相关系数r=.
可以预测2026年的氮氧化物排放量,但不可以预测2036年的氮氧化物排放量.
理由如下:
①2026年与所给数据的年份较接近,因而可以认为短期内氮氧化物排放量将延续该趋势,故可以用此模型进行预测;
索引
②2036年与所给数据的年份相距过远,而影响氮氧化物排放量的因素有很多,这些因素在短期内可能保持不变,但从长期看很有可能会变化,因而用此模型预测可能是不准确的.
索引
角度2 非线性回归分析
例3 “绿水青山是金山银山”的理念推动了新能源汽车产业的迅速发展.以下表格和散点图反映了近几年某新能源汽车的年销售量情况.
年份 2021 2022 2023 2024 2025
年份代码x 1 2 3 4 5
某新能源汽车年销售量y/万辆 1.5 5.9 17.7 32.9 55.6
索引
(1)请根据散点图判断,y=bx+a与y=cx2+d中哪一个更适宜作为年销售量y关于年份代码x的回归方程类型,并比较两个模型的残差平方和大小;(给出判断即可,不必说明理由)
根据散点图可知,y=cx2+d更适宜作为年销售量y关于年份代码x的回归方程类型,y=cx2+d比y=bx+a的残差平方和小.
索引
(2)根据(1)的判断结果及表中数据,建立y关于x的经验回归方程,并预测2027年该新能源汽车的年销售量.(精确到0.1)
参考数据:=22.72,(wi-)2=374,(wi-)(yi-)=851.2(其中wi=).
令w=x2,则w+.易知=11,≈2.28,
≈22.72-2.28×11=-2.36,所以=2.28w-2.36,
所以y关于x的经验回归方程为=2.28x2-2.36.
令x=7,得=109.36≈109.4.
故预测2027年该新能源汽车的年销售量为109.4万辆.
索引
感悟提升
1.求线性经验回归方程
(1)当两个系数均未知时,可利用公式法求解;
(2)当两个系数已知一个求另一个时,可利用经验回归直线过样本点的中心求解.
索引
感悟提升
2.非线性经验回归方程转化为线性经验回归方程的方法
(1)若=a+b,设t=,则=a+bt;
(2)若满足对数式:=a+bln x,设t=ln x,则=a+bt;
(3)若满足指数式:=c1,两边取对数得ln =ln c1+c2x,设z=ln ,a=ln c1,b=c2,则z=a+bx.
3.模型拟合效果的好坏可由残差平方和、残差图、决定系数R2等进行判断.
索引
训练2 (1)(2026·山东三市诊断)已知变量x,y线性相关,其一组样本数据(xi,yi)
(i=1,2,…,9)满足xi=33,用最小二乘法得到的经验回归方程为=2x-1.若增加一个数据(-3,3),得到修正后的经验回归直线的斜率为2.1,则数据(4,8)的残差的绝对值为( )
A.0.1 B.0.2
C.0.3 D.0.4
A
由题意得,
所以=2-1=2×-1=.
索引
增加数据(-3,3)后,
'==3,'==6.
设增加数据(-3,3)后的经验回归方程为
=2.1x+,则6=2.1×3+,得=-0.3,
所以修正后的经验回归方程为=2.1x-0.3.
当x=4时,=2.1×4-0.3=8.1,
故数据(4,8)的残差的绝对值为|8-8.1|=0.1.
索引
(2)已知变量y关于变量x的非线性经验回归方程为ln x+0.24,其一组数据如表所示:
x e e3 e4 e6 e7
y 1 2 3 4 5
若x=e10,则y的值大约为( )
A.4.94 B.5.74
C.6.81 D.8.04
C
索引
由ln x+0.24,令t=ln x,
则t+0.24,
由题意易得=4.2,=3,
所以3=×4.2+0.24,
解得≈0.657,所以=0.657ln x+0.24,
若x=e10,解得=6.81.
索引
例4 (2025·新高考Ⅰ卷)为研究某疾病与超声波检查结果的关系,从做过超声波检查的人群中随机调查了1 000人,得到如下列联表:
考点三 独立性检验
组别 超声波检查结果 合计
正常 不正常
患该疾病 20 180 200
未患该疾病 780 20 800
合计 800 200 1 000
索引
(1)记超声波检查结果不正常者中患有该疾病的概率为p,求p的估计值;
由题表可知,检查结果不正常者有200人,检查结果不正常者中患有该疾病的有180人,
所以由样本估计总体得p==0.9.
索引
(2)根据小概率值α=0.001的独立性检验,分析超声波检查结果是否与患该疾病有关.
附:χ2=,
α 0.050 0.010 0.001
xα 3.841 6.635 10.828
零假设H0:超声波检查结果与是否患该疾病无关.
χ2==765.625>10.828=x0.001,
索引
所以依据小概率值α=0.001的独立性检验,我们推断H0不成立,
即认为超声波检查结果与是否患该疾病有关.
索引
感悟提升
独立性检验的一般步骤
(1)根据样本数据制成2×2列联表.
(2)根据公式χ2=计算.
(3)比较χ2与临界值的大小关系,作统计推断.
索引
训练3 (1)为了研究性别与对乡村音乐态度(喜欢和不喜欢两种态度)的关系,运用2×2列联表进行独立性检验,经计算χ2=8.01,则“性别与喜欢乡村音乐有关系”这个推断犯错误的概率不超过(参考数据:x0.005=7.879,x0.001=10.828)( )
A.0.1% B.0.5%
C.99.5% D.99.9%
B
因为χ2=8.01>7.879=x0.005,所以“性别与喜欢乡村音乐有关系”这个推断犯错误的概率不超过0.5%.
索引
(2)(多选)(2026·济南模拟)为了验证牛的毛色(黑色、红色)和角(有角、无角)这两对相对性状是否相关,某学院进行了一次数据统计,并根据形成的2×2列联表,计算得到χ2≈2.727,根据小概率值为α的独立性检验,下列说法正确的是( )
附:
BC
α 0.100 0.050 0.010
xα 2.706 3.841 6.635
索引
A.若α=0.100,则认为“毛色”和“角”无关
B.若α=0.100,则认为“毛色”和“角”有关,此推断犯错误的概率不超过10%
C.若α=0.010,则认为“毛色”和“角”无关
D.若α=0.010,则认为“毛色”和“角”有关,此推断犯错误的概率不超过1%
零假设为H0:“毛色”和“角”之间无关联.
因为χ2≈2.727>2.706,所以根据小概率值α=0.100的独立性检验,推断H0不成立,即认为“毛色”和“角”之间有关联,此推断犯错误的概率不超过10%,A错误;B正确.
因为χ2≈2.727<6.635,所以根据小概率值α=0.010的独立性检验,没有充分证据推断H0不成立,
因此可认为“毛色”和“角”之间无关联,C正确,D错误.
索引
课时对点精练
03
一、单选题
1.某机构为调查网游爱好者是否有性别差异,通过调研数据统计:在500名男生中有200名爱玩网游,在400名女生中有50名爱玩网游.若要确定网游爱好是否与性别有关时,用下列最适合的统计方法是( )
A.均值 B.方差
C.独立性检验 D.回归分析
C
由题意可知,“爱玩网游”与“性别”是两类变量,其是否有关,应用独立性检验判断.
1
2
3
4
5
6
7
8
9
10
11
12
索引
13
14
2.(2023·天津卷)调查某种群花萼长度和花瓣长度,所得数据如图所示,其中相关系数r=0.824 5,下列说法正确的是( )
C
A.花瓣长度和花萼长度没有相关性
B.花瓣长度和花萼长度呈负相关
C.花瓣长度和花萼长度呈正相关
D.若从样本中抽取一部分,则这部分的相关系数一定是0.824 5
1
2
3
4
5
6
7
8
9
10
11
12
索引
13
14
因为相关系数r=0.824 5>0.75,所以花瓣长度和花萼长度的相关性较强,并且呈正相关,所以A,B错误,C正确;
因为相关系数与样本的数据有关,所以当样本发生变化时,相关系数也会发生变化,所以D错误.
1
2
3
4
5
6
7
8
9
10
11
12
索引
13
14
3.甲、乙、丙、丁四位同学各自对A,B两个变量的线性相关性做试验,并用回归分析方法分别求得样本相关系数r与残差平方和m,如下表:
D
则哪位同学的试验结果体现A,B两个变量有更强的线性相关性?( )
A.甲 B.乙
C.丙 D.丁
r的绝对值越大,m越小,线性相关性越强.
甲 乙 丙 丁
r 0.82 0.78 0.69 0.85
m 106 115 124 103
1
2
3
4
5
6
7
8
9
10
11
12
索引
13
14
4.(2026·成都诊断)假设有两个分类变量X和Y,它们的取值分别为{x1,x2}和{y1,y2},其2×2列联表如下:
X Y 合计
y1 y2
x1 a b a+b
x2 c d c+d
合计 a+c b+d a+b+c+d
1
2
3
4
5
6
7
8
9
10
11
12
索引
13
14
对同一样本,以下数据能说明X与Y有关联关系可能性最大的一组为( )
A.a=9,b=3,c=2,d=1
B.a=9,b=2,c=3,d=1
C.a=2,b=3,c=1,d=9
D.a=3,b=1,c=2,d=9
D
根据χ2的计算公式及a+b+c+d=15可得,当n相等时,|ad-bc|越小,说明X与Y之间的关系越弱;|ad-bc|越大,说明X与Y之间的关系越强,经过逐一验证,可知选D.
1
2
3
4
5
6
7
8
9
10
11
12
索引
13
14
5.某科研机构为了研究中年人秃发与患心脏病是否有关,随机调查了一些中年人的情况,具体数据如表:
A
患心脏病 无心脏病
秃发 20 300
不秃发 5 450
根据表中数据得到χ2≈15.968,因为χ2>10.828,则断定中年人秃发与患心脏病有关系.那么这种判断出错的可能性为( )
A.0.001 B.0.05 C.0.025 D.0.01
因为χ2>10.828=x0.001,因此判断出错的可能性为0.001,故选A.
1
2
3
4
5
6
7
8
9
10
11
12
索引
13
14
6.某兴趣小组研究光照时长x(h)和向日葵种子发芽数量y(颗)之间的关系,采集5组数据,作如图所示的散点图.若去掉D(10,2),则下列说法正确的是( )
D
A.相关系数r变小
B.决定系数R2变小
C.残差平方和变大
D.解释变量x与预报变量y的相关性变强
可知点D偏离程度较大,去掉点D后,相关系数r变大,决定系数R2变大,残差平方和变小,解释变量x与预报变量y的相关性变强.故选D.
1
2
3
4
5
6
7
8
9
10
11
12
索引
13
14
7.设两个相关变量x和y分别满足表:
B
若相关变量x和y可拟合为非线性经验回归方程=2bx+a,则当x=6时,y的估计值为( )
附:对于一组数据(u1,v1),(u2,v2),…,(un,vn),其经验回归直线u的斜率和截距的最小二乘估计公式分别为,
;1.155≈2.
x 1 2 3 4 5
y 1 2 8 8 16
A.33 B.37 C.65 D.73
1
2
3
4
5
6
7
8
9
10
11
12
索引
13
14
因为非线性经验回归方程为=2bx+a,
则有log2=bx+a,令log2,即x+,
列出相关变量x,y,v关系如表:
x 1 2 3 4 5
y 1 2 8 8 16
v 0 1 3 3 4
所以xivi=0+2+9+12+20=43,
=3,,
1
2
3
4
5
6
7
8
9
10
11
12
索引
13
14
=1+4+9+16+25=55,所以=1,
所以-3=-,
所以=x-,
即log2=x-,即,
因为1.155≈2,所以≈1.15,
当x=6时,=25.2=25×≈32×1.15=36.8≈37.
1
2
3
4
5
6
7
8
9
10
11
12
索引
13
14
二、多选题
8.根据如图所示的等高堆积条形图,下列叙述正确的是( )
ABC
A.吸烟患肺病的频率约为0.2
B.吸烟不患肺病的频率约为0.8
C.不吸烟患肺病的频率小于0.05
D.吸烟与患肺病无关系
从等高堆积条形图中可以明显地看出,吸烟患肺病的频率远远大于不吸烟患肺病的频率.所以吸烟与患肺病有关,D错误;由题图得,A,B,C都正确.
1
2
3
4
5
6
7
8
9
10
11
12
索引
13
14
9.(2026·武汉调研)某科技公司统计了一款APP最近5个月的下载量如表所示,若y与x线性相关,且经验回归方程为=-0.6x+,则( )
ACD
月份编号x 1 2 3 4 5
下载量y/万次 5 4.5 4 3.5 2.5
A.y与x负相关
B.=5.6
C.预测第6个月的下载量是2.1万次
D.残差绝对值的最大值为0.2
1
2
3
4
5
6
7
8
9
10
11
12
索引
13
14
因为=-0.6x+中x的系数-0.6<0,所以y与x负相关,A正确;
因为(1+2+3+4+5)÷5=3,
(5+4.5+4+3.5+2.5)÷5=3.9,
所以将(3,3.9)代入=-0.6x+,
得3.9=-0.6×3+=5.7,B错误;
将x=6代入=-0.6x+5.7,
得=2.1,
所以预测第6个月的下载量是2.1万次,C正确;
1
2
3
4
5
6
7
8
9
10
11
12
索引
13
14
如表,由表可知残差绝对值的最大值为0.2,D正确.
月份编号x 1 2 3 4 5
下载量y/万次 5 4.5 4 3.5 2.5
下载量预测值z/万次 5.1 4.5 3.9 3.3 2.7
残差绝对值 0.1 0 0.1 0.2 0.2
1
2
3
4
5
6
7
8
9
10
11
12
索引
13
14
三、填空题
10.(2026·湖北起点考试)已知某种商品的广告费x(单位:万元)与销售额y(单位:万元)之间的对应数据如下表:
66
x 1 3 4 5 7
y 14 18 30 42 46
根据表中数据得到y关于x的经验回归方程为=6x+,则当广告费为10万元时,预测销售额为____________万元.
1
2
3
4
5
6
7
8
9
10
11
12
索引
13
14
由题表可知,×(1+3+4+5+7)=4,×(14+18+30+42+46)=30,
将(4,30)代入=6x+,得=30-6×4=6,
故=6x+6.
当x=10时,=6×10+6=66,
故预测销售额为66万元.
1
2
3
4
5
6
7
8
9
10
11
12
索引
13
14
11.已知x和y的散点图如图所示,在相关关系中,若用=c1拟合时的决定系数为,用x+拟合时的决定系数为,则中较大的是_______.
由散点图知,用=c1拟合的效果比
x+拟合的效果要好,
所以>,故较大者为.
1
2
3
4
5
6
7
8
9
10
11
12
索引
13
14
12.下表是关于某设备的使用年限x(单位:年)和所支出的维修费用y(单位:万元)的统计表.
x 2 3 4 5 6
y 3.4 4.2 5.1 5.5 6.8
由表可得经验回归方程为=0.81x+,若规定:维修费用y不超过10万元,一旦大于10万元时,该设备必须报废.据此模型预测,该设备使用年限的最大值约为____________.
1
2
3
4
5
6
7
8
9
10
11
12
索引
13
14
由表格,得×(2+3+4+5+6)=4,×(3.4+4.2+5.1+5.5+6.8)=5,
因为经验回归直线恒过点(),
所以5=0.81×4+,解得=1.76,
所以经验回归方程为=0.81x+1.76,
由y≤10,得0.81x+1.76≤10,解得x≤≈10.17,
由于x∈N*,所以据此模型预测,
该设备使用年限的最大值约为10.
1
2
3
4
5
6
7
8
9
10
11
12
索引
13
14
四、解答题
13.(2022·全国乙卷)某地经过多年的环境治理,已将荒山改造成了绿水青山.为估计一林区某种树木的总材积量,随机选取了10棵这种树木,测量每棵树的根部横截面积(单位:m2)和材积量(单位:m3),得到如下数据:
并计算得=0.038,=1.615 8,xiyi=0.247 4.
样本号i 1 2 3 4 5 6 7 8 9 10 总和
根部横截
面积xi 0.04 0.06 0.04 0.08 0.08 0.05 0.05 0.07 0.07 0.06 0.6
材积量yi 0.25 0.40 0.22 0.54 0.51 0.34 0.36 0.46 0.42 0.40 3.9
1
2
3
4
5
6
7
8
9
10
11
12
索引
13
14
(1)估计该林区这种树木平均一棵的根部横截面积与平均一棵的材积量;
样本中10棵这种树木的根部横截面积的平均值=0.06(m2),
样本中10棵这种树木的材积量的平均值=0.39(m3),
据此可估计该林区这种树木平均一棵的根部横截面积为0.06 m2,平均一棵的材积量为0.39 m3.
1
2
3
4
5
6
7
8
9
10
11
12
索引
13
14
(2)求该林区这种树木的根部横截面积与材积量的样本相关系数(精确到0.01);
r==
=
=≈≈0.97.
1
2
3
4
5
6
7
8
9
10
11
12
索引
13
14
(3)现测量了该林区所有这种树木的根部横截面积,并得到所有这种树木的根部横截面积总和为186 m2.已知树木的材积量与其根部横截面积近似成正比.利用以上数据给出该林区这种树木的总材积量的估计值.
附:相关系数r=,≈1.377.
设该林区这种树木的总材积量的估计值为Y m3,
又已知树木的材积量与其根部横截面积近似成正比,可得,
解得Y=1 209.则该林区这种树木的总材积量估计为1 209 m3.
1
2
3
4
5
6
7
8
9
10
11
12
索引
13
14
14.(2024·上海卷改编)为了解某地初中学生体育锻炼时长与学业成绩的关系,从该地区29 000名学生中随机抽取580人,得到日均体育锻炼时长(单位:小时)与学业成绩的数据如表所示:
学业
成绩 日均体育锻炼时长/小时
[0,0.5) [0.5,1) [1,1.5) [1.5,2) [2,2.5]
优秀 5 44 42 3 1
不优秀 134 147 137 40 27
1
2
3
4
5
6
7
8
9
10
11
12
索引
13
14
(1)该地区29 000名学生中日均体育锻炼时长不小于1小时的人数约为多少?
抽取的样本中日均体育锻炼时长不小于1小时的人数为42+3+1+137+40+27=250.
设该地区29 000名学生中有x人的日均体育锻炼时长不小于1小时,则,解得x=12 500.
故该地区29 000名学生中日均体育锻炼时长不小于1小时的人数约为12 500.
1
2
3
4
5
6
7
8
9
10
11
12
索引
13
14
(2)估计该地区初中学生日均体育锻炼时长(精确到0.1小时);
依题意得,该地区初中学生日均体育锻炼时长为(0.25×139+0.75×191+1.25×179+1.75×43+2.25×28)÷580=540÷580≈0.9.
所以该地区初中学生日均体育锻炼时长约为0.9小时.
1
2
3
4
5
6
7
8
9
10
11
12
索引
13
14
(3)依据小概率值α=0.05的独立性检验能否认为学业成绩优秀与日均体育锻炼时长不小于1小时且小于2小时有关?
附:χ2=,n=a+b+c+d,(x0.05=3.841).
对数据重新组合,得到2×2列联表
学业成绩 日均体育锻炼时长/小时
[1,2) 其他 合计
优秀 45 50 95
不优秀 177 308 485
合计 222 358 580
1
2
3
4
5
6
7
8
9
10
11
12
索引
13
14
提出原假设H0:学业成绩优秀与日均体育锻炼时长不小于1小时且小于2小时无关.
χ2=≈3.976>3.841=x0.05,
我们推断H0不成立,即认为学业成绩优秀与日均体育锻炼时长不小于1小时且小于2小时有关,该推断犯错误的概率不超过0.05.
1
2
3
4
5
6
7
8
9
10
11
12
索引
13
14
$