内容正文:
相关系数、成对数据的线性分析
一、选择题:本题共6小题,每小题6分,共36分,在每小题给出的四个选项中,只有一项是符合题目要求的.
1.以下说法不正确的是( )
A.78,82,83,85,86,87,89,89的第75百分位数为88
B.相关系数的绝对值接近于0,两个随机变量没有相关性
C.的展开式中常数项为15
D.必然事件和不可能事件与任意事件相互独立
2.某团队尝试用回归模型甲、乙、丙、丁描述人的1000米跑步成绩与肺活量的关系,已知模型甲、乙、丙、丁对应的决定系数分别为0.14,0.17,0.72,0.45,则拟合效果最好的模型是( )
A.甲 B.乙 C.丙 D.丁
3.下列四组成对数据:①,,,,;②,,,,;③,,,,;④,,,,.其中样本相关系数最小的是( )(附:样本相关系数)
A.① B.② C.③ D.④
4.为了研究y关于x的线性相关关系,收集了5组样本数据(见下表).若已求得一元线性回归方程,则下列选项中正确的是( )
x
1
2
3
4
5
y
0.5
0.9
1
1.1
1.5
A.
B.x与y的样本是负相关
C.当时,y的预估值为2.2
D.去掉样本点后,x与y的样本相关系数r必会改变
5.变量x与y相对应的一组数据为,,,,;变量u与v相对应的一组数据为,,,,,表示变量y与x之间的线性相关系数,表示变量v与u之间的线性相关系数,则( )
A. B. C. D.
6.现有一组样本数据点,,,,则该组样本数据点的相关系数( )
A. B. C. D.1
二、选择题:本题共4小题.每小题6分.共24分.在每小题给出的选项中,有多项符合题目要求全部选对的得6分.部分选对的得部分分,有选错的得0分.
7.两个具有相关关系的变量x,y的一组数据为,,…,,其经验回归方程为,记,,决定系数为;若将数据调整为,,…,,其经验回归方程为,记,决定系数为,则( )
附:,,
A. B. C. D.
8.已知某区域的水源指标x与某种植物的分布数量y之间的数据如下表所示,则( )
x
10
20
30
40
50
y
23
45
60
78
94
附:相关系数
A.y与x的相关系数为正数
B.y与x的回归直线经过点
C.删去数据后,y与x的相关系数变小
D.增加数据后,y与x的相关系数不变
9.一组成对样本数据,,点位于一条直线附近,它的样本相关系数(其中,,由最小二乘法求得经验回归方程(其中),则( )
A.若,则
B.若,则成对数据的样本相关系数等于r
C.若,则成对数据的样本相关系数大于r
D.若,则成对数据的经验回归方程
10.由一组样本数据,利用最小二乘法得到两个变量的回归直线方程为,记,,则下面说法正确的是( )
A.直线至少经过点中的一个点
B.直线必经过点
C.样本相关系数r与回归系数同号
D.对样本相关系数r,越大,两个变量之间的线性相关性越强
三、填空题:本题共4小题,每小题5分,共20分.
11.为了比较甲、乙、丙、丁四组数据的线性相关性强弱,某同学分别计算了甲、乙、丙、丁四组数据的线性相关系数,求得的数值依次为,,0.36,0.93,则这四组数据中线性相关性最强的是___________组数据.
12.现调查某地区某种野生动物的数量,将该地区分成面积相近的200个地块,从这些地块中简单随机抽样的方法抽取20个作为样本,调查得到样本数据,其中,分别表示第i个样本的植物覆盖面积(单位:公顷)和这种野生动物的数量,构造向量,,其中,,并计算得,,,,,由选择性必修二教材中的知识,我们知道n对数据的相关系数,则上述数据的相关系数____________.
13.已知样本相关系数,则成对样本数据,,,,的相关系数为_____________.
14.甲、乙、丙各自研究两个随机变量的数据,若甲、乙、丙计算得到各自研究的两个随机变量的线性相关系数分别为,则这三人中,____________研究的两个随机变量的线性相关程度最高.
四、解答题:本题共1小题,共20分.解答应写出文字说明、证明过程或者演算步骤.
15.根据统计,某蔬菜基地西红柿亩产量的增加量y(百千克)与某种液体肥料每亩使用量x(千克)之间的对应数据的散点图,如图所示.
(1)依据数据散点图可以看出,可用线性回归模型拟合y与x的关系,请计算相关系数并加以说明(若,则线性相关程度很高,可用线性回归模型拟合);
(2)求y关于x的回归方程,并预测液体肥料每亩使用量为12千克时,西红柿亩产量的增加量约为多少?附:相关系数公式,回归方程中斜率和截距的最小二乘估计公式分别为:,.
1.答案:B参考答案
解析:对于A:因为,所以第75百分位数为,故A正确;
对于B:相关系数r的绝对值接近于0,表示两个变量之间几乎不存在线性相关关系,并不说明变量之间不存在其它相关关系,故B错误;
对于C:常数项为,故C正确;
对于D:由必然事件和不可能事件的定义,可得D正确.故选:B.
2.答案:C
解析:越大,模型的拟合效果越好,因为,所以模型丙拟合效果最好.故选:C.
3.答案:C
解析:对于①,数据均在上,故样本相关系数为1,
对于③,数据均在上,故样本相关系数为-1,
对于②,可看出其数据为正相关,故样本相关系数大于0,
对于④,显然所有数据无法落在某一个一次函数上,故,事实上,,其中,故,故,综上,样本相关系数最小的是③.故选:C
4.答案:A
解析:,,则样本中心点为,
对于A,由,得,A正确;
对于B,由,得x与y的样本是正相关,B错误;
对于C,当时,y的预估值为,C错误;
对于D,由相关系数公式知,去掉样本中心点后,x与y的样本相关系数r不会改变,D错误.故选:A
5.答案:C
解析:由变量x与y相对应的一组数据为,,,,,
可得变量y与x正相关,所以.而由变量u与v相对应的一组数据为,,,,,可知变量v与u负相关,所以,所以与的大小关系是.故选:C.
6.答案:D
解析:根据题意可知:这些样本数据点均在直线上,故,由直线的斜率为正,可知,所以.故选:D.
7.答案:BC
解析:,А错误;
的计算中,数据不变,也不变,所以不变,B正确;
,C正确;由于,变成了,,,从而,都不变,所以,D错误.故选:BC
8.答案:ABD
解析:对于A选项,因为y与x呈正相关,故相关系数为正数,A选项正确;
对于B选项,,,
样本中心点为,故y与x的回归直线经过样本中心点,B选项正确;
对于C选项,删去数据后,,,故的值不变,和的值也不变,故相关系数不变,C选项错误;
对于D选项,增加数据后,,,故的值不变,和的值也不变,故相关系数不变,D选项正确.故选:ABD.
9.答案:ABD
解析:当时,变量正相关,所以,故A正确;
因为,所以成对数据对应点相当于把成对数据对应的点向下平移2个单位,不改变变量的相关性,故B正确;
因为,则成对数据对应点相当于把成对数据对应的点横坐标不变,纵坐标变为原来的2倍,故变量间的相关性不变,故C错误;
当,由可知,新的回归直线方程中斜率变为,,则成对数据的经验回归方程,故D正确.
故选:ABD
10.答案:BCD
解析:回归直线是由点拟合而成的,可能不过任何一个样本点,但必过数据的中心点,A错误,B正确.
样本相关系数r为正时,两个变量为正相关,回归系数为正;样本相关系数r为负时,两个变量为负相关,回归系数为负.故样本相关系数r与回归系数同号,C正确.
样本相关系数,越大,两个变量之间的线性相关性越强,D正确.故选:BCD.
11.答案:甲
解析:因为值越接近1,随机变量之间的线性相关程度越强,且,所以甲组数据的线性相关性最强.
12.答案:
解析:由题干数据,,可得,,根据夹角公式的定义,,而,
根据
,
于是.故答案为:.
13.答案:
解析:因为,,
,
,
所以.故答案为:.
14.答案:甲
解析:由甲、乙、丙的两个随机变量的线性相关系数分别为,,,可得,所以这三人中,甲研究的两个随机变量的线性相关程度最高.
故答案为:甲.
15.答案:(1)答案见解析;
(2),9.9百千克.
解析:(1)因为,,
,
,,
因此相关系数,
所以可用线性回归模型拟合y与x的关系.
(2)由(1)知,,,
因此,当时,,
所以预测液体肥料每亩使用量为12千克时,西红柿亩产量的增加量约为9.9百千克.
学科网(北京)股份有限公司
$