内容正文:
4.2 大数据处理的基本思想与架构
1. 大数据按照类型和处理方式划分袁下列错误的是 渊 冤
A. 静态数据院批处理 B. 流数据院流计算
C. 图数据院图计算 D. 半结构化数据院电子表格
2. 咱2023窑杭州测试暂下列关于大数据及其架构与处理的说法袁正确的是 渊 冤
A. 存储 6626亿部叶红楼梦曳袁需要 1EB的空间袁所以这个数据量就是大数据
B. 处理大数据的基本思路是并行处理
C. 文本是非结构化数据袁其处理过程主要包括院分词尧特征提取尧数据分析尧结果呈现等
D. 分布式文件系统 HBase是一个高度容错性的系统袁适合部署在廉价的机器上
3. 下列不是 HDFS优点的是 渊 冤
A. 高容错性 B. 适合单线程处理
C. 适合大数据处理 D. 流式文件访问
4. 应用分治法的两个前提是 渊 冤
A. 问题的可分性和解的可归并性 B. 问题的可分性和解的复杂性
C. 问题的可分性和解的存在性 D. 问题的复杂性和解的可归并性
5. HDFS和 MapReduce作为 Hadoop的核心组件袁下列对它们的描述错误的是 渊 冤
A. HDFS是具有高容错性的分布式文件系统袁适合部署在普通的机器上
B. HDFS特别适合那些需要多次写入尧多次读取的超大规模数据集的应用程序
C. MapReduce是一种并行编程模型袁帮助用户编写处理大规模数据集的并行运算
D. MapReduce隐藏了分布式并行编程的底层实现细节袁提升了应用的开发效率
6. 以下描述的场景与处理方法使用不恰当的是 渊 冤
A. 分析去年的地铁客流数据优化地铁运行采用批处理计算
B. 淘宝野双十一冶通过实时分析用户行为实现商品的推荐采用流计算
C. 图计算为腾讯超大规模社交网络图数据的各类计算提供支撑
D. 分析近十年高考的数学试卷梳理常考知识点采用流计算
7. 下列关于分布式系统架构 Hadoop及其主要模块的说法袁不正确的是 渊 冤
A. Hadoop计算平台适用于静态数据的批处理计算
B. 分布式文件系统 HDFS是一个高度容错性系统袁可以部署在普通计算机上
C. 分布式数据库 HBase主要用来存储结构化数据
D. MapReduce是一种并行编程模型袁帮助用户编写处理大规模数据集的并行运算
8. 在数据量一定的情况下袁MapReduce是一个线性可扩展模型袁服务器数量与处理时间之间的
关系是 渊 冤
A. 数量越多处理时间越长 B. 数量越多处理时间越短
C. 数量越小处理时间越短 D. 没什么关系
143
4.3 利用 pandas模块处理数据
1. 下列关于 pandas的描述袁不正确的是 渊 冤
A. 不能用于金融数据分析
B. 是基于 numpy扩展而来的第三方库
C. 能够高效地进行时间序列分析
D. 是用于数据分析的第三方库
2. 某 DataFrame对象 score包含野准考证号冶野学校名称冶野姓名冶野总分冶野排名冶等数据列袁下列语句
中袁可以以学校为单位袁输出各校学生野总分冶平均值的是 渊 冤
A. print(score.groupby("学校名称",as_index=False).mean())
B. print(score.groupby("总分",as_index=False).mean())
C. print(score.groupby("学校名称",as_index=False).排名.mean())
D. print(score.sort_index("学校名称",as_index=False).describe())
3. 不能实现选取 df对象前 5行数据记录的语句是 渊 冤
A. df.head() B. df.head(5) C. df咱0:5暂 D. df咱5暂
4. 在 Python中创建了一个 DataFrame对象 df1遥
import pandas as pd
data={"姓名":咱"甲","乙","丙"暂,"性别":咱"男","女","男"暂,"身高":咱175,156,180暂}
df1=pd.DataFrame(data,columns=咱"姓名","性别",身高"暂)
以下操作描述错误的是 渊 冤
A. print(df1咱"姓名"暂)将显示姓名列的数据
B. print(df1.身高冤将显示身高列的数据
C. print(df1.head())将显示甲同学的数据
D. print(df1咱df1.身高<160暂)将显示乙同学的数据
5. 野data.csv冶文件中依次包含有野姓名冶野学号冶野性别冶野借阅次数冶等字段尧若干个数据行袁执行下
列 Python程序段后袁输出数据将 渊 冤
import pandas as pd #第 1行
stu_df=pd.read_csv("dat