内容正文:
高效作业18[第18课 文本数据处理 数据可视化]
【A级 新教材落实与巩固】
1.下列数据处理中,不属于文本数据处理的是( D )
A.将中文翻译成其他国家的文字
B.解析大量合同文档,有效监控风险条款,节省人力和时间成本
C.检测的论文内容与对比库中的资料进行对比,检测论文可信度
D.输入姓名、单位等信息,制作通讯录
【解析】 输入姓名、单位等信息,制作通讯录,属于将文本输入计算机系统,并非处理。选项D符合题意。
2.下列关于文本数据处理的说法中,正确的是( C )
A.文本数据处理不能应用在自动校对方面
B.英文词语与词语之间有明显的空格,因此不需要进行分词就可以直接进行数据分析
C.文本数据处理可以处理非结构化的数据
D.用词频统计的结果作为特征词,进行特征提取,不需要基于大量数据
【解析】 文本数据属于非结构化的数据,文本数据处理可以从文本中提取有用信息进行分析,选项C正确。
3.2024·浙南名校联盟检测下列关于大数据处理的说法中,正确的是( D )
A.jieba模块是基于规则的分词方法的典型应用
B.典型的文本处理过程为:数据分析→分词→特征提取→结果呈现
C.社交关系数据一般采用流计算模式进行处理
D.数据可视化是将数据以图形图像等形式表示,直观呈现数据中所蕴含的信息
【解析】 选项A,jieba模块是基于词典的分词方法的典型应用,选项错误;选项B,典型的文本处理过程为:分词→特征提取→数据分析→结果呈现,选项错误;选项C,社交关系数据一般采用图计算模式进行处理,选项错误。
4.下图是文本数据处理分析后生成的标签云图片,下列说法不正确的是( C )
A.标签云用词频来表现文本特征
B.该数据集中词语“beautiful”比“拼搏”出现的频率高
C.只能制作中文和英文混合的标签云
D.“思考”“beautiful”“拼搏”等词是该文本的重点词汇
【解析】 能制作中文、英文、中文和英文混合的标签云,选项C错误。
5.借助软件进行创建的关于某城市的介绍的标签云如图所示。其中用作文本的特征项的是( B )
A.字 B.词 C.句子 D.段落
【解析】 标签云用词频表现文本特征,所以用作文本的特征项的是词,选项B正确。
6.位置信息也是智能交通的重要数据,其主要来源是( B )
A.网络爬虫 B.卫星定位
C.视频监控 D.传感器
【解析】 获取位置信息需要进行卫星定位,选项B正确。
7.某公司在全国有六大营业区,下列哪种图表可以最清晰地展现各大营业区“季度销售额”占比( D )
A.地图 B.雷达图
C.折线图 D.饼图
【解析】 用于显示各数据的比例关系的是饼图,选项D正确。
8.下列关于大数据处理的说法中,不正确的是( B )
A.处理大数据时,一般采用分治思想
B.对图结构的数据一般采用流计算模式进行处理
C.文本数据处理时需要将非结构化的文本原始状态转化成结构化数据
D.数据的可视化可以帮助用户更快捷地观察与追踪数据
【解析】 对图结构的数据一般采用图计算模式进行处理,选项B错误。
9.下列关于数据可视化的说法中,不正确的是( A )
A.标签云是基于语句的文本内容可视化
B.数据可视化是将数据以图形图像等形式表示
C.数据可视化可以直观地呈现数据中蕴含的信息
D.数据可视化增强了数据的解释力与吸引力
【解析】 标签云用词频表现文本特征,选项A错误。
10.下列选项中,不属于大数据的典型应用的是( D )
A.基于交易大数据分析用户的购买习惯
B.基于搜索引擎的搜索关键词分析社会热点
C.基于道路摄像头、地感线圈等数据分析城市交通情况
D.基于科技文献数据库检索某一领域研究进展
【解析】 常规数据库检索不属于大数据,选项D错误。
11.下列属于大数据应用的是( B )
①电商平台的精准推送 ②导航最优规划
③交通管理系统优化红绿灯配时
A.①③ B.①②③
C.②③ D.①②
【解析】 每项都属于大数据,选项B正确。
12.2024·东阳中学检测下列关于大数据的典型应用的说法中,不正确的是( D )
A.大数据经过合适的处理方式,能获得更高的数据价值
B.在金融行业利用大数据,可以评估用户信用等级
C.保险行业可利用大数据进行欺诈行为分析和精细化运营
D.大数据的应用只能让我们了解事物的现状,不能预测未来
【解析】 大数据的应用只能让我们了解事物的现状,可以根据数据预测未来,选项D错误。
【B级 素养形成与评价】
13.下列关于大数据及其处理的说法中,正确的是( D )
A.大数据体量规模巨大,可以抽取价值密度高的样本进行分析
B.大数据价值密度低,泄露个人信息不会造成安全问题
C.大数据产生速度快,实时生成的大数据无法与批处理整合处理
D.文本数据处理在情报分析、垃圾邮件过滤、机器翻译等方面有重要应用
【解析】 选项A,大数据体量规模巨大的特征描述正确,但不能抽样分析,需要分析全体数据,选项错误;选项B,大数据的价值密度低,但泄露个人信息也会造成安全问题,选项错误;选项C,大数据产生速度快,实时产生的数据也能与静态数据的批处理协同完成,选项错误。
14.下列关于大数据处理、数据可视化的说法中,不正确的是( C )
A.静态数据是指处理时已收集完成、计算时不会发生改变的数据
B.流数据主要是指不间断地、持续地到达的实时数据
C.图计算是指有关大量图片的计算
D.“各省生产总值占比情况”可以采用饼图或环形图呈现
【解析】 图计算处理的数据是以图的形式呈现或则可以转换为图,不是关于大量图片的计算,选项C错误。
15.下列说法正确的是( C )
A.HDFS是一个容错性较低的系统,适合部署在廉价的机器上
B.MapReduce是一种聚合式的并行编程模型
C.Twitter架构实现了批处理系统与流计算在一个平台架构下的整合
D.标签云是通过给特征词赋予权重进行统计分析的
【解析】 选项A,HDFS是一个高度容错性的系统,选项错误;选项B,MapReduce是一种分布式的并行编程模型,选项错误;选项D,标签云用词频表现文本特征,选项错误。
16.下列关于中文分词方法的描述中,属于基于统计的分词方法的是( B )
A.在分析句子时与词典中的词语进行对比,词典中出现的就划分为词
B.依据上下文中相邻字出现的频率统计,同时出现的次数越高就越可能组成一个词
C.让计算机模拟人的理解方式,根据大量的现有资料和规则进行学习,然后分词
D.依据词语与词语之间的空格进行分词
【解析】 选项A,属于基于词典的分词方法,选项错误;选项C,属于基于规则的分词方法,选项错误;选项D,分词方法不合理,选项错误。
17.有如下Python程序段:
import jieba
str=”我来到北京清华大学”
ls=list(jieba.cut(str,cut_all=True))
print(ls)
执行该程序段后,输出的结果是( C )
A.”我来到清华大学”
B.[”我”,”来到”,”北京”,”清华大学”]
C.[”我”,”来到”,”北京”,”清华”,”清华大学”,”华大”,”大学”]
D.”我”,”来到”,”北京”,”清华大学”
【解析】 输出的是列表形式,选项C正确。
18.若字符串str1=”小明打死老虎”,有如下Python程序段:
import jieba
#1.全模式:['小','明','打死','打死老虎','死老虎','老虎']
fc1=jieba.lcut(str1,cut_all=True)
#2. 精简模式:['小明','打死老虎']
fc2=jieba.lcut(str1,cut_all=False)
下列关于文本分词处理的说法中,正确的是( D )
A.使用jieba分词处理的文本内容属于结构化的数据
B.文本处理过于复杂,语文作文机器自动阅卷目前无法实现
C.采用全模式分词产生的分词数量一定多于精简模式的分词数量
D.文本的处理过程主要包括:分词、特征提取、数据分析、结果呈现等
【解析】 选项A,使用jieba分词处理的文本内容属于非结构化的数据,选项错误;选项B,语文作文机器自动阅卷目前已实现,但不准确,选项错误;选项C,采用全模式分词产生的分词数量不一定多于精简模式的分词数量,选项错误。
19.2024·江山中学检测阿泽同学使用某平台搜索关键字“元旦”,将采集到的结果数据存储为文本文件,如图1所示,统计其中各词语(由两个及以上汉字构成)出现的次数并以衢州地图为轮廓将其制作成标签云,如图2所示。
图1 图2
请回答下列问题。
(1)编写Python程序,读取文件,并统计各词语(由两个及以上汉字构成)出现的次数。请在横线处填入合适的代码。
import jieba
import os
txt=open(”①__”元旦.txt”__”,”r”).read()
words=jieba.cut(txt,cut_all=False)
counts={}
for word in words:
if②__len(word)==1__或len(word)<2__:
continue
else:
if word in counts:
counts[word]+=1
else:
③__counts[word]=1__
#生成标签云,代码略
(2)下列说法正确的是__ACD__(多选,填字母)。
A.文本数据处理主要应用在搜索引擎、情报分析、自动摘要、自动校对、自动应答等方面
B.基于词典的分词方法、基于统计的分词方法和基于规则的分词方法是常用的中文分词算法,其中基于规则的统计方法在实际应用中较多
C.标签云用词频表现文本特征,将关键词按照一定的顺序和规律排列,并以文字大小的形式代表词语的重要性
D.典型的中文文本处理过程主要包括:分词、特征提取、数据分析、结果呈现等
【解析】 (1)①打开文件。
②如果字数少于2个,不做处理。
③长度满足要求,如果word在字典中,该词的数量加1,如果不在,则在字典中添加新元素。
(2)基于词典的分词方法在实际应用中较多,选项B错误。
20.2024·开化中学检测习近平总书记在中国共产党第二十次全国代表大会上作了《高举中国特色社会主义伟大旗帜为全面建设社会主义现代化国家而团结奋斗》的报告,大会后全文发表。现将该报告内容存储在“new.txt”文件中,经程序处理后的数据保存为“newfc.txt”文件。分别如图1、图2 所示。
图1
图2
请回答下列问题。
(1)处理文件“new.txt”中的数据生成“newfc.txt”文件的过程,一般称为:__分词__。
(2)编写如下Python 程序,读取“newfc.txt”文件的数据,并统计其中各词语(由两个及以上汉字构成)出现的次数,请在横线处填入合适的代码。
import pandas as pd
f=open('newfc.txt','r',encoding='utf——8').read() # 读取文件
words=f.split() #利用空格、换行符将字符串f 分割成列表
counts={} # 建立空字典,用于存放词语及其出现的次数
for word in words: # 统计其中各词语(由两个及以上汉字构成)出现的次数
if①__len(word)>1__或len(word)>=2__:
if word not in counts:
counts[word]=0
②__counts[word]+=1__
# 利用字典生成相应的Series,根据值降序排列
s=pd.Series(③__counts__).sort_values(ascending=False)
for i in④__s.head(10).index__或s.index__[:10]__: # 从高到低输出出现次数最多的10 个词语
print(i)
【解析】 (1)根据图2 的状态,可以看出生成“newfc.txt”文件的过程是文本处理过程中的分词。
(2)①处描述的是该词的长度,是两个及以上汉字,可以填入len(word)>1 或len(word)>=2;当有长度大于或等于两个汉字的词第一次出现的时候,添加一个新的键值对,先设置counts[word]为0,②处该词出现的次数加1,可以填入counts[word]+=1;③处利用字典counts 的数据生成相应的Series 结构数据,可以填入counts;字典作为Series 的原始数据时,字典的键作为索引index,字典的值作为数据列,i 要遍历对象s 经过降序排序后的前10 条数据的索引值,所以④处需要填入的是s.head(10).index或s.index [:10]。
学科网(北京)股份有限公司
$$