内容正文:
4.5 文本数据处理
1. 文本数据处理是大数据处理的分支之一袁以下对其理解错误的是 渊 冤
A. 处理对象是具有丰富语义的文本数据
B. 目的是从海量文本数据中提取符合需要的尧感兴趣的和隐藏的信息
C. 文本数据是结构化数据
D. 在文本分类尧垃圾邮件过滤等方面应用广泛
2. 典型的文本数据处理过程的正确顺序是 渊 冤
淤数据分析 于分词 盂结果呈现 榆特征提取
A. 淤于盂榆 B. 于淤榆盂 C. 榆于淤盂 D. 于榆淤盂
3. 以下不是文本数据处理主要应用领域的是 渊 冤
A. 论文查重 B. 文本分类 C. 垃圾邮件分类 D. 手写输入识别
4. 文本数据处理是从大量的文本中提取有用信息袁在此过程中文本的状态变化是 渊 冤
A. 从结构化到非结构化 B. 从非结构化到结构化
C. 从非结构化到半结构化 D. 从半结构化到结构化
5. 以下不属于常用中文分词算法的是 渊 冤
A. 基于词典的分词方法 B. 基于统计的分词方法
C. 基于人工操作的分词方法 D. 基于规则的分词方法
6. 下列关于文本数据分析与应用的说法袁错误的是 渊 冤
A. 标签云是文本可视化的一种方式
B. 标签云用词频表现文本特征
C. 文本情感分析的研究领域是专门尧单一的
D. 文本情感分析应用于多个不同领域
7. 根据习近平总书记提出野新时代中国特色社会主义思想冶内容制作词云如图所示袁下列说法正
确的是 渊 冤
A. 词云必须显示该数据集包含的全部词语
B. 该报告中词语野教育冶比野社会主义冶出现频率高
C. 对数据集中文本分词后还需特征提取后才能绘制词云
D. 野发展冶野建设冶野社会主义思想冶是该思想的重点词汇之一
152
8. 下列关于中文分词方法的描述中袁属于基于统计的分词方法的是 渊 冤
A. 在分析句子时与词典中的词语进行对比袁词典中出现的就划分为词
B. 依据上下文中相邻字出现的频率统计袁同时出现的次数越高就越可能组成一个词
C. 让计算机模拟人的理解方式袁根据大量的现有资料和规则进行学习袁然后分词
D. 依据词语与词语之间的空格进行分词
9. 小明想知道中国成语中有多少成语包含文字野文冶野武冶渊包含单字和双字冤袁从网络上下载了
野成语大全.txt冶袁部分界面如图所示遥
请回答下列问题院
成语的统计代码如下袁请在画线处填入合适的代码遥
import pandas as pd #导入 pandas模块袁并设置别名 pd
cy=open(" 淤 ","r",encoding="utf-8") #打开文件
cytxt=cy.read().split('
') #读取文件内容
xm=咱"文","武","文武"暂
jg=咱暂
count=0
for i in cytxt:
for j in range(len(xm)):
if 于 :
jg.append(i)
count=count+1
print("包含文武渊含单字冤共有:"+ 盂 )
print("这些成语为:",jg)
淤
于
盂
153
10. 小张获取了叶三国演义曳的小说袁存储为野三国演义.txt冶袁他想利用 jieba模块对该小说进行文
本分析袁查看该小说中词频最高的前 10个词遥
渊1冤文本数据处理的主要步骤包括院淤结果呈现曰于特征提取曰盂分词曰榆数据分析曰虞文本数
据获取遥 正确的顺序是 渊单选袁填字母冤遥
A. 虞于榆淤 B. 虞盂淤榆 C. 虞盂于榆淤 D. 虞淤盂于榆
渊2冤完成词频统计的程序代码如下所示袁请在画线处填入合适的代码遥
import jieba #导入 jieba分词
import pandas as pd #导入 pandas模块袁并设置别名 pd
f=open("三国演义.txt","r",encoding="utf-8") #以只读的方式打开文件
txt=f.read() #读取文件内容
words=jieba.lcut(txt,cut_all=True) #全模式分词
counts={}
for name in words:
if 淤 : #过滤掉单字分词
if name in counts:
于 #已经出现过袁出现次数累加
else:
盂 #未出现过袁出现次数设为 1
f.close()
df=pd.DataFrame(list(counts.items()),columns=咱"词","次数"暂)
df=df.sort_values("次数",ascending= 榆 )
df.to_excel("词频结果.xlsx")
print(df)
淤
于
盂
榆
154
渊3冤df2.sort_values("平均分",ascending=False)
揖解析铱渊1冤数据整理的目的是检测和修正错漏的
数据袁整合数据资源尧规整数据格式尧提高数