4.5 文本数据处理-【同步宝典】2023-2024学年新教材高中信息技术必修1数据与计算课程精练(浙教版)

2024-05-17
| 2份
| 5页
| 129人阅读
| 6人下载
金华市合创展教育图书有限公司
进店逛逛

内容正文:

4.5 文本数据处理 1. 文本数据处理是大数据处理的分支之一袁以下对其理解错误的是 渊 冤 A. 处理对象是具有丰富语义的文本数据 B. 目的是从海量文本数据中提取符合需要的尧感兴趣的和隐藏的信息 C. 文本数据是结构化数据 D. 在文本分类尧垃圾邮件过滤等方面应用广泛 2. 典型的文本数据处理过程的正确顺序是 渊 冤 淤数据分析 于分词 盂结果呈现 榆特征提取 A. 淤于盂榆 B. 于淤榆盂 C. 榆于淤盂 D. 于榆淤盂 3. 以下不是文本数据处理主要应用领域的是 渊 冤 A. 论文查重 B. 文本分类 C. 垃圾邮件分类 D. 手写输入识别 4. 文本数据处理是从大量的文本中提取有用信息袁在此过程中文本的状态变化是 渊 冤 A. 从结构化到非结构化 B. 从非结构化到结构化 C. 从非结构化到半结构化 D. 从半结构化到结构化 5. 以下不属于常用中文分词算法的是 渊 冤 A. 基于词典的分词方法 B. 基于统计的分词方法 C. 基于人工操作的分词方法 D. 基于规则的分词方法 6. 下列关于文本数据分析与应用的说法袁错误的是 渊 冤 A. 标签云是文本可视化的一种方式 B. 标签云用词频表现文本特征 C. 文本情感分析的研究领域是专门尧单一的 D. 文本情感分析应用于多个不同领域 7. 根据习近平总书记提出野新时代中国特色社会主义思想冶内容制作词云如图所示袁下列说法正 确的是 渊 冤 A. 词云必须显示该数据集包含的全部词语 B. 该报告中词语野教育冶比野社会主义冶出现频率高 C. 对数据集中文本分词后还需特征提取后才能绘制词云 D. 野发展冶野建设冶野社会主义思想冶是该思想的重点词汇之一 152 8. 下列关于中文分词方法的描述中袁属于基于统计的分词方法的是 渊 冤 A. 在分析句子时与词典中的词语进行对比袁词典中出现的就划分为词 B. 依据上下文中相邻字出现的频率统计袁同时出现的次数越高就越可能组成一个词 C. 让计算机模拟人的理解方式袁根据大量的现有资料和规则进行学习袁然后分词 D. 依据词语与词语之间的空格进行分词 9. 小明想知道中国成语中有多少成语包含文字野文冶野武冶渊包含单字和双字冤袁从网络上下载了 野成语大全.txt冶袁部分界面如图所示遥 请回答下列问题院 成语的统计代码如下袁请在画线处填入合适的代码遥 import pandas as pd #导入 pandas模块袁并设置别名 pd cy=open(" 淤 ","r",encoding="utf-8") #打开文件 cytxt=cy.read().split(' ') #读取文件内容 xm=咱"文","武","文武"暂 jg=咱暂 count=0 for i in cytxt: for j in range(len(xm)): if 于 : jg.append(i) count=count+1 print("包含文武渊含单字冤共有:"+ 盂 ) print("这些成语为:",jg) 淤 于 盂 153 10. 小张获取了叶三国演义曳的小说袁存储为野三国演义.txt冶袁他想利用 jieba模块对该小说进行文 本分析袁查看该小说中词频最高的前 10个词遥 渊1冤文本数据处理的主要步骤包括院淤结果呈现曰于特征提取曰盂分词曰榆数据分析曰虞文本数 据获取遥 正确的顺序是 渊单选袁填字母冤遥 A. 虞于榆淤 B. 虞盂淤榆 C. 虞盂于榆淤 D. 虞淤盂于榆 渊2冤完成词频统计的程序代码如下所示袁请在画线处填入合适的代码遥 import jieba #导入 jieba分词 import pandas as pd #导入 pandas模块袁并设置别名 pd f=open("三国演义.txt","r",encoding="utf-8") #以只读的方式打开文件 txt=f.read() #读取文件内容 words=jieba.lcut(txt,cut_all=True) #全模式分词 counts={} for name in words: if 淤 : #过滤掉单字分词 if name in counts: 于 #已经出现过袁出现次数累加 else: 盂 #未出现过袁出现次数设为 1 f.close() df=pd.DataFrame(list(counts.items()),columns=咱"词","次数"暂) df=df.sort_values("次数",ascending= 榆 ) df.to_excel("词频结果.xlsx") print(df) 淤 于 盂 榆 154 渊3冤df2.sort_values("平均分",ascending=False) 揖解析铱渊1冤数据整理的目的是检测和修正错漏的 数据袁整合数据资源尧规整数据格式尧提高数

资源预览图

4.5 文本数据处理-【同步宝典】2023-2024学年新教材高中信息技术必修1数据与计算课程精练(浙教版)
1
所属专辑
相关资源
示范课
由于学科网是一个信息分享及获取的平台,不确保部分用户上传资料的 来源及知识产权归属。如您发现相关资料侵犯您的合法权益,请联系学科网,我们核实后将及时进行处理。