内容正文:
5.1 认识大数据
汇报人:王春艳
定义与核心特征
高速处理(Velocity)
多样性(Variety)
数据规模庞大(Volume)
低价值密度(Value)
处理范式差异
传统数据依赖关系型数据库和确定性分析,而大数据采用NoSQL、MapReduce等非关系型技术处理非确定性关联。
价值密度对比
传统数据价值集中(如交易记录),大数据价值稀疏且需挖掘(如监控视频中关键帧提取),要求更复杂的算法模型。
存储架构革新
传统数据采用集中式存储,大数据依赖分布式文件系统(如HDFS)和云存储,具备横向扩展能力。
分析目标不同
传统数据分析侧重因果推理,大数据分析更关注相关性发现和预测性建模(如用户行为模式识别)。
与传统数据的区别
典型应用场景
城市治理
利用交通摄像头、传感器数据实现智能信号灯调控,降低拥堵指数,典型案例包括杭州城市大脑的实时路况优化。
智慧医疗
整合电子病历、基因测序和影像数据,辅助疾病预测(如AI诊断肿瘤)和个性化治疗方案制定。
精准营销
通过分析用户浏览、购买历史等行为数据,构建个性化推荐系统(如电商平台的"猜你喜欢"),提升转化率30%以上。
文本中单词出现频率数据分析与可视化表达
活动探究
现有一篇文章,需可视化显示出文章中的高频词汇
文本中单词出现频率数据分析与可视化表达
问题1
小组探究并设计问题解决方案
文本中单词出现频率数据分析与可视化表达
问题2
如何提取网页中的文本?
def getcontent(url, tag, attr={}, subtag='a', subattr={}):
soup=getsoup(url)
node=soup.find(tag, attr)
if subtag != None:
node=node.find(subtag, subattr)
contents=node.contents
contents=[unicode(n) for n in contents if True]
return filtercontent(u''.join(contents))
文本中单词出现频率数据分析与可视化表达
问题3
文本中的词组有很多,怎样才能找到它的关键字呢?
import jieba
text_from_file_with_apath=open('/Users/Administrator/Desktop/111.docx').read()
wordlist_after_jieba=jieba.cut(text_from_file_with_apath, cut_all = True)
wl_space_split= " ".join(wordlist_after_jieba)
文本中单词出现频率数据分析与可视化表达
问题4
你认为怎样才能直观、丰富的展示数据结果?
import matplotlib.pyplot as plt
from wordcloud import WordCloud
import jieba
text_from_file_with_apath=open('/Users/Administrator/Desktop/111.docx').read()
wordlist_after_jieba=jieba.cut(text_from_file_with_apath, cut_all = True)
wl_space_split= " ".join(wordlist_after_jieba)
my_wordcloud=WordCloud().generate(wl_space_split)
plt.imshow(my_wordcloud)
plt.axis("off")
plt.show()
文本中单词出现频率数据分析与可视化表达
展示交流
小组上传并展示作品
线下探究
任选一个主题或者自拟主题,制定相应的活动方案。
THANKS
感谢观看
$