第4章商业分析的技术环境(课件)《商业分析实务》(华东师范大学出版社)

2024-06-30
| 36页
| 44人阅读
| 0人下载
普通

资源信息

学段 中职
学科 职教专业课
课程 市场营销知识
教材版本 -
年级 高一
章节 -
类型 课件
知识点 营销市场分析
使用场景 同步教学-新授课
学年 2024-2025
地区(省份) 全国
地区(市) -
地区(区县) -
文件格式 PPTX
文件大小 7.21 MB
发布时间 2024-06-30
更新时间 2024-06-30
作者 匿名
品牌系列 -
审核时间 2024-06-30
下载链接 https://m.zxxk.com/soft/46046012.html
价格 0.00储值(1储值=1元)
来源 学科网

内容正文:

第四章 商业分析的技术环境 1 数据仓库 周边技术与工具产品 挖掘任务与方法 目录 CONTENT 01 02 03 04 01 数据仓库 3 数据库与数据仓库 比较项目 传统数据库 数据仓库 内容 与业务相关的数据 与决策相关的数据 数据模型 关系、层次结构 关系、多维结构 数据结构 数据结构化程度高,适合运算操作 数据结构化程度始终 负载 事务处理量大,但每个事务涉及的记录数很少 查询量小,但每次需要查询大量的记录 事务输出 一般很少 可能非常大 访问 经常是随机地读、写操作 经常是只读操作 面向用户 普通的业务处理人员 高级的决策管理人员 汇总情况 原始数据,不做汇总 多层次汇总,数据细节有损失 停机 可能意味着灾难性错误 可能意味着延迟决策 数据时间期限 60-90天 5-10年 设计 避免冗余,符合范式 引入冗余,反范式 传统数据库 缺乏集成性 主体不明确 数据需求不匹配,无法支持决策分析活动 数据仓库 数据仓库是基于大规模数据库的决策支持系统环境的核心,是进行数据分析和决策制定的一种技术方案。 关于数据仓库的定义,目前被广泛接受的是由数据仓库之父William H.Inmon在“Building the Data Warehouse”一书中所提出的定义——数据仓库是一个面向主题的(Subject Oriented)、集成的(Integrate)、相对稳定的(Non-Volatile)、反映历史变化(Time Variant)的数据集合,用于支持管理决策。 数据仓库是一个过程而不是一个项目,是一个环境而不是一件产品。 数据仓库的特点 (1)面向主题 “面向主题”是数据仓库中数据组织的最基本原则。 操作型数据库的数据组织面向事务处理任务,各个业务系统之间各自分离,而数据仓库中的数据是按照一定的主题域进行组织。数据仓库的面向主题正是相对于传统数据库的面向应用而言。 所谓面向应用是指系统实现过程中主要围绕着一些应用或功能,而面向主题则是考虑一个个的问题域,对问题域涉及的数据和分析数据所采用的功能给予同样的重视。 所谓“主题”,是一个逻辑概念,是指用户使用数据仓库进行决策时所关心的重点方面,一个主题通常与多个操作型信息系统相关。 (2)集成的 数据仓库中数据的集成,是指在构建数据仓库的过程中,对多个外部数据源中格式不同、定义各异的数据,按既定的策略进行抽取、清洗、转换等一系列处理,使之成为一个有机的整体。这在数据仓库的所有特点中是最重要的。 数据仓库的特点 (3)相对稳定的 操作型数据库中的数据通常实时更新,数据根据需要及时发生变化。而数据仓库的数据主要供企业决策分析之用,所涉及的数据操作主要是数据查询,一旦某个数据进入数据仓库以后,一般情况下将被长期保留,也就是数据仓库中内容的更新、追加等操作是不频繁的,一般依据既定的周期或条件阈值进行。并且,数据在导入数据仓库后,虽然也有删除、更新等操作,但决定这种操作的阈值条件是较难满足的,这种情况是非常罕见的,通常只需要定期的加载、刷新。 (4)反映历史变化 数据仓库是以维的形式对数据进行组织的,时间维是数据仓库中很重要的维度之一,数据仓库的内容会随时间的变化而不断得到增补、更新。 操作型数据库主要关心当前某一个时间段内的数据,而数据仓库虽然不会随业务的发生而频繁地更新数据,但为了保证决策分析的正确性,对数据仓库的内容定期加以增补和更新是十分必要的。所以数据仓库中的数据通常包含历史信息,系统记录了企业从过去某一时点到目前的各个阶段的信息,通过这些信息,可以对企业的发展历程和未来趋势做出定量分析和预测。 数据仓库相关概念 1.数据源 构建一个数据仓库,必然要有充足的数据来源,为数据仓库系统提供进行分析的“原材料”——数据,这些数据来源成为数据仓库的数据源(Data Source)。 数据仓库并不直接存储事务数据,其数据往往来源于多个数据源,并且数据源并不局限于传统数据库,也可以是其他类型的数据,甚至是非结构化的信息,如文本文件,也可以是网络资源。 数据仓库必须将不同来源的数据聚集合并为结构一致的数据集,使其能够准确反映该来源的事务运行情况和历史记录。 从业务系统中提取的或从外部数据源中导入的数据,经过清洗、转化后,成为数据仓库的原始数据。(它们是数据仓库数据的一部分,但不是全部) 数据仓库相关概念 2.元数据 数据是对事物的描述,“元数据”就是描述数据的数据,它提供了相关数据的环境,是关于数据仓库中数据、操作数据的进程以及应用程序的结构和意义的描述信息。元数据在数据仓库的设计、运行中有着十分重要的作用,它所描述的对象涉及数据仓库的各个方面。 元数据在数据仓库中数据的上层,用于记录数据仓库中对象的位置。 为了从操作型环境向数据仓库环境转换而建立的元数据:包括所有源数据项的名称、属性及其在提取仓库中的转化 决策支持系统元数据:用来与最终用户的多维商业模型和前端工具之间建立映射 元数据是数据仓库的一个综合文档,是数据仓库的核心,它决定了数据分析的有效性。通过元数据可以将数据仓库和复杂的数据源系统的变化隔离,是数据仓库开发和维护的一个关键因素,也是保证数据提取质量的依据。 数据仓库相关概念 3.数据集市 数据仓库是企业级的,能为整个企业各个部门的运行提供决策支持手段;而数据集市则是部门级的,一般只能为某个局部范围内的管理人员服务,因此也称之为部门级数据仓库。数据仓库的工作范围和成本常常是巨大的。信息技术部门必须对所有的用户用以整个企业的眼光对待任何一次决策分析,这样就形成了代价很高、耗时较长的大项目。于是提供更紧密集成的、拥有完整图形接口并且价格吸引人的工具——数据集市(Data Mart)就应运而生。 作为一种更小、更集中的数据仓库,数据集市为公司提供了一条分析商业数据的廉价途径,主要针对某个具有战略意义的应用或者具体部门级的应用,支持用户利用已有的数据获得重要的竞争优势或者找到进入新市场的具体解决方案。 一个企业只需建立一个数据仓库,但企业却可以有多个数据集市。 数据集市是面向部门的,这就要求它的整个实施过程由部门定义、设计和开发,也由部门来管理和维护。同时,数据集市相对数据仓库的规模较小,便于实施,购买较便宜,投资回收快。 无论如何,数据集市的数据和功能都是数据仓库的一个子集,并不拥有数据仓库的全部数据及功能。可以认为数据集市是一个提供更详细的、预先存在的数据仓库的摘要子集,可升级到完整的数据仓库。 数据仓库相关概念 是为了满足企业内部各部门的分析需求而建立的微型数据仓库。 这类数据集市的服务对象层次较低,数据规模较小,结构也相对简单,大多没有元数据部件。这类数据集市也可以实施集成,以构建完整的数据仓库。 从属型数据集市的内容并不直接来自外部数据源,而是从数据仓库中得到。 在数据仓库内部,数据根据分析主题,划分为若干个子集,进行组织、存放。 数据划分成集市之后,在进行某个确定主题的分析时,可以有效缩小数据的检索范围,明显提高数据仓库的效率。 数据仓库体系结构 1.两层体系结构(DB-DW) 数据仓库的体系结构 2.三层体系结构(DB-ODS-DW) 作用: 为数据仓库提供数据,减少数据仓库数据抽取的复杂性。 及时的OLAP分析。 全聚德OLTP操作。 数据模型 1.概念模型 概念模型是客观世界到计算机系统的一个中间层次,最常用的表示方法是E-R(实体-关系)图,除此之外,还有面向对象方法、动态模型分析法等。 设计概念模型的目的,是对所涉及的现实世界中的所有客观实体,进行科学的、全面的分析和抽象,为数据仓库的构建制定出“蓝图”。这是成功构建数据仓库的第一步。 概念模型设计的关键,是要保证所有与数据仓库相关的客观实体(即业务内容)均得到正确的理解,并被完整地包含在模型当中。 2.物理模型 数据仓库的物理模型,是指逻辑模型在计算机世界中的具体实现方法,包括物理存取、数据存储结构的构造、数据存放位置的确定,以及存储分配策略等。数据仓库的物理数据模型是在逻辑模型的基础上实现的。 不同层次的建模侧重点: (1)应用层的建模应当面向应用。 (2)业务信息层的建模应当以用户及客户为中心。 (3)数据整合层的建模应当面向主题。 数据模型 3.逻辑模型 对概念模型进行细分,即可构造出数据仓库的逻辑模型。逻辑模型,是从概念模型过渡到物理模型的中间层次,因此又称为中间层数据模型。 数据仓库的逻辑模型描述了数据仓库的主题的逻辑实现,即每个主题对应的模式定义。一般而言,高层概念模型中的每一个主要的实体或主题域,都需要建立一个对应的逻辑模型。 逻辑模型是数据的逻辑结构,如多维模型、关系模型和层次模型等。目前,对数据仓库数据模型的讨论大多集中在逻辑模型,其中最常用的是多维模型。 多维模型中的基本概念: 维是指人们观察数据的特定角度。例如,企业常常关心不同销售数据随时间变化的情况,所以时间就是一个维度。 维的层次是指人们观察数据的某个特定角度还可以存在细节程度不同的多个描述。一个维度往往有多个层次。例如描述日期维度时,可以有年、季度、月和日等不同层次,则年、季度、月和日就是时间维度的层次。 维成员是指维的一个取值。如果一个维是多层次的,则该维度的成员就是在不同层次上取值的组合。例如时间维有年、月和日三个层次,则分别在三个层次上各取一个值组合起来就得到时间维的一个成员,即“某年某月某日”。 度量描述了要分析的数值,例如销售额等。 粒度是指数据仓库所保存数据的细化或综合程度的级别。细化程度越高,粒度越小;反之,细化程度越低,粒度越大。 02 周边技术与产品工具 ETL(Extract,Transform and Load) 为了实现对数据的质量进行有效地维护和管理,使数据仓库能够准确、安全、可靠地从数据库中取出数据,经过加工转换成有规律信息之后,供管理人员进行分析,需要一种程序来对数据进行净化提炼,ETL(Extract,Transform and Load)正是这样的程序。 ETL是数据仓库的最基本流程,原来业务系统的数据经过抽取、转换并加载到数据仓库中心存储库的过程就被称为ETL过程,制定这一过程的测量称之为ETL策略,而完成ETL过程的工具则是ETL工具。ETL是构建数据仓库的重要环节,也是企业数据管理的核心,按照统一的规则集成并提高数据的价值,是负责完成数据从数据源向目标数据仓库转化的过程,对数据仓库的后续环节影响比较大。 ETL(Extract,Transform and Load) 1.数据抽取 数据抽取即是从数据源中抽取数据的过程。源数据进入数据仓库是通过数据抽取完成的,从一个或多个源数据库中通过记录选取进行数据复制的过程。抽取过程是将记录写入ODS或者临时区以备进一步处理。数据抽取是ETL的首要任务,解决的主要问题是确定需要抽取的数据,并选用适当的抽取方式。 数据抽取的主要功能: 数据提取。 数据清洗。 生成衍生数据。 数据抽取的方式有多种,主要包括时戳方式、日志方式、全表对比方式、全表删除插入方式等。 ETL(Extract,Transform and Load) 2.数据转换 数据转换是将抽取出的数据进行过滤、合并、解码和解释等,为数据仓库创建有效数据的过程。一旦数据抽取完成,则需要设计并确定转换规则应用于已抽取的数据。数据转换需要理解业务侧重点、信息需求和目前可用的源数据。 常用的转换规则: 字段级的转换。 清洁和净化。 多数据源处理。 聚合和汇总。 3.数据加载 数据加载是将转换好的数据装载到数据仓库中,通常分为以下几种方式: (1)初始装载。 (2)增量装载。 (3)完全刷新。 在选择ETL工具时,应当从以下几个原则出发进行考虑:ETL对平台的支持;对数据源的支持;数据转换功能;管理和调度功能;集成和开放性;对元数据管理。 周边技术 OLAP技术 目前主流的OLAP产品有Oracle Express/Discoverer、SQL Server Analysis Services、DB2 OLAP Server、SAS OLAP Server等,这些产品都可以生成多维数据立方体,提供多维数据的快速分析,支持所有主流关系型数据库如DB2,Oracle,SQL Server,Sybase等,同时可读取关系数据库中细节数据,实现混合在线分析(HOLAP)或关系型在线分析(ROLAP)。 报表技术 报表技术主要是将集成在数据模型里的数据,按照复杂的格式、指定行列统计项,计算形成的特殊表格。一般的简单报表可以使用通用的前台展现技术实现,而复杂的报表则需要使用特定的报表技术。主流的报表技术都可以灵活的制定各种报表模版库和指标库,并根据每个区块或单元格的需要引用指标,实现一系列复杂的符合要求的报表的自动生成。 数据挖掘技术 数据挖掘就是从海量数据中,提取隐含在其中的、人们事先不知道的但又可能有用的信息和知识的过程。通过数据挖掘能找出数据中隐藏的信息,实现用模型来拟合数据、探索、分析数据,驱动知识发现,实现机器学习等功能。 数据仓库产品 Oracle公司的数据仓库解决方案包含了业界领先的数据库平台、开发工具和应用系统,能够提供一系列的数据仓库工具集和服务,具有多用户数据仓库管理能力,多种分区方式,较强的与OLAP工具的交互能力,及快速和便捷的数据移动机制等特性。 IBM公司的数据仓库产品称为DB2 Data Warehouse Edition,它结合了DB2数据服务器的长处和IBM的商业智能基础设施,集成了用于仓库管理、数据转换、数据挖掘以及OLAP分析和报告的核心组件,提供了一套基于可视数据仓库的商业智能解决方案。 微软的SQL Server提供了三大服务和一个工具来实现数据仓库系统的整合,为用户提供了可用于构建典型和创新的分析应用程序所需的各种特性、工具和功能,可以实现建模、ETL、建立查询分析或图表、定制KPI、建立报表和构造数据挖掘应用及发布等功能。 SAS公司的数据仓库解决方案是一个由30多个专用模块构成的架构体系,适应于对企业级的数据进行重新整合,支持多维、快速查询,提供服务于OLAP操作和决策支持的数据采集、管理、处理和展现功能。 03 挖掘任务与方法 挖掘任务与方法 数据挖掘的基本任务按照其挖掘需要达到的目标可以分为分类和预测、聚类分析、关联规则、异常检测和智能推荐等。通过完成以上任务,发现数据的价值来指导商业决策。 按照是否有预先设置分类可以分为有监督学习和无监督学习。 无监督学习模型也可以称为描述性模型,可以概括出数据中潜在的模式(相关、趋势、聚类、轨迹和异常)。 有监督模型则是根据其他属性的值预测出特定属性的值,被预测的属性是目标变量、因变量,用来做预测的是说明变量、自变量。 无监督学习模型 有监督学习模型 分类与预测 分类与预测是一种基于类标号的学习方式。这种类标号若是离散的,属于分类问题;若是连续的,则属于预测问题,或者称为回归问题。 分类能反映事物的类别,进而对事态发展进行预测。 分类的目的是学会一个分类函数或分类模型,该模型能把数据库中的数据项映射到给定类别中的某一个。分类的目的是:分析输入数据,通过在训练集中的数据表现出来的特性,为每一个类找到一种准确的描述或者模型。 数据分类操作步骤: 根据给定的训练集,找到合适的映射函数。 使用上一步训练完成的函数和预测数据的类别,或者利用该函数的模型,对数据集中的每一类别进行描述,形成分类规则。 分类与预测 分类器可主要应用于以下场景: 文本分类:电商将客户的按照关键词进行分类和情感分析。 信用风险分析:将信用卡申请按照中、低、高风险分类。 客户响应分析:预测哪些客户会对电信公司的产品促销活动会响应。 客户流失预测:预测哪些客户会流失。 不满意客户预测:预测哪些客户会对移动公司的服务不满意,以提前进行客户满意度提升。 决策树分类器算法 决策树构建 利用训练样本生成决策树模型的过程 特别关注 如何找出用于定义某节点测试的分割点, 若已选定某分割点,如何将数据进行划分 决策树修剪 通过删除部分节点和子树,以避免“过度拟合 修剪策略 基于代价复杂度的修剪 悲观修剪 MDL修剪 聚类分析 聚类分析(Cluster Analysis)的一般定义是根据数据的不同特征,将其划分为不同的数据类,是“物以类聚,人以群分”在原始数据集中的使用,它将物理或抽象对象的集合组成为由类似对象组成的多个类的过程被成为聚类。由聚类所组成的簇是一组数据对象的集合,这些对象与同一簇中的对象彼此类似,与其他簇中的对象相异,最终实现属于同一个类别的个体之间距离尽可能小(高相似度),而不同类别的个体间距离尽可能大(相似度尽可能小)。 目前主要有基于划分的聚类算法、基于层次的聚类算法、基于密度聚类算法、基于网格的聚类算法、基于神经网络的聚类算法和基于统计学的聚类算法。 聚类分析 k-means 是一种典型的划分聚类算法,它用一个聚类的中心来代表一个簇,即在迭代过程中选择的聚点不一定是聚类中的一个点,该算法只能处理数值型数据。 k-modes K-Means算法的扩展,采用简单匹配方法来度量分类型数据的相似度。 k-prototypes 结合了K-Means和K-Modes两种算法,能够处理混合型数据。 k-medoids 在迭代过程中选择簇中的某点作为聚点,PAM是典型的k-medoids算法。 CLARA CLARA算法在PAM的基础上采用了抽样技术,能够处理大规模数据。 CLARANS CLARANS算法融合了PAM和CLARA两者的优点,是第一个用于空间数据库的聚类算法。 Focused CLARAN 采用了空间索引技术提高了CLARANS算法的效率。 PCM 模糊集合理论引入聚类分析中并提出了PCM模糊聚类算法。 基于划分的方法(Partition-based methods):其原理就是需要对一堆散点进行聚类,最终聚类结果为“类内的点都足够近,类间的点都足够远”。首先我们要确定这堆散点最后聚成几类,然后挑选几个点作为初始中心点,再然后依据预先定好的启发式算法给数据点做迭代重置,直到最后到达“类内的点都足够近,类间的点都足够远”的目标效果。基于划分的聚类多适用于中等体量的数据集,但我们也不知道“中等”到底有多“中”,所以不妨理解成,数据集越大,越有可能陷入局部最小。 聚类分析 基于层次的聚类算法(Hierarchical methods):其首先计算样本之间的距离,每次将距离最近的点合并到同一个类,然后再计算类与类之间的距离,将距离最近的类合并为一个大类,不停的合并,直到合成了一个类。层次聚类算法根据层次分解的顺序分为:自下底向上和自上向下,即凝聚的层次聚类算法和分裂的层次聚类算法,也可以理解为自下而上法和自上而下法。自下而上法就是一开始每个个体都是一个类,然后根据联系寻找同类,最后形成一个“类”。自上而下法就是反过来,一开始所有个体都属于一个“类”,然后根据联系排除异己,最后每个个体都成为一个“类”。 CURE 采用抽样技术先对数据集D随机抽取样本,再采用分区技术对样本进行分区,然后对每个分区局部聚类,最后对局部聚类进行全局聚类。 ROCK 也采用了随机抽样技术,该算法在计算两个对象的相似度时,同时考虑了周围对象的影响。 CHEMALOEN 首先由数据集构造成一个K-最近邻图Gk ,再通过一个图的划分算法将图Gk 划分成大量的子图,每个子图代表一个初始子簇,最后用一个凝聚的层次聚类算法反复合并子簇,找到真正的结果簇。 SBAC SBAC算法则在计算对象间相似度时,考虑了属性特征对于体现对象本质的重要程度,对于更能体现对象本质的属性赋予较高的权值。 BIRCH BIRCH算法利用树结构对数据集进行处理,叶结点存储一个聚类,用中心和半径表示,顺序处理每一个对象,并把它划分到距离最近的结点,该算法也可以作为其他聚类算法的预处理过程。 BUBBLE BUBBLE算法则把BIRCH算法的中心和半径概念推广到普通的距离空间。 BUBBLE-FM BUBBLE-FM算法通过减少距离的计算次数,提高了BUBBLE算法的效率。 聚类分析 基于密度聚类的思想就是定一个距离半径,最少有多少个点,然后把可以到达的点都连起来,判定为同类。其原理简单说画圈,其中要定义两个参数,一个是圈的最大半径,一个是一个圈里最少应容纳几个点,最后在一个圆圈里的,就是一个类。它解决了k-means解决不了不规则形状聚类的问题,同时也对噪声数据的处理比较好。 DBSCAN DBSCAN算法是一种典型的基于密度的聚类算法,该算法采用空间索引技术来搜索对象的邻域,引入了“核心对象”和“密度可达”等概念,从核心对象出发,把所有密度可达的对象组成一个簇。 GDBSCAN 算法通过泛化DBSCAN算法中邻域的概念,以适应空间对象的特点。 OPTICS OPTICS算法结合了聚类的自动性和交互性,先生成聚类的次序,可以对不同的聚类设置不同的参数,来得到用户满意的结果。 FDC FDC算法通过构造k-d tree把整个数据空间划分成若干个矩形空间,当空间维数较少时可以大大提高DBSCAN的效率。 基于网格的聚类算法(dding-based)是指将对象空间量化为有限数目的单元,形成一个网络结构,所有聚类都在这个网络中进行。其基本思想是将每个属性的可能值分割成许多相邻的区间,创建网格单元的集合,每个对象落入一个网格单元,网格单元对应的属性区间包含该对象的值。这种算法的处理速度很快,其处理时间独立于数据对象的数目,只与量化空间中每一维的单元数目有关。 STING 利用网格单元保存数据统计信息,从而实现多分辨率的聚类 WaveCluster 在聚类分析中引入了小波变换的原理,主要应用于信号处理领域。(备注:小波算法在信号处理,图形图像,加密解密等领域有重要应用,是一种比较高深和牛逼的东西) CLIQUE 是一种结合了网格和密度的聚类算法 聚类分析 神经网络(Neural Networks,NN)是通过模拟人的大脑处理机制的生理功能,有大量的、简单的处理单元(或称神经元)广泛互连形成的复杂网络系统,具有大规模并行、分布式存储和处理、自组织、自适应和自学习的能力,特别适用于处理需要同时考虑需要因素和条件的、不精确和模糊的信息处理问题,目前已广泛应用于语音识别、图像识别与理解、计算机视觉、智能机器人、故障检测等领域中。 由于神经网络具有鲁棒性强、可去除噪声等优点,所以不会把几个噪声数据单独聚为一类,从而有效地避免了早上数据对于聚类结果的影响。 自组织神经网络(SOM)是比较常用的神经网络聚类算法,可以在一维或二维的处理单元阵列上,形成输入信号的特征拓扑分布。该方法的基本思想是由外界输入不同的样本到人工的自组织映射网络中,一开始时,输入样本引起输出兴奋细胞的位置各不相同,但自组织后会形成一些细胞群,它们分别代表了输入样本,反映了输入样本的特征。 SOM神经网络模型 聚类算法综合评价表 算法名称 可伸缩性 适合的数据类型 高维性 异常数据的抗干扰性 聚类形状 算法效率 WaveCluster 很高 数值型 很高 较高 任意形状 很高 ROCK 很高 混合型 很高 很高 任意形状 一般 BIRCH 较高 数值型 较低 较低 球形 很高 CURE 较高 数值型 一般 很高 任意形状 较高 K-Prototypes 一般 混合型 较低 较低 任意形状 一般 DENCLUE 较低 数值型 较高 一般 任意形状 较高 OptiGrid 一般 数值型 较高 一般 任意形状 一般 CLIQUE 较高 数值型 较高 较高 任意形状 较低 DBSCAN 一般 数值型 较低 较高 任意形状 一般 CLARANS 较低 数值型 较低 较高 球形 较低 关联分析 关联规则模式属于描述型模式,发现关联规则的算法属于无监督学习的方法。 关联分析又称为购物篮分析,是数据挖掘领域常见的一种算法,主要用于发现隐藏于大型数据集中的有意义的联系。 关联分析所得到的结果,我们可以用关联规则或者频繁项集的形式表示。 项集指的是在关联分析中,包含0个或多个的项称为项集。如果一个项集包含k个项,那么就称为k项集。比如{牛奶,咖啡}则称为2项集。 尿布和啤酒 关联规则涉及的四个参数: 可信度(Confidence) 对关联规则的准确度的衡量 支持度(Support) 对关联规则重要性的衡量 期望可信度(Expected Confidence) 描述了在没有物品集A 的作用下,物品集B 本身的支持度 作用度(Lift) 描述了物品集A 对物品集B 的影响力的大小 异常检测 什么是异常(Outlier)?异常是在数据集中与众不同的数据,使人怀疑这些数据并非随机偏差而是产生于完全不同的机制。在统计学意义下,Outlier是指图或数据表上“显著远离”数据主体聚簇的数据点。 离群点:大部分与其他对象不同的对象。离群点的成因主要有以下三个方面:首先是数据来源于不同的类。其次是自然变异,最后也是常见的人们认为的数据测量和收集误差。 检测离群点的代表性的算法有:基于深度的算法DEEPLOC,基于局部差异的算法Optics-Of,基于距离的算法FindAllOutsD,基于小波变换的算法FindOut,带离群度的局部离群点检测算法LOF和基于机器学习方法的二阶段规则推导算法NP-rule等。 离群统计的算法主要有以下几类:基于统计的算法、基于密度的算法、基于深度的算法、基于距离的算法和基于偏离的算法。 对于离群点的检测,可用于欺诈检测、入侵检测等,如电信和信用卡欺骗、贷款审批、消费者行为分析、气象预报、金融领域客户分类、网络入侵检测等。 描述与可视化 描述是增加对复杂数据的了解,可视化是促进了解的方式。描述与可视化都不是单独的数据分析过程,需要与上述分析方法等结合使用,使分析的结果更加明晰。 基本的描述是对描述性统计量的分析,如对反应集中趋势的描述统计量:数值平均数、算术平均数、调和平均数、几何平均数、位置平均数、众数、中位数、分位数等的分析;反映离中数据的描述统计量如全距、平均差、标准差和离散系数的描述以及反映分布趋势的描述统计量如偏斜度和峰度等的描述。 数据的可视化呈现有多种方式,传统的数据可视化工具如Excel、Spss等统计软件能形成对数据统计量的基本的可视化描述。 根据应用类型可以分为离线和在线。在线的可视化工具如Google Chart API,目前可以提供动态图表工具。Flot,优秀的线框图表库,支持所有的Canvas的浏览器; Raphaël,创建图表和图形的JavaScript库,与其他库最大的不同是输出格式有限,仅限SCG和VML;D3,可以制作信息图而并不仅仅是数据可视化。Visually的定位就是:“信息图设计师的在线集市”,也提供了大量的信息图模板。 描述与可视化 R.交互化展示包shiny绘图示例 思考题 1、数据仓库与数据库有何异同?请简明阐述数据仓库与数据集市的关系。 2、简述ETL的过程及其作用。 3、数据挖掘的常用算法包括哪些?掌握其区别与特性。 $$

资源预览图

第4章商业分析的技术环境(课件)《商业分析实务》(华东师范大学出版社)
1
第4章商业分析的技术环境(课件)《商业分析实务》(华东师范大学出版社)
2
第4章商业分析的技术环境(课件)《商业分析实务》(华东师范大学出版社)
3
第4章商业分析的技术环境(课件)《商业分析实务》(华东师范大学出版社)
4
第4章商业分析的技术环境(课件)《商业分析实务》(华东师范大学出版社)
5
第4章商业分析的技术环境(课件)《商业分析实务》(华东师范大学出版社)
6
所属专辑
由于学科网是一个信息分享及获取的平台,不确保部分用户上传资料的 来源及知识产权归属。如您发现相关资料侵犯您的合法权益,请联系学科网,我们核实后将及时进行处理。