十一、数据处理与分析第1关数据处理与分析的概念任务描述本关任务根据相关知识内容完成右边选择题。相关知识为了完成本关任务你需要掌握1.数据分析与处理的概念。数据处理与分析的概念数据分析可以分为广义的数据分析和狭义的数据分析广义的数据分析就包括狭义的数据分析和数据挖掘。广义的数据分析是指用适当的分析方法来自统计学、机器学习和数据挖掘等领域对收集来的数据进行分析提取有用信息和形成结论的过程。可以看出在广义的数据分析中可以使用复杂的机器学习和数据挖掘算法也可以根本不使用这些算法而只使用一些简单的统计分析方法比如汇总求和、求平均值、求均方差等。狭义的数据分析是指根据分析目的用适当的统计分析方法及工具对收集来的数据进行处理与分析提取有价值的信息发挥数据的作用。数据分析与数据挖掘狭义的数据分析和数据挖掘是有着明显的区分的具体如下1在定义层面狭义的数据分析在上面已经定义过。而数据挖掘是指从大量的数据中通过统计学、人工智能、机器学习等方法挖掘出未知的、且有价值的信息和知识的过程。2在作用层面数据分析主要实现三大作用现状分析、原因分析、预测分析定量。数据分析的目标明确先做假设然后通过数据分析来验证假设是否正确从而得到相应的结论。数据挖掘主要侧重解决四类问题分类、聚类、关联和预测定量、定性数据挖掘的重点在寻找未知的模式与规律如著名的数据挖掘案例——啤酒与尿布就是事先未知的但又是非常有价值的信息。3在方法层面数据分析主要采用对比分析、分组分析、交叉分析、回归分析等常用分析方法数据挖掘主要采用决策树、神经网络、关联规则、聚类分析等统计学、人工智能、机器学习等方法进行挖掘4在结果层面数据分析一般都是得到一个指标统计量结果如总和、平均值等这些指标数据都需要与业务结合进行解读才能发挥出数据的价值与作用。数据挖掘则是输出模型或规则并且可相应得到模型得分或标签模型得分如流失概率值、总和得分、相似度、预测值等标签如高中低价值用户、流失与非流失、信用优良中差等。综上所述数据分析狭义与数据挖掘的本质都是一样的都是从数据里面发现关于业务的知识有价值的信息从而帮助业务运营、改进产品以及帮助企业做更好的决策。所以数据分析狭义与数据挖掘构成广义的数据分析。数据分析与数据处理数据分析过程通常会伴随着发生数据处理或者说伴随着大量数据计算因此数据分析和数据处理是一对关系紧密的概念很多时候二者是融合在一起的很难割裂开来。也就是说当用户在进行数据分析的时候底层的计算机系统会根据数据分析任务的要求使用程序进行大量的数据处理或者说发生大量的数据计算。例如当用户进行决策树分析时需要事先根据决策树算法编写分析程序当分析开始以后决策树分析程序就会从磁盘读取数据进行大量计算最终给出计算结果也就是决策树分析结果。大数据处理与分析数据分析包含两个要素即理论和技术。在理论层面需要统计学、机器学习和数据挖掘等知识。在技术层面包括单机分析工具比如 SPSS、SAS 等或单机编程语言比如 Python、R以及大数据处理与分析技术比如 MapReduce、Spark、Hive 等。数据分析可以是针对小规模数据的分析也可以是针对大规模数据的分析这时被称为“大数据分析”。在大数据时代到来之前数据分析主要以小规模的抽样数据为主一般使用统计学、机器学习和数据挖掘的相关方法以单机分析工具比如 SPSS 和 SAS或者单机编程比如 Python、R的方式来实现分析程序。但是到了大数据时代数据量爆炸式地增长很多时候需要对规模巨大的全量数据而不是小规模的抽样数据进行分析这时单机工具和单机程序已经显得“无能为力”就需要采用分布式实现技术比如使用 MapReduce、Spark 或 Flink 编写分布式分析程序借助于集群的多台机器进行并行数据处理分析这个过程就被称为“大数据处理与分析”。编程要求根据相关知识完成右侧选择题测试说明若选择题答案与正确答案一致则可通关。开始你的任务吧祝你成功第2关机器学习和数据挖掘算法任务描述本关任务根据相关知识内容完成右边选择题。相关知识为了完成本关任务你需要掌握1.概述2.分类3.聚类4.回归分析5.关联规则6.协同过滤。概述机器学习是一门多领域交叉学科涉及概率论、统计学、逼近论、凸分析、算法复杂度理论等多门学科专门研究计算机怎样模拟或实现人类的学习行为以获取新的知识或技能重新组织已有的知识结构使之不断改善自身的性能它是人工智能的核心是使计算机具有智能的根本途径其应用遍及人工智能的各个领域。数据挖掘是指从大量的数据中通过算法搜索隐藏于其中信息的过程。数据挖掘可以视为机器学习与数据库的交叉它主要利用机器学习界提供的算法来分析海量数据利用数据库界提供的存储技术来管理海量数据。从知识的来源角度而言数据挖掘领域的很多知识也“间接”来自于统计学界之所以说“间接”是因为统计学界一般偏重于理论研究而不注重实用性统计学界中的很多技术需要在机器学习界进行验证和实践并变成有效的机器学习算法以后才可能进入数据挖掘领域对数据挖掘产生影响。虽然数据挖掘的很多技术都来自机器学习领域但是我们并不能因此就认为数据挖掘只是机器学习的简单应用。毕竟机器学习通常只研究小规模的数据对象往往无法应用到海量数据的情形数据挖掘领域必须借助于海量数据管理技术对数据进行存储和处理同时对一些传统的机器学习算法进行改进使其能够支持海量数据的情形。典型的机器学习和数据挖掘算法包括分类、聚类、回归分析和关联规则等。分类分类是一种重要的机器学习和数据挖掘技术。分类的目的是根据数据集的特点构造一个分类函数或分类模型(也常常称作分类器)该模型能把未知类别的样本映射到给定类别中。构造分类模型的过程一般分为训练和测试两个阶段。在构造模型之前将数据集随机地分为训练数据集和测试数据集。先使用训练数据集来构造分类模型然后使用测试数据集来评估模型的分类准确率。如果认为模型的准确率可以接受就可以用该模型对其它数据元组进行分类。一般来说测试阶段的代价远低于训练阶段。典型的分类方法包括决策树、朴素贝叶斯、支持向量机和人工神经网络等。这里给出一个分类的应用实例。假设有一名植物学爱好者对她发现的鸢尾花的品种很感兴趣。她收集了每朵鸢尾花的一些测量数据花瓣的长度和宽度以及花萼的长度和宽度。她还有一些鸢尾花分类的数据也就是说这些花之前已经被植物学专家鉴定为属于 setosa、versicolor 或 virginica 三个品种之一。基于这些分类数据她可以确定每朵鸢尾花所属的品种。于是她可以构建一个分类算法让算法从这些已知品种的鸢尾花测量数据中进行学习得到一个分类模型再使用分类模型预测新鸢尾花的品种。聚类聚类又称群分析是一种重要的机器学习和数据挖掘技术。聚类分析的目的是将数据集中的数据对象划分到若干个簇中并且保证每个簇之间样本尽量接近不同簇的样本间距离尽量远。通过聚类生成的簇是一组数据对象的集合簇满足以下两个条件1每个簇至少包含一个数据对象2每个数据对象仅属于一个簇。聚类分析的常见应用场景包括1目标用户的群体分类通过对特定运营目的和商业目的所挑选出的指标变量进行聚类分析把目标群体划分成几个具有明显特征区别的细分群体从而可以在运营活动中为这些细分群体采取精细化个性化的运营和服务最终提升运营的效率和商业效果。2不同产品的价值组合企业可以按照不同的商业目的并依照特定的指标标量来为众多的产品种类进行聚类分析把企业的产品体系进一步细分成具有不同价值、不同目的的多维度的产品组合并且在此基础分别制定和相应的开发计划、运营计划和服务规划。3探测发现离群点和异常值这里的离群点是指相对于整体数据对象而言的少数数据对象这些对象的行为特征与整体的数据行为特征很不一致比如某 B2C 电商平台上比较昂贵、频繁的交易就有可能隐含欺诈的风险需要风控部门提前关注。聚类分析一般属于无监督分类的范畴按照一定的要求和规律在没有关于分类的先验知识情况下对数据进行区分和分类。聚类既能作为一个单独过程用于找寻数据内部的分布结构也可以作为分类等其他学习任务的前驱过程。聚类算法可分为划分法Partitioning Method、层次法Hierarchical Method、基于密度的方法Density-based Method、基于网格的方法Grid-based Method、基于模型的方法Model-BasedMethod。这些方法没有统一的评价指标因为不同聚类算法的目标函数相差很大。有些聚类是基于距离的如 K-Means有些是假设先验分布的如 GMMLDA有些是带有图聚类和谱分析性质的如谱聚类还有些是基于密度的如 DBSCAN。聚类算法应该嵌入到问题中进行评价。回归分析回归分析Regression Analysis指的是确定两种或两种以上变量间相互依赖的定量关系的一种统计分析方法。回归分析按照涉及的变量的多少分为一元回归和多元回归分析按照因变量的多少可分为简单回归分析和多重回归分析按照自变量和因变量之间的关系类型可分为线性回归分析和非线性回归分析。在大数据分析中回归分析是一种预测性的建模技术它研究的是因变量目标和自变量预测器之间的关系。这种技术通常用于预测分析时间序列模型以及发现变量之间的因果关系。例如司机的鲁莽驾驶与道路交通事故数量之间的关系最好的研究方法就是回归。关联规则关联规则最初是针对购物篮分析Market Basket Analysis问题提出的。假设零售商想更多地了解顾客的购物习惯。特别是想知道顾客可能会在一次购物时同时购买哪些商品为了回答该问题可以对商店的顾客事物零售数量进行购物篮分析。该过程通过发现顾客放入“购物篮”中的不同商品之间的关联分析顾客的购物习惯。这种关联的发现可以帮助零售商了解哪些商品频繁地被顾客同时购买从而帮助他们开发更好的营销策略。关联规则定义为假设是I{I1,I2,I3,…,Im}项的集合。给定一个交易数据库 D其中每个事务 t 是 I 的非空子集即每一个交易都与一个唯一的标识符 TID 对应。关联规则在 D 中的支持度是 D 中事务同时包含 X、Y 的百分比即概率置信度是 D 中事务已经包含 X 的情况下包含 Y 的百分比即条件概率。如果满足最小支持度阈值和最小置信度阈值则认为关联规则是有趣的。这些阈值是根据挖掘需要人为设定的。这里举一个简单的例子进行说明。顾客购买记录TID 乒乓球拍 乒乓球 运动鞋 羽毛球1 1 1 1 02 1 1 0 03 1 0 0 04 1 0 1 05 0 1 1 16 1 1 0 0上表是顾客购买记录的数据库 D包含 6 个事务。项集 I {乒乓球拍乒乓球运动鞋羽毛球}。考虑关联规则频繁二项集乒乓球拍与乒乓球事务1,2,3,4,6包含乒乓球拍事务1,2,6同时包含乒乓球拍和乒乓球这里用 X 表示购买了乒乓球用 Y 表示购买了乒乓球拍则X˄Y3, D6支持度(X˄Y)/D0.5X5, 置信度(X˄Y)/X0.6。若给定最小支持度α 0.5最小置信度β 0.6认为购买乒乓球拍和购买乒乓球之间存在关联。常见的关联规则挖掘算法包括 Apriori 算法和 FP-Growth 算法等。协同过滤推荐技术从被提出到现在已有十余年在多年的发展历程中诞生了很多新的推荐算法。协同过滤作为最早、最知名的推荐算法不仅在学术界得到了深入研究而且至今在业界仍有广泛的应用已经被大量应用到电子商务的推荐系统中。协同过滤主要包括基于用户的协同过滤、基于物品的协同过滤和基于模型的协同过滤。基于用户的协同过滤算法简称 UserCF 算法是推荐系统中最古老的算法可以说UserCF 的诞生标志着推荐系统的诞生。该算法在 1992 年 被提出直到现在该算法都是推荐系统领域最著名的算法之一。UserCF 算法符合人们对于“趣味相投”的认知即兴趣相似的用户往往有相同的物品喜好当目标用户需要个性化推荐时可以先找到和目标用户有相似兴趣的用户群体然后将这个用户群体喜欢的、而目标用户没有听说过的物品推荐给目标用户这种方法就称为“基于用户的协同过滤算法”。基于物品的协同过滤算法简称 ItemCF 算法是目前业界应用最多的算法。无论是亚马逊还是 Netflix其推荐系统的基础都是 ItemCF 算法。ItemCF 算法是给目标用户推荐那些和他们之前喜欢的物品相似的物品。ItemCF 算法并不利用物品的内容属性计算物品之间的相似度而主要通过分析用户的行为记录来计算物品之间的相似度该算法基于的假设是物品 A 和物品 B 具有很大的相似度是因为喜欢物品 A 的用户大多也喜欢物品 B。例如该算法会因为你购买过《数据挖掘导论》而给你推荐《机器学习实战》因为买过《数据挖掘导论》的用户多数也购买了《机器学习实战》。基于模型的协同过滤算法ModelCF是通过已经观察到的所有用户给产品的打分来推断每个用户的喜好并向用户推荐适合的产品。实际上ModelCF 同时考虑了用户和物品两个方面因此它也可以看作是 UserCF 和 ItemCF 的混合形式。编程要求根据相关知识完成右侧选择题测试说明若选择题答案与正确答案一致则可通关。开始你的任务吧祝你成功有任何问题都可以随时关注私信