数据挖掘 Data Mining 数据挖掘


数据挖掘 Data Mining 数据挖掘

文章插图
数据挖掘(数据挖掘(Data Mining))【数据挖掘 Data Mining 数据挖掘】DM(数据挖掘(Data Mining))一般指本词条
数据挖掘(Data mining)又译为资料探勘、数据採矿 。它是资料库知识发现(英语:Knowledge-Discovery in Databases,简称:KDD)中的一个步骤 。数据挖掘一般是指从大量的数据中通过算法搜寻隐藏于其中信息的过程 。数据挖掘通常与计算机科学有关,并通过统计、线上分析处理、情报检索、机器学习、专家系统(依靠过去的经验法则)和模式识别等诸多方法来实现上述目标 。
基本介绍中文名:数据挖掘
外文名:Data mining
别名:资料探勘、数据採矿
所属学科:计算机科学
套用领域:情报检索、数据分析、模式识别等
相关领域:人工智慧、资料库
起源需要是发明之母 。近年来,数据挖掘引起了信息产业界的极大关注,其主要原因是存在大量数据,可以广泛使用,并且迫切需要将这些数据转换成有用的信息和知识 。获取的信息和知识可以广泛用于各种套用,包括商务管理,生产控制,市场分析,工程设计和科学探索等 。数据挖掘利用了来自如下一些领域的思想:(1) 来自统计学的抽样、估计和假设检验,(2)人工智慧、模式识别和机器学习的搜寻算法、建模技术和学习理论 。数据挖掘也迅速地接纳了来自其他领域的思想,这些领域包括最最佳化、进化计算、资讯理论、信号处理、可视化和信息检索 。一些其他领域也起到重要的支撑作用 。特别地,需要资料库系统提供有效的存储、索引和查询处理支持 。源于高性能(并行)计算的技术在处理海量数据集方面常常是重要的 。分散式技术也能帮助处理海量数据,并且当数据不能集中到一起处理时更是至关重要 。发展阶段第一阶段:电子邮件阶段这个阶段可以认为是从70年代开始,平均的通讯量以每年几倍的速度增长 。第二阶段:信息发布阶段从1995年起,以Web技术为代表的信息发布系统,爆炸式地成长起来,成为目前Internet的主要套用 。中小企业如何把握好从“粗放型”到“精準型”行销时代的电子商务 。第三阶段: EC(Electronic Commerce),即电子商务阶段EC在美国也才刚刚开始,之所以把EC列为一个划时代的东西,是因为Internet的最终主要用于商业用途,就是电子商务 。同时反过来也可以说,若干年后的商业信息,主要是通过Internet传递 。Internet即将成为我们这个商业信息社会的神经系统 。1997年底在加拿大温哥华举行的第五次亚太经合组织非正式首脑会议(APEC)上美国总统柯林顿提出敦促各国共同促进电子商务发展的议案,其引起了全球首脑的关注,IBM、HP和Sun等国际着名的信息技术厂商已经宣布1998年为电子商务年 。第四阶段:全程电子商务阶段随着SaaS(Software as a service)软体服务模式的出现,软体纷纷登入网际网路[5],延长了电子商务链条,形成了当下最新的“全程电子商务”概念模式 。也因此形成了一门独立的学科——数据挖掘与客户关係管理硕士 。使用分析方法· 分类 (Classification)
数据挖掘 Data Mining 数据挖掘

文章插图
图1数据挖掘的系统模型· 估计(Estimation)· 预测(Prediction)· 相关性分组或关联规则(Affinity grouping or association rules)· 聚类(Clustering)· 複杂数据类型挖掘(Text, Web ,图形图像,视频,音频等)方法简介·分类 (Classification)首先从数据中选出已经分好类的训练集,在该训练集上运用数据挖掘分类的技术,建立分类模型,对于没有分类的数据进行分类 。例子:a. 信用卡申请者,分类为低、中、高风险b. 故障诊断:中国宝钢集团与上海天律信息技术有限公司合作,採用数据挖掘技术对钢材生产的全流程进行质量监控和分析,构建故障地图,实时分析产品出现瑕疵的原因,有效提高了产品的优良率 。注意: 类的个数是确定的,预先定义好的· 估计(Estimation)估计与分类类似,不同之处在于,分类描述的是离散型变数的输出,而估值处理连续值的输出;分类的类别是确定数目的,估值的量是不确定的 。例子:a. 根据购买模式,估计一个家庭的孩子个数b. 根据购买模式,估计一个家庭的收入c. 估计real estate的价值一般来说,估值可以作为分类的前一步工作 。给定一些输入数据,通过估值,得到未知的连续变数的值,然后,根据预先设定的阈值,进行分类 。例如:银行对家庭贷款业务,运用估值,给各个客户记分(Score 0~1) 。然后,根据阈值,将贷款级别分类 。· 预测(Prediction)通常,预测是通过分类或估值起作用的,也就是说,通过分类或估值得出模型,该模型用于对未知变数的预言 。从这种意义上说,预言其实没有必要分为一个单独的类 。预言其目的是对未来未知变数的预测,这种预测是需要时间来验证的,即必须经过一定时间后,才知道预言準确性是多少 。· 相关性分组或关联规则(Affinity grouping or association rules)决定哪些事情将一起发生 。例子:a. 超市中客户在购买A的同时,经常会购买B,即A => B(关联规则)b. 客户在购买A后,隔一段时间,会购买B (序列分析)· 聚类(Clustering)聚类是对记录分组,把相似的记录在一个聚集里 。聚类和分类的区别是聚集不依赖于预先定义好的类,不需要训练集 。例子:a. 一些特定症状的聚集可能预示了一个特定的疾病b. 租VCD类型不相似的客户聚集,可能暗示成员属于不同的亚文化群聚集通常作为数据挖掘的第一步 。例如,"哪一种类的促销对客户回响最好?",对于这一 类问题,首先对整个客户做聚集,将客户分组在各自的聚集里,然后对每个不同的聚集,回答问题,可能效果更好 。· 描述和可视化(Description and Visualization) 是对数据挖掘结果的表示方式 。一般只是指数据可视化工具,包含报表工具和商业智慧型分析产品(BI)的统称 。譬如通过Yonghong Z-Suite等工具进行数据的展现,分析,钻取,将数据挖掘的分析结果更形象,深刻的展现出来 。经验之谈第一,目标律:业务目标是所有数据解决方案的源头 。第二,知识律:业务知识是数据挖掘过程每一步的核心 。第三,準备律:数据预处理比数据挖掘其他任何一个过程都重要 。第四,试验律(NFL律:No Free Lunch):对于数据挖掘者来说,天下没有免费的午餐,一个正确的模型只有通过试验(experiment)才能被发现 。第五,模式律(大卫律):数据中总含有模式 。第六,洞察律:数据挖掘增大对业务的认知 。第七,预测律:预测提高了信息泛化能力 。第八,价值律:数据挖掘的结果的价值不取决于模型的稳定性或预测的準确性 。第九,变化律:所有的模式因业务变化而变化 。成功案例数据挖掘帮助Credilogros Cía Financiera S.A.改善客户信用评分Credilogros Cía Financiera S.A. 是阿根廷第五大信贷公司,资产估计价值为9570万美元,对于Credilogros而言,重要的是识别与潜在预先付款客户相关的潜在风险,以便将承担的风险最小化 。该公司的第一个目标是创建一个与公司核心繫统和两家信用报告公司系统互动的决策引擎来处理信贷申请 。同时,Credilogros还在寻找针对它所服务的低收入客户群体的自定义风险评分工具 。除这些之外,其他需求还包括解决方案能在其35个分支办公地点和200多个相关的销售点中的任何一个实时操作,包括零售家电连锁店和手机销售公司 。最终Credilogros 选择了SPSS Inc.的数据挖掘软体PASWModeler,因为它能够灵活并轻鬆地整合到 Credilogros 的核心信息系统中 。通过实现PASW Modeler,Credilogros将用于处理信用数据和提供最终信用评分的时间缩短到了8秒以内 。这使该组织能够迅速批准或拒绝信贷请求 。该决策引擎还使 Credilogros 能够最小化每个客户必须提供的身份证明文档,在一些特殊情况下,只需提供一份身份证明即可批准信贷 。此外,该系统还提供监控功能 。Credilogros目前平均每月使用PASW Modeler处理35000份申请 。仅在实现 3 个月后就帮助Credilogros 将贷款支付失职减少了 20%.数据挖掘帮助DHL实时跟蹤货箱温度DHL是国际快递和物流行业的全球市场领先者,它提供快递、水陆空三路运输、契约物流解决方案,以及国际邮件服务 。DHL的国际网路将超过220个国家及地区联繫起来,员工总数超过28.5万人 。在美国 FDA 要求确保运送过程中药品装运的温度达标这一压力之下,DHL的医药客户强烈要求提供更可靠且更实惠的选择 。这就要求DHL在递送的各个阶段都要实时跟蹤货柜的温度 。虽然由记录器方法生成的信息準确无误,但是无法实时传递数据,客户和DHL都无法在发生温度偏差时採取任何预防和纠正措施 。因此,DHL的母公司德国邮政世界网(DPWN)通过技术与创新管理(TIM)集团明确拟定了一个计画,準备使用RFID技术在不同时间点全程跟蹤装运的温度 。通过IBM全球企业谘询服务部绘製决定服务的关键功能参数的流程框架 。DHL获得了两方面的收益:对于最终客户来说,能够使医药客户对运送过程中出现的装运问题提前做出回响,并以引人注目的低成本全面切实地增强了运送可靠性 。对于DHL来说,提高了客户满意度和忠实度;为保持竞争差异奠定坚实的基础;并成为重要的新的收入增长来源 。行业套用价格竞争空前激烈,语音业务增长趋缓,快速增长的中国移动通信市场正面临着前所未有的生存压力 。中国电信业改革的加速推进形成了新的竞争态势,移动运营市场的竞争广度和强度将进一步加大,这特别表现在集团客户领域 。移动信息化和集团客户已然成为未来各运营商应对竞争、获取持续增长的新引擎 。随着国内三足鼎立全业务竞争态势和3G牌照发放,各运营商为集团客户提供融合的信息化解决方案将是大势所趋,而移动信息化将成为全面进入信息化服务领域的先导力量 。传统移动运营商因此面临着从传统个人业务转向同时拓展集团客户信息化业务领域的挑战 。如何应对来自内外部的挑战,迅速以移动信息化业务作为融合业务的竞争利器之一拓展集团客户市场,在新兴市场中立于不败之地,是传统移动运营商需要解决的紧迫问题 。从目前网路招聘的信息来看,大小公司对数据挖掘的需求有50多个方面(来源见参考资料):1、数据统计分析2、预测预警模型3、数据信息阐释4、数据採集评估5、数据加工仓库6、品类数据分析7、销售数据分析8、网路数据分析9、流量数据分析10、交易数据分析11、媒体数据分析12、情报数据分析13、金融产品设计14、日常数据分析15、总裁万事通16、数据变化趋势17、预测预警模型18、运营数据分析19、商业机遇挖掘20、风险数据分析21、缺陷信息挖掘22、决策数据支持23、运营最佳化与成本控制24、质量控制与预测预警25、系统工程数学技术26、用户行为分析/客户需求模型27、产品销售预测(热销特徵)28、商场整体利润最大化系统设计29、市场数据分析30、综合数据关联繫统设计31、行业/企业指标设计32、企业发展关键点分析33、资金鍊管理设计与风险控制34、用户需求挖掘35、产品数据分析36、销售数据分析37、异常数据分析38、数学规划与数学方案39、数据实验模拟40、数学建模与分析41、呼叫中心数据分析42、贸易/进出口数据分析43、海量数据分析系统设计、关键技术研究44、数据清洗、分析、建模、调试、最佳化45、数据挖掘算法的分析研究、建模、实验模拟46、组织机构运营监测、评估、预测预警47、经济数据分析、预测、预警48、金融数据分析、预测、预警49、科研数学建模与数据分析:社会科学,自然科学,医药,农学,计算机,工程,信息,军事,图书情报等50、数据指标开发、分析与管理51、产品数据挖掘与分析 52、商业数学与数据技术53、故障预测预警技术54、数据自动分析技术55、泛工具分析56、互译57、指数化其中,互译与指数化是数据挖掘除计算机技术之外最核心的两大技术 。经典算法1. C4.5:是机器学习算法中的一种分类决策树算法,其核心算法是ID3算法 。2. K-means算法:是一种聚类算法 。3.SVM:一种监督式学习的方法,广泛运用于统计分类以及回归分析中4.Apriori :是一种最有影响的挖掘布尔关联规则频繁项集的算法 。5.EM:最大期望值法 。6.pagerank:是google算法的重要内容 。7. Adaboost:是一种叠代算法,其核心思想是针对同一个训练集训练不同的分类器然后把弱分类器集合起来,构成一个更强的最终分类器 。8.KNN:是一个理论上比较成熟的的方法,也是最简单的机器学习方法之一 。9.Naive Bayes:在众多分类方法中,套用最广泛的有决策树模型和朴素贝叶斯(Naive Bayes)10.Cart:分类与回归树,在分类树下面有两个关键的思想,第一个是关于递归地划分自变数空间的想法,第二个是用验证数据进行减枝 。关联规则定义在描述有关关联规则的一些细节之前,我们先来看一个有趣的故事: "尿布与啤酒"的故事 。在一家超市里,有一个有趣的现象:尿布和啤酒赫然摆在一起出售 。但是这个奇怪的举措却使尿布和啤酒的销量双双增加了 。这不是一个笑话,而是发生在美国沃尔玛连锁店超市的真实案例,并一直为商家所津津乐道 。沃尔玛拥有世界上最大的数据仓库系统,为了能够準确了解顾客在其门店的购买习惯,沃尔玛对其顾客的购物行为进行购物篮分析,想知道顾客经常一起购买的商品有哪些 。沃尔玛数据仓库里集中了其各门店的详细原始交易数据 。在这些原始交易数据的基础上,沃尔玛利用数据挖掘方法对这些数据进行分析和挖掘 。一个意外的发现是:"跟尿布一起购买最多的商品竟是啤酒!经过大量实际调查和分析,揭示了一个隐藏在"尿布与啤酒"背后的美国人的一种行为模式:在美国,一些年轻的父亲下班后经常要到超市去买婴儿尿布,而他们中有30%~40%的人同时也为自己买一些啤酒 。产生这一现象的原因是:美国的太太们常叮嘱她们的丈夫下班后为小孩买尿布,而丈夫们在买尿布后又随手带回了他们喜欢的啤酒 。