十大经典算法之C4.5

上次发了个数据挖掘的十大经典算法的18个候选算法,因时间问题没有对其进行详细的介绍。
这次想把这18个候选算法逐个做详细的介绍。
记得有一次听吴信东老师的讲座,吴老师说:“作为一个从事数据挖掘的研究者,如果连这18个算法都没听说过,那就是要自己反省一下了。”
所以就上网找了介绍,在这里想和大家一起学习。

 

数据挖掘工具

#1. C4.5

Quinlan, J. R. 1993. C4.5: Programs for Machine Learning.
Morgan Kaufmann Publishers Inc. 数据挖掘交友

决策树是如何工作的
决策树一般都是自上而下的来生成的。
选择分割的方法有好几种,但是目的都是一致的:对目标类尝试进行最佳的分割。
从根到叶子节点都有一条路径,这条路径就是一条“规则”。
决策树可以是二叉的,也可以是多叉的。
对每个节点的衡量:
1)        通过该节点的记录数
2)        如果是叶子节点的话,分类的路径
3)        对叶子节点正确分类的比例。
有些规则的效果可以比其他的一些规则要好。 数据挖掘实验室

由于ID3算法在实际应用中存在一些问题,于是Quilan提出了C4.5算法,严格上说C4.5只能是ID3的一个改进算法。相信大家对ID3算法都很.熟悉了,这里就不做介绍。
    C4.5算法继承了ID3算法的优点,并在以下几方面对ID3算法进行了改进:
    1) 用信息增益率来选择属性,克服了用信息增益选择属性时偏向选择取值多的属性的不足;
    2) 在树构造过程中进行剪枝;
    3) 能够完成对连续属性的离散化处理;
    4) 能够对不完整数据进行处理。
    C4.5算法有如下优点:产生的分类规则易于理解,准确率较高。其缺点是:在构造树的过程中,需要对数据集进行多次的顺序扫描和排序,因而导致算法的低效。此外,C4.5只适合于能够驻留于内存的数据集,当训练集大得无法在内存容纳时程序无法运行。

数据挖掘研究院

[数据挖掘专家] [数据挖掘研究院] [数据挖掘论坛] [数据挖掘实验室]
上一篇:总经理给我的第二个印象
下一篇:中国网络营销未来的十大趋势
最新评论共有 0 位网友发表了评论 , 查看所有评论
发表评论( 不能超过250字,需审核,请自觉遵守互联网相关政策法规。 )
匿名?
数据挖掘网站导航 数据挖掘论坛导航
  • 数据挖掘工具
  • 数据挖掘论坛
  • DataCruncher - Cognos
  • MineSet - MathSoft
  • Intelligent Miner - GainSmarts
  • Sqlserver - SAS - Clementine
  • CART - Weka - WizSoft
  • NeuroShell - ModelQuest
  • data mining tools - Darwin
  • 数据挖掘交友
  • 数据挖掘博客
  • 数据挖掘工具
  • 数据挖掘资源
  • 数据挖掘技术算法
  • 数据挖掘相关期刊、会议
  • 研究院联盟合作专区
  • 数据挖掘基础与相关技术
  • 数据挖掘厂商与就业
  • 数据挖掘研究者乐园
  • 知名厂商数据挖掘工具资料
  • 国内数据挖掘实验室
  • Foreign Data Mining Lab
  • 热点关注
  • SAP FI/CO Reading Repository - [ERP]
  • 预言2008年软件业界十大风云事件
  • 数据挖掘面试记录
  • 垂直搜索引擎技术
  • 数据挖掘经典算法
  • 十大经典算法之C4.5
  • 2008中国信息技术应用学术研讨会征文通知
  • 数据分析过程中的多维技术
  • 数据挖掘研究&开发网站
  • SQL Server 2k5数据挖掘功能介绍
  • 论坛最新话题
  • Foundations of Statistical Natural Langu
  • Game Theory meet Data Mining: A Recent P
  • System Building: How does it help or hin
  • 数据挖掘与Clementine培训
  • 新手报到
  • 求 SASEM 客户流失预测分析
  • 数据挖掘工程师/搜索研究院—北京——无线
  • 数据挖掘入门介绍(如何着手数据挖掘)
  • Information Overload Survey Results
  • The INEX 2005 Workshop on Element Retrie
  • 相关资讯
  • Google不知不觉中把微软装进口袋里
  • 预言2008年软件业界十大风云事件
  • 什么是竞争情报
  • Google上市三周年 从华尔街宠儿到网络巨兽
  • 数据挖掘研究&开发网站
  • Oracle Portal 及其门户网站开发概述
  • SAP 全球技术研发者大会 2007 上海
  • 中国电讯,电讯营运商:客户流失的深层次原
  • 数据挖掘实验室资料
  • 数据挖掘博客地址
  • 数据挖掘实验室网站地址
  • Prepare for Medicare audits by using dat
  • 注册成为SAS用户与爱好者俱乐部会员
  • 水南梅
  • 明日烟
  • 新人报道
  • 下载
  • 厦门服务器托管,450元/月—0592-5177319 高
  • 买空间送域名--0592-5177319 高静