机器学习经典算法
45页1、经典算法,机器学习十大经典算法,C4.5 分类与回归树 朴素贝叶斯 支持向量机(SVM) K近邻(KNN) AdaBoost K均值(K-means) 最大期望(EM) Apriori算法 Pagerank,机器学习方法的分类,基于学习方式的分类 (1)有监督学习:输入数据中有导师信号,以概率函数、代数函数或人工神经网络为基函数模型,采用迭代计算方法,学习结果为函数。 (2)无监督学习:输入数据中无导师信号,采用聚类方法,学习结果为类别。典型的无导师学习有发现学习、聚类、竞争学习等。 (3)强化学习(增强学习):以环境反馈(奖/惩信号)作为输入,以统计和动态规划技术为指导的一种学习方法。,有监督学习(用于分类),标定的训练数据 训练过程:根据目标输出与实际输出的误差信号来调节参数 典型方法 全局:BN, NN,SVM, Decision Tree 局部:KNN、CBR(Case-base reasoning),无监督学习(用于聚类),不存在标定的训练数据 学习机根据外部数据的统计规律(e.g. Cohension & divergence )来调节系统参数,以使输出能反映数据的某种特性
2、。 典型方法 K-means、SOM.,示例:聚类,半监督学习,结合(少量的)标定训练数据和(大量的)未标定数据来进行学习 典型方法 Co-training、EM、Latent variables.,一、C4.5,C4.5由J.Ross Quinlan在ID3的基础上提出的。ID3算法用来构造决策树。决策树是一种类似流程图的树结构,其中每个内部节点(非树叶节点)表示在一个属性上的测试,每个分枝代表一个测试输出,而每个树叶节点存放一个类标号。一旦建立好了决策树,对于一个未给定类标号的元组,跟踪一条有根节点到叶节点的路径,该叶节点就存放着该元组的预测。 决策树的优势在于不需要任何领域知识或参数设置,产生的分类规则易于理解,准确率较高。适合于探测性的知识发现。 缺点是:在构造树的过程中,需要对数据集进行多次的顺序扫描和排序,因而导致算法的低效。,增益比率度量是用增益度量Gain(S,A)和分裂信息度量SplitInformation(S,A)来共同定义的 设S代表训练数据集,由s个样本组成。A是S的某个属性,有m个不同的取值,根据这些取值可以把S划分为m个子集,Si表示第i个子集(i=1,2
3、,m),|Si|表示子集Si中的样本数量。,数据集如图1所示,它表示的是天气情况与去不去打高尔夫球之间的关系,二、分类和回归树(Classification and Regression TreesCART,可简写为C&RT),CART算法中的每一次分裂把数据分为两个子集,每个子集中的样本比被划分之前具有更好的一致性。它是一个递归的过程,也就是说,这些子集还会被继续划分,这个过程不断重复,直到满足终止准则,然后通过修剪和评估,得到一棵最优的决策树。,在ID3算法中,用“熵”来度量数据集随机性的程度。在CART中我们把这种随机性的程度称为“杂度”(impurity,也称为“不纯度”),并且用“吉尼”(gini)指标来衡量它。,决策树停止生长的条件,满足以下一个即停止生长。 (1) 节点达到完全纯性; (2) 数树的深度达到用户指定的深度; (3) 节点中样本的个数少于用户指定的个数; (4) 异质性指标下降的最大幅度小于用户指定的幅度。,剪枝:完整的决策树对训练样本特征的描述可能“过于精确”(受噪声数据的影响),缺少了一般代表性而无法较好的用对新数据做分类预测,出现 ”过度拟合”。 移去
4、对树的精度影响不大的划分。使用 成本复杂度方法,即同时度量错分风险和树的复杂程度,使二者越小越好。 剪枝方式: A、 预修剪(prepruning):停止生长策略 B、后修剪(postpruning):在允许决策树得到最充分生长的基础上,再根据一定的规则,自下而上逐层进行剪枝。,优点,(1)可自动忽略对目标变量没有贡献的属性变量,也为判断属性变量的重要性,减少变量数据提供参考; (2)在面对诸如存在缺失值、变量数多等问题时C&RT 显得非常稳健(robust); (3)估计模型通常不用花费很长的训练时间; (4) 推理过程完全依据属性变量的取值特点(与 C5.0不同,C&RT的输出字段既可以是数值型,也可以是分类型) (5)比其他模型更易于理解从模型中得到的规则能得到非常直观的解释,决策推理过程可以表示成 IFTHEN的形式 (6)目标是定类变量为分类树,若目标变量是定距变量,则为回归树; (7)通过检测输入字段,通过度量各个划分产生的异质性的减小程度,找到最佳的一个划分。 (8)非常灵活,可以允许有部分错分成本,还可指定先验概率分布,可使用自动的成本复杂性剪枝来得到归纳性更强的树,三
《机器学习经典算法》由会员小**分享,可在线阅读,更多相关《机器学习经典算法》请在金锄头文库上搜索。
2020年高考真题——理科综合(全国卷Ⅲ)+Word版含答案
2021年绝味鸭脖策划书
2021年熟食店创业方案
2021年熟食店开店策划
2021年卤菜店创业计划书
2021年周黑鸭网络营销策划方案
东大21年1月考试《现代设计方法》考核作业
谈我国行政管理效率的现状及其改观对策(论文)
单证员考试-备考辅导-复习资料:无贸易背景信用证案分析.docx
土木工程毕业生答辩自述.docx
建筑学毕业后工作状态真实写照.doc
C#代码规范(湖南大学).doc
xx区食药监局2019年工作总结及2020年工作计划
2019年中医院药物维持治疗门诊工人先锋号先进事迹
2019年度xx乡镇林长制工作总结
2019年性艾科工作计划书
2019年人才服务局全国扶贫日活动开展情况总结
关于组工信息选题的几点思考
摘了穷帽子 有了新模样
2019年某集团公司基层党支部书记培训班心得体会
2024-01-31 15页
2024-01-31 21页
2024-01-31 37页
2024-01-31 30页
2024-01-31 22页
2024-01-31 48页
2024-01-31 32页
2024-01-31 40页
2024-01-31 31页
2024-01-31 20页