首页 > 代码库 > DecisionTree
DecisionTree
1.信息增益的定义,也就是互信息
2.信息增益的推导
由公式即可得到信息增益
信息增益存在偏向于选择取值较多的特征的问题,信息增益比可以对这一问题进行修正
3.信息增益比
4.基尼指数,基尼指数越大,样本集合的不确定性也就越大,与熵类似
5.ID3算法,使用信息增益作为特征选择准则,递归选择信息增益最大的特征,递归终止条件是信息增益小于某个阈值
6.C4.5算法,使用信息增益比作为选择标准
7.CART(分类与回归树) 回归树以平方误差最小化为准则选择特征,分类树使用基尼指数作为特征选择标准,选择基尼指数最小的作为特征。
7.决策树的剪枝,对付过拟合
损失函数,其中,<Tleaf>是叶子结点的个数
Nt是第t个叶子结点的样本点个数,H(t)为叶节点t的经验熵,或者是基尼指数
如果是经验熵,Ntk是节点t上属于第k类的样本的个数。
CART树的剪枝算法
第一步:剪枝系数的确定
第二步:剪枝算法
DecisionTree
声明:以上内容来自用户投稿及互联网公开渠道收集整理发布,本网站不拥有所有权,未作人工编辑处理,也不承担相关法律责任,若内容有误或涉及侵权可进行投诉: 投诉/举报 工作人员会在5个工作日内联系你,一经查实,本站将立刻删除涉嫌侵权内容。