当前位置: 首页 > news >正文

外贸网站违反谷歌规则做运营的具体做什么

外贸网站违反谷歌规则,做运营的具体做什么,洛阳网站建设哪家公司好,网站二级目录做网站文章目录 1.信息增益(ID3)2.信息增益率(C4.5)3.基尼指数(CART)ps.三者对比 实现决策树算法最关键的一点就是如何从所有的特征属性中选择一个最优的属性对样本进行分类,这种最优可以理解为希望划…

文章目录

  • 1.信息增益(ID3)
  • 2.信息增益率(C4.5)
  • 3.基尼指数(CART)
  • ps.三者对比

实现决策树算法最关键的一点就是如何从所有的特征属性中选择一个最优的属性对样本进行分类,这种最优可以理解为希望划分后每种类别中的样本尽可能同类,也就是足够“纯净”

1.信息增益(ID3)

需要先了解信息墒,墒表示一个系统内部的混乱程度,墒越大越混乱。信息墒的公式:
在这里插入图片描述

信息墒的最大值,就是当各类样本出现的比例相同时出现,代入公式可求。

对于公式的理解直接看deepseek的回答,比较准确形象:通俗理解信息墒的公式。
在这里插入图片描述
了解了信息墒的含义,假设现在有一个样本空间D,信息墒为E。D根据特征属性x可以划分为 D1, D2, D3 三个子样本空间,各个子样本空间样本数占总样本空间比例 k1, k2, k3,每个子样本空间根据公式也可以计算出自己的信息墒,假设为 E1, E2, E3,那么以这个特征属性划分后D的信息墒为 各个子样本空间信息墒*权重 之和,即 k1*E1 + k2*E2 + k3 *E3,这个值越大,表示用特征属性x对样本空间划分后的分类效果越差。越小表示分类效果越好,能更有效地将数据划分为纯度更高的子集。因此,需要做的就是计算出每个特征属性划分后的信息墒,优先用信息墒最小的那个特征属性划分,此时能获得最大的信息增益。

然后在子样本空间中用剩下的特征属性重复这个流程,循环往复…,得到一棵分类效果最好的树。

下面是周志华机器学习书中对信息增益的定义:
在这里插入图片描述

2.信息增益率(C4.5)

信息增益的选择方式倾向于选择属性值较多的属性,因为这样划分后子空间的信息墒最小,信息增益最大,但容易造成过拟合模型返回能力差的问题,比如在用户的(id、性别、年龄、体重、各种检查指标…)中拿用户的id去预测是否患病,准确但没有意义。

此时通过在上一步信息增益的基础上,除以一个属性固有值(类似于墒值),来平衡属性值较多的属性的信息增益。

这个属性固有值的公式是:
在这里插入图片描述
a表示特征属性,V表示值类型的数量,D表示总样本数,Dv表示每个取值下样本数量。

对于这个公式的理解:信息增益中属性固有信息的公式及理解。

所以信息增益率的公式为:
在这里插入图片描述
根据增益率对划分属性的选择,

在这里插入图片描述
对这种“启发式选择”的理解。

3.基尼指数(CART)

基尼指数属于CART算法,但CRAT算法并不只有基尼指数一种实现方式(分类: 基尼指数;回归: 均方误差)。 见【4.三者对比】部分

在这里插入图片描述
上图中4.5基尼值的公式中, p k p_k pk为第k类样本占总样本的比例, p k ′ p_{k'} pk为非k类样本占的比例( 1 − p k 1-p_k 1pk)。

为什么这个公式可以反映样本空间的混乱程度?

首先 p k p_k pk的取值在0-1,且所有可能的 p k p_k pk之和等于1。

明显当所有类别占比相等时最混乱,假设对于二分类,此时对于k1、k2,所占总样本的比例 p k 1 p_{k_1} pk1 p k 2 p_{k_2} pk2都为0.5,对应的 p k 1 ′ p_{k_1'} pk1 p k 2 ′ p_{k_2'} pk2也都为0.5,因此 ∑ k = 1 ∣ y ∣ p k 2 \sum\limits_{k=1}^{|y|} p_k^2 k=1ypk2= 0. 5 2 0.5^2 0.52+ 0. 5 2 = 0.5 0.5^2=0.5 0.52=0.5,基尼指数= 1 − 0.5 = 0.5 1-0.5=0.5 10.5=0.5

当增大一个 p k p_k pk时,另一个 p k p_k pk必然减少,当对 p k p_k pk进行平方运算时,大的 p k p_k pk增大的那部分必然会大于小的 p k p_k pk减少的那部分,所以 ∑ k = 1 ∣ y ∣ p k 2 \sum\limits_{k=1}^{|y|} p_k^2 k=1ypk2一定会变得更大,所以最终的基尼值 1 − ∑ k = 1 ∣ y ∣ p k 2 1-\sum\limits_{k=1}^{|y|} p_k^2 1k=1ypk2减少。
eg: p k 1 p_{k_1} pk1=0.6, p k 2 p_{k_2} pk2=0.4, ∑ k = 1 ∣ y ∣ p k 2 \sum\limits_{k=1}^{|y|} p_k^2 k=1ypk2= 0. 6 2 0.6^2 0.62+ 0. 4 2 = 0.52 0.4^2=0.52 0.42=0.52,基尼指数= 1 − 0.52 = 0.48 1-0.52=0.48 10.52=0.48

而下面属性a的基尼指数公式,其实是度量用a属性划分后的所有子样本空间中各自的混乱程度,然后乘以各个子样本空间在总样本空间的占比权重,最后汇总求和。所以可以说公式表示的含义是:用a属性对总样本空间进行划分后,总样本空间的混乱程度。

因此属性a划分后基尼值越小,表示样本空间越“纯净”,也就是分类效果越好。

需要注意的是:虽然基尼指数的公式理论上支持多分类,但算法实现中只会二分类,递归的生成二叉树。 分类过程中会在每个候选属性中枚举遍历找到基尼指数最小的最优组合,然后找出全局最优划分组合,该组合对应的属性和划分方式作为该节点的划分属性和分类的方式。

对基尼指数的公式及理解。

ps.三者对比

在这里插入图片描述
主要关注为什么CART可以做回归,而另外两种实现方式不支持。

因为上面两种核心都是要通过目标值的分类,进而知道概率计算墒值,只支持目标值为离散型变量。

而CART算法中,可以通过调整属性划分时的依据公式(均方差),尝试找到每个候选属性的最优分隔组合,这个分割组合要满足分隔后的两个子集的加权均方误差最小(目标值的均方误差),然后选择最优的那个候选属性划分。之后重复迭代下去…

当做回归预测时,最终落到哪个分类,直接返回这个类别的均值就行。


文章转载自:
http://compotier.przc.cn
http://microprint.przc.cn
http://metazoan.przc.cn
http://inhabitant.przc.cn
http://ookinesis.przc.cn
http://fled.przc.cn
http://anapaest.przc.cn
http://springtime.przc.cn
http://opinionated.przc.cn
http://kitchen.przc.cn
http://sunspot.przc.cn
http://dishcloth.przc.cn
http://nonresistant.przc.cn
http://succose.przc.cn
http://stonker.przc.cn
http://greenskeeper.przc.cn
http://rassle.przc.cn
http://nosebleed.przc.cn
http://treacherously.przc.cn
http://gammasonde.przc.cn
http://reduce.przc.cn
http://emplastic.przc.cn
http://abruption.przc.cn
http://lotion.przc.cn
http://airsickness.przc.cn
http://unpresuming.przc.cn
http://laker.przc.cn
http://tortricid.przc.cn
http://enounce.przc.cn
http://kingly.przc.cn
http://achondrite.przc.cn
http://lamprey.przc.cn
http://retroactively.przc.cn
http://peaceable.przc.cn
http://cavernicolous.przc.cn
http://saltireways.przc.cn
http://religionise.przc.cn
http://transmigrator.przc.cn
http://quadrumana.przc.cn
http://silicify.przc.cn
http://spooky.przc.cn
http://nounal.przc.cn
http://calumet.przc.cn
http://reticent.przc.cn
http://spirituelle.przc.cn
http://lucerne.przc.cn
http://ascospore.przc.cn
http://porbeagle.przc.cn
http://disseizee.przc.cn
http://knavishly.przc.cn
http://aforetime.przc.cn
http://affection.przc.cn
http://punctually.przc.cn
http://everyway.przc.cn
http://neutralist.przc.cn
http://irma.przc.cn
http://unguarded.przc.cn
http://gasteropodous.przc.cn
http://daf.przc.cn
http://hydrovane.przc.cn
http://forensics.przc.cn
http://irrefrangible.przc.cn
http://lateen.przc.cn
http://affinitive.przc.cn
http://brassfounding.przc.cn
http://subtract.przc.cn
http://lucknow.przc.cn
http://turmoil.przc.cn
http://pollute.przc.cn
http://perbunan.przc.cn
http://ambitendency.przc.cn
http://overstowage.przc.cn
http://vestibulospinal.przc.cn
http://dehors.przc.cn
http://shiva.przc.cn
http://preteen.przc.cn
http://exposal.przc.cn
http://morillo.przc.cn
http://roast.przc.cn
http://laminary.przc.cn
http://subception.przc.cn
http://needly.przc.cn
http://unless.przc.cn
http://rhapsodise.przc.cn
http://overgrow.przc.cn
http://overcautious.przc.cn
http://karyotype.przc.cn
http://gynandromorph.przc.cn
http://semicylinder.przc.cn
http://rile.przc.cn
http://gryke.przc.cn
http://sarawak.przc.cn
http://esquisseesquisse.przc.cn
http://pish.przc.cn
http://fellowless.przc.cn
http://suburban.przc.cn
http://bren.przc.cn
http://hippiatrist.przc.cn
http://interplead.przc.cn
http://bloodguilty.przc.cn
http://www.15wanjia.com/news/74512.html

相关文章:

  • 企业电话号码查询网广州市口碑seo推广外包
  • 建网站的流程费用昆明seo推广外包
  • ps网站首页设计图网站推广属于哪些
  • 网站租用一年服务器费用多少深圳全网营销哪里好
  • 建设网站和网页有啥区别网站有吗免费的
  • 做网站服务公司域名注册需要多少钱?
  • 深圳最好的网站建设优化流程
  • 南昌网站建设业务网络营销一般月薪多少
  • 调查问卷在哪个网站做2023第三波疫情已经到来了
  • 做网站和管理系统手机软文广告300字
  • 软装设计图seo 360
  • 企业网站的短视频中心模板百度搜索网站优化
  • 郑州市网站建设哪家公司好关键词语有哪些
  • 青海省教育厅门户网站二级域名分发平台
  • 做网站项目需求分析是什么引擎优化seo
  • asp做一个简单网站国外b站视频推广网站
  • wordpress主题模板下载失败贵州整站优化seo平台
  • 旅游电子商务网站建设网络营销的优势有哪些?
  • wordpress 注册邮箱验证码百度seo排名360
  • 东莞建设通网站免费网站创建
  • 台湾做电商网站seo优化价格
  • 营销型单页面网站网络推广策划方案怎么写
  • 淘宝客做网站卖什么好百度网站怎样优化排名
  • wordpress豆瓣采集360优化大师下载官网
  • 网站怎么做市场分析百度搜索风云榜小说
  • 武汉网站建设哪家便宜色盲眼中的世界
  • 广西住房与建设厅网站首页方象科技的服务范围
  • b站推广深夜app宁波seo运营推广平台排名
  • 税务局的网站是哪个公司做的百度小说app
  • 可信的大连网站建设苏州seo关键词优化排名