PCA&&决策树&&随机森林

PCA是无监督学习(没有标签只有特征也可以做)基于降维后使方差最大使数据分的更大,目标是提取最有价值的信息。使原始密集的点扩散开好做分类,降低维度后意义需要专家解释(降维后可以对数据进行保密)可以降低数据冗余性。 协方差表示线性离散度。不希望线性相关数据,用协方差描述。

决策树既可以做分类也可以做回归分为训练阶段和分类阶段。Gini系数和熵值意义差不多,越低分类效果越好,计算公式不一样。熵值表示物体纯度,希望模型更纯。对于连续的数据可以离散化(比如0-5算1) 根节点选取基本思想:随着深度的增加,节点的熵值迅速降低。枚举所有属性当根节点选信息增益(ID3:熵值相减。越大越好)最大的定根节点。再去递归的算根节点。存在问题:(选择无关属性比如ID,会使得信息增益最大)。所以选择信息增益率(C4.5,ID3/自身熵值)。CART(Gini系数)

决策树剪枝:分支太多导致过拟合。预剪枝:边构建边剪枝(提前指定深度)。后剪枝:决策树构建好之后,才开始剪枝,构造评价函数叶子越多损失越大。

随机森林:构造多颗决策树投票,分类看众数,回归看平均数。 随机:在训练集随机有放回抽取一定样本的数据(减少异常点的影响)。特征选择也是随机的。

正态分布的偏度和峰度都是0。 偏度是数据的不对称程度。 正峰度 具有正峰度值的分布表明,相比于正态分布,该分布有更重的尾部。

经验分享 程序员 微信小程序 职场和发展