ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

倾斜数据集的错误指标-混淆矩阵

2026/8/9 3:44:44 拓冰建站 浏览量
倾斜数据集的错误指标-混淆矩阵 有一些特殊的例子他的样本比较小例如 有一种罕见病并且只有0.5%的患者环游该疾病我们进行训练一个模型达到95%的准确率另一额模型我们我们瞬步输出患者健康不是这个病那么这个模型就有99.5%的准确率如果我们仅仅只看这两个数字我们的就会选择错误的算法所以引入一个判断算法性能的方式就是混淆矩阵其中横轴代表真是类别纵轴表示预测类别这样我们就得到了四个象限左上角 真是患病预测也是患病 所以我们交真阳性右上角 没有患病我们预测患病 叫 假阳性左下角 真实患病预测没有患病 叫 假阴性右下角 没有患病 预测没有患病叫真阴性分成了四个单元格之后我们会对齐进行两个常见的指标分别是精确度: 再预测为阳性中模型预测阳性是否可信预测为阳性且实际为阳性的 / 预测为阳性的召回率我在所有阳性中有多少阳性抓到了预测为阳性且实际为阳性的 / 实际为阳性的准确率模型预测对了多少榆次额对的真阴性真阳性/ 所有样本精确度:返回的结果中只返回想要的正确的有多少召回率有多少个该返回的没返回精确度:模型做对了多少精确率和召回率在某种程度上呈现此消彼长的情况还有一个F1值F1是精确率和召回率的调和平均 反应了整体的情况但是什么指标最重要要看具体情况F1是综合的评判例如在医疗领域我们希望不要漏掉任何一个患者所以这个时候召回率就相当的重要。