每天5分钟疾速玩转机器学习:运用贝叶斯算法完成渣滓邮件分类
作者头像
  • aichinaexpo
  • 2020-05-11 09:15:06 4

本文重点

贝叶斯算法的应用非常广泛,特别是在垃圾邮件分类中。本节将通过垃圾邮件的例子,探讨贝叶斯算法在实际应用中可能遇到的问题及其解决方法。

垃圾邮件分类

在机器学习中,判断一封邮件是否为垃圾邮件属于二分类问题。如果我们选择使用朴素贝叶斯分类器,目标是确定在给定某些特征的情况下,邮件是垃圾邮件的概率是否超过50%。

假设我们有5000封垃圾邮件和5000封正常邮件。现在有一封邮件的内容是:“恭喜!您的条件已达标,特告诉您获得申请金卡资格”。我们如何判断这封邮件是否为垃圾邮件呢?我们需要计算以下概率:

P(“垃圾邮件”|“恭喜!您的条件已达标,特告诉您获得申请金卡资格”)

计算结果如下:

但这种方法有一个问题,因为包含完整短语的邮件数量很少,无论是垃圾邮件还是正常邮件,因此这种方法并不理想。

因此,我们可以改变思路,从分词的角度来处理这个问题。“恭喜!您的条件已达标,特告诉您获得申请金卡资格”可以被拆分为以下词汇:“恭喜”,“您”,“的”,“条件”,“已”,“达标”,“特”,“告诉”,“您”,“获得”,“申请”,“金卡”,“资格”。

也就是说,我们将完整的句子拆分成更细粒度的词汇,并去除标点符号。这时,我们计算的不再是整个句子的概率,而是各个词汇的概率组合。即:

P(“垃圾邮件”|“恭喜”,“您”,“的”,“条件”,“已”,“达标”,“特”,“告诉”,“您”,“获得”,“申请”,“金卡”,“资格”)

然后我们使用贝叶斯算法进行处理:

然而,这样的计算依然比较复杂,怎么办呢?这时我们可以引入一个简单的假设——条件独立假设,这也是朴素贝叶斯算法的核心思想。这意味着每个词汇出现的概率是独立的,这样可以大大简化计算过程。

    本文来源:图灵汇
责任编辑: : aichinaexpo
声明:本文系图灵汇原创稿件,版权属图灵汇所有,未经授权不得转载,已经协议授权的媒体下载使用时须注明"稿件来源:图灵汇",违者将依法追究责任。
    分享
叶斯渣滓疾速算法运用机器分钟邮件完成每天
    下一篇