人工智能入门100讲:机器学习系统中反馈的作用
作者头像
  • cee13683031413
  • 2020-05-11 08:08:52 4

人工智能入门其实并不难,通过交流学习,相信你会事半功倍。专栏《100节课带你从小白入门人工智能》集结了多年的教学经验,内容丰富全面,堪称“人工智能的百科全书”。该专栏涵盖了人工智能的发展历程、搜索方法、知情搜索、博弈中的搜索、人工智能中的逻辑、知识表示、产生式系统、专家系统、机器学习、神经网络、遗传算法、自然语言处理、自动规划、机器人技术、高级计算机博弈以及人工智能的历史与未来等多个主题。即便是对人工智能一无所知的新手也能轻松入门。

小复习

在上一章节中,我们探讨了机器学习的入门知识,介绍了机器学习的五大范例。如果想回顾上一节的内容,可以点击链接查看。

10.2 机器学习系统中反馈的作用

假设有一个智能体,它希望能够达到大联盟级别的棒球水平。要达到这样的水平,通常需要15年的训练时间。尽管棒球规则相对简单,但学习过程却非常漫长:“投球、接球、击球。”

在训练初期,智能体需要掌握许多可能的情况:

  • 我们的队伍是否领先?
  • 如果我在防守位置,并且球向我飞来,那么我需要判断跑垒者是否速度很快?如果是,我必须尽快传球。
  • 对方的投手是否投出了一个难以击中的旋转球?如果是,我可能需要假装生病。

这些反馈对于智能体的学习过程至关重要。在机器学习中,有三种主要的反馈机制:监督学习、无监督学习和强化学习。

监督学习

监督学习是一种直接且简单的方法,智能体在执行某些动作后能立即获得反馈。例如,当敏捷的跑垒者将球滚向一侧时,如果智能体未能迅速传球到一垒,几分钟内就会收到提醒,让他加快速度。第11章介绍了如何利用监督学习让神经网络学会布尔函数。在此过程中,我们向网络提供了正确输入的列表。

无监督学习

在无监督学习中,训练期间并没有具体的反馈机制。然而,如果智能体希望学习,它仍然需要收到某种形式的反馈。例如,如果智能体在防守中表现出色,比如两次扑接并截获了一个全垒打,虽然最终没能得分,但队友们会表扬他。这使他意识到好的防守同样值得称赞。

强化学习

强化学习中没有教师提供正确答案,甚至智能体也不能提前知道其行为的结果。为了增加难度,假设即使智能体知道行为的结果,也无法确定结果的具体影响。因此,智能体需要通过试错法进行学习。由于奖励被延迟,智能体很难确定哪些行为是好的。例如,试图用中指平衡未打开的雨伞,需要在x-y平面上进行细微调整才能保持平衡,如图10.2所示。

图10.2 平衡未打开的雨伞,需要在x-y平面上进行细微调整

如果雨伞向左倾斜,你需要向左大幅度移动,但很快会发现这是矫枉过正。回到棒球智能体的例子,假设他是一名投手,当对方打出一个全垒打时,他会倾向于将球投向对方的击球手。当对方投手以大约145公里/小时的速度投出一个快速球时,他可能会在几局之后感受到膝盖的疼痛。在这里,我们主要讨论监督学习。巴拉德的著作中有更多关于无监督学习和强化学习的详细讨论。

通过监督学习,我们可以观察到一系列有序对:

我们称这一系列有序对为训练集。其中,

是输入的n维向量,而

是该函数在

处的值,也就是学习到的值。函数f将每个输入向量映射到正确的响应。一般来说,在m维空间中,

每个分量

(k = 1,..., m)都来自一个事先定义的集合,如整数集或实数集等(输入集和输出集可以不同)。

获取专栏答案的方式

请关注我,私信获取更多内容。

如果你想获得更多IT学习资源,请关注异步社区头条号。

    本文来源:图灵汇
责任编辑: : cee13683031413
声明:本文系图灵汇原创稿件,版权属图灵汇所有,未经授权不得转载,已经协议授权的媒体下载使用时须注明"稿件来源:图灵汇",违者将依法追究责任。
    分享
学习系统人工智能入门反馈机器作用100
    下一篇