人工智能入门其实并不难,通过交流学习,相信你会事半功倍。专栏《100节课带你从小白入门人工智能》集结了多年的教学经验,内容丰富全面,堪称“人工智能的百科全书”。该专栏涵盖了人工智能的发展历程、搜索方法、知情搜索、博弈中的搜索、人工智能中的逻辑、知识表示、产生式系统、专家系统、机器学习、神经网络、遗传算法、自然语言处理、自动规划、机器人技术、高级计算机博弈以及人工智能的历史与未来等多个主题。即便是对人工智能一无所知的新手也能轻松入门。
在上一章节中,我们探讨了机器学习的入门知识,介绍了机器学习的五大范例。如果想回顾上一节的内容,可以点击链接查看。
假设有一个智能体,它希望能够达到大联盟级别的棒球水平。要达到这样的水平,通常需要15年的训练时间。尽管棒球规则相对简单,但学习过程却非常漫长:“投球、接球、击球。”
在训练初期,智能体需要掌握许多可能的情况:
这些反馈对于智能体的学习过程至关重要。在机器学习中,有三种主要的反馈机制:监督学习、无监督学习和强化学习。
监督学习是一种直接且简单的方法,智能体在执行某些动作后能立即获得反馈。例如,当敏捷的跑垒者将球滚向一侧时,如果智能体未能迅速传球到一垒,几分钟内就会收到提醒,让他加快速度。第11章介绍了如何利用监督学习让神经网络学会布尔函数。在此过程中,我们向网络提供了正确输入的列表。
在无监督学习中,训练期间并没有具体的反馈机制。然而,如果智能体希望学习,它仍然需要收到某种形式的反馈。例如,如果智能体在防守中表现出色,比如两次扑接并截获了一个全垒打,虽然最终没能得分,但队友们会表扬他。这使他意识到好的防守同样值得称赞。
强化学习中没有教师提供正确答案,甚至智能体也不能提前知道其行为的结果。为了增加难度,假设即使智能体知道行为的结果,也无法确定结果的具体影响。因此,智能体需要通过试错法进行学习。由于奖励被延迟,智能体很难确定哪些行为是好的。例如,试图用中指平衡未打开的雨伞,需要在x-y平面上进行细微调整才能保持平衡,如图10.2所示。
如果雨伞向左倾斜,你需要向左大幅度移动,但很快会发现这是矫枉过正。回到棒球智能体的例子,假设他是一名投手,当对方打出一个全垒打时,他会倾向于将球投向对方的击球手。当对方投手以大约145公里/小时的速度投出一个快速球时,他可能会在几局之后感受到膝盖的疼痛。在这里,我们主要讨论监督学习。巴拉德的著作中有更多关于无监督学习和强化学习的详细讨论。
通过监督学习,我们可以观察到一系列有序对:
我们称这一系列有序对为训练集。其中,
是输入的n维向量,而
是该函数在
处的值,也就是学习到的值。函数f将每个输入向量映射到正确的响应。一般来说,在m维空间中,
每个分量
(k = 1,..., m)都来自一个事先定义的集合,如整数集或实数集等(输入集和输出集可以不同)。
请关注我,私信获取更多内容。
如果你想获得更多IT学习资源,请关注异步社区头条号。