【机器学习】零数据的强化学习,还能走多远?
作者头像
  • 马老师粉丝
  • 2020-04-22 20:00:26 1

强化学习:无需数据即可战胜专家

有趣的是,某些类型的机器学习并不需要任何外部数据,更不需要标记数据。通常,这类方法可以自行生成数据。其中最重要的领域是强化学习,智能体在这种学习模式下会与环境互动,并根据环境反馈来优化其行为。这种学习模式一般包含两大部分:特征提取部分,将环境状态转化为特征;以及深度学习部分,将这些特征转化为行动,并将环境给予的奖励转化为权重的更新。

虽然强化学习是一个广泛且有趣的领域,但在这篇简短的文章中不可能详尽地探讨所有细节。值得一提的是,深度学习在过去一直是一个独特的领域,因为强化学习的最佳入门书籍《强化学习:入门》是由理查德·S·萨顿和安德鲁·巴托撰写的,首次出版于1998年。尽管这本书已经包含了强化学习的基本概念,但它无法涵盖现代强化学习的所有进展。幸运的是,两位作者后来又推出了第二版,既适合初学者,也包含了最新的理论和应用。

DeepMind的AlphaZero是现代强化学习的典型例子。最初,AlphaGo通过击败人类围棋高手李世石而闻名。在此之前,围棋一直是计算机难以企及的领域,AlphaGo的成功在2016年引起了广泛关注,被认为是人工智能领域的重大突破。李世石和AlphaGo之间的比赛被视为人工智能在亚洲崛起的重要标志。

然而,AlphaGo依赖大量的标记数据,而AlphaZero则不同,它从零开始,通过自我博弈来学习游戏规则。AlphaZero不仅在围棋中表现出色,还在国际象棋中击败了顶级引擎Stockfish。

随后,DeepMind的MuZero进一步展示了强化学习的强大。MuZero不仅能在已知规则的游戏中取得优异成绩,还能在未知规则的情况下,通过构建环境模型来学习。例如,在国际象棋中,MuZero能够识别非法移动,并通过树搜索来优化其策略。此外,MuZero在Atari游戏等标准基准测试中同样表现出色。

解决魔方问题:Dactyl的故事

强化学习在机器人技术中也有广泛应用。机器人需要在实际环境中执行任务,这通常意味着无法收集标记数据。因此,强化学习成为解决这一难题的关键。例如,OpenAI的Dactyl机器人手就是一个很好的例子。Dactyl在虚拟环境中进行训练,通过域随机化技术,使机器人手能够适应多种不同的环境条件。这种方法使得机器人在现实世界中也能表现出色。

OpenAI团队通过自动域随机化(ADR)技术改进了这一过程。ADR通过调整环境参数来生成多样化的数据,从而提高模型的泛化能力。这种方法不仅提高了Dactyl的性能,还增强了其应对未知干扰的能力。

计算能力的挑战

尽管强化学习取得了显著进展,但它也面临着巨大的计算挑战。例如,MuZero在训练过程中需要大量计算资源。在2012年之前,训练最先进的人工智能模型所需的计算资源基本遵循摩尔定律,每两年翻一番。然而,随着深度学习的发展,这一增长速度显著加快,每3.4个月翻一番。这意味着未来进一步提升人工智能的能力将面临巨大的计算成本压力。

结论

本文讨论了强化学习作为一种克服对大量标记数据需求的方法。在某些情况下,强化学习可以不依赖标记数据,或者只需要一次性训练。然而,强化学习的成功需要巨大的计算资源,这在未来可能成为一个限制因素。尽管如此,强化学习仍然是除标记数据外的一种有效方法,展示了其在多个领域的潜力。

    本文来源:图灵汇
责任编辑: : 马老师粉丝
声明:本文系图灵汇原创稿件,版权属图灵汇所有,未经授权不得转载,已经协议授权的媒体下载使用时须注明"稿件来源:图灵汇",违者将依法追究责任。
    分享
多远机器化学数据学习习还
    下一篇