学习自然语言处理,强烈推荐这本书——《自然语言处理实战》。
这本书详细介绍了自然语言处理的最佳实践,并使用Python深入讲解了最新的自然语言处理算法。书中不仅介绍了如何构建能够根据文档含义搜索文档的搜索引擎,还讲述了如何训练聊天机器人通过深度学习来回答问题和参与对话。本书注重实战,提供了完整的案例,适合作为现代自然语言处理从业者的入门书籍。
自2020年10月发布以来,这本书受到了广泛好评。豆瓣上的评论也非常积极。目前,CSDN、博客园和知乎等平台上有很多专家都在推荐这本书,经过许多读者的验证,普遍认为这本书理论与实践结合紧密,有具体的代码可以参考,有助于理解算法过程,易于理解和上手。
这本书的理论讲解通俗易懂,便于快速入门。实践案例均来自实际应用场景,通过实际操作加深对理论的理解。书中从计算机如何处理不同语言的细微差别,到使用自然语言处理技术构建现实世界应用,详细介绍了计算机是如何阅读和解释语言的,接着讲述了如何训练基于Python的自然语言处理机器来识别模式并从文本中提取信息。
本书分为三个部分:
第一部分:自然语言处理的基础入门。涵盖了自然语言的特点、分词、TF-IDF向量化以及从词频向量到语义向量的转换等内容。
第二部分:深度学习。包括神经网络、词向量、卷积神经网络(CNN)、循环神经网络(RNN)、长短期记忆(LSTM)网络、序列到序列建模和注意力机制等基本的深度学习模型和方法。
第三部分:实战部分。涵盖了信息提取、问答系统、人机对话等系统构建中的模型挑战,以及应对这些挑战的一些实际做法。
尽管书中介绍了一些经典的基本模型,但对这些模型的深刻理解将有助于快速掌握一些新模型(如Transformer和BERT)。
本书提供了大量的实战案例,读者可以使用现有的Python包来捕获文本的含义并作出相应的响应。书中涵盖了可扩展的自然语言处理流水线、基于规则的自然语言处理和基于数据的自然语言处理、Keras、TensorFlow、gensim和scikit-learn等工具的使用,这些都是学习自然语言处理时经常遇到的问题。
此外,本书还扩展了传统的自然语言处理方法,包括神经网络、现代深度学习算法和生成技术,用于解决真实世界的问题,如提取日期和名称、合成文本和回答无固定格式的问题。
本书所有代码清单中的源代码可以从异步社区(https://www.epubit.com/)和本书的GitHub下载。
本书由王斌老师带领的小米AI实验室NLP团队翻译。王斌老师是NLP首席科学家、小米AI实验室主任,曾翻译过多本优秀著作,如《信息检索导论》《大数据》《机器学习实战》等。
王斌老师提供了有效的阅读方法——“三遍法”。
第一遍:通读全书,了解自然语言处理的基本理论和知识、基本的深度学习模型和NLP领域的一些基本应用。阅读时可以做些笔记,记录疑难问题。
第二遍:选择感兴趣的内容进行细读。可以根据自己的需求和兴趣,选择感兴趣的模型或任务进行深入阅读。本书最重要的是边阅读边实践,通过代码实践加深理解。
第三遍:回顾第一遍中的疑问问题。通过实践加深对NLP基础技术的理解,再次回顾第一遍中的疑问问题,看是否有了更深的理解。
以上几个步骤可以反复迭代,读者还可以参考其他优秀的NLP或深度学习教程和教材,以进一步加深对本书的理解。
目前,自然语言处理已经成为深度学习的核心应用领域,而深度学习也是自然语言处理研究和应用中的重要工具。希望本书能帮助更多想要从事自然语言处理的学生更好地学习与进阶。