钟崇光博士参与了数据派THU于6月5日和6月8日发布的《循序渐进提升Kaggle竞赛模型精确度,以美国好事达保险公司理赔为例》一文的校对工作,并提出了许多宝贵的建议。在此,数据派翻译组向钟博士表示衷心的感谢!
作者:梅兰妮·托西克
翻译:闵黎
校对:丁楠雅
本文长度约为1100字,建议阅读时间约3分钟。
梅兰妮·托西克目前在旅游搜索公司WayBlazer任职,负责通过自然语言请求生成个性化的旅游推荐。她在学习过程中积累了丰富的经验,并为希望入门自然语言处理的初学者提供了一份学习资源清单。
如果您觉得有必要多次回答相同的问题,不妨将其整理成博客文章,这样可以节省重复解释的时间。因此,我将解答一个常见的问题:“我的背景是研究某一领域,我对学习自然语言处理(NLP)非常感兴趣。应该从哪里开始呢?”
在开始阅读本文之前,请注意,以下列表只是一份入门级的清单(可能并不全面)。为了帮助读者更好地理解,我将在括号内附上简短的说明和难度评估。最好具备一些基本的编程技能(如Python)。
Dan Jurafsky 和 Chris Manning 的自然语言处理课程
斯坦福大学CS224d:自然语言处理的深度学习
Coursera:自然语言处理简介
spaCy
自然语言工具包(NLTK)
斯坦福CoreNLP
《言语和语言处理》(Daniel Jurafsky 和 James H. Martin)
《统计自然语言处理的基础》(Chris Manning 和 Hinrich Schütze)
《信息检索简介》(Chris Manning, Prabhakar Raghavan 和 Hinrich Schütze)
《自然语言处理中的神经网络方法》(Yoav Goldberg)
如何在TensorFlow中构建Word2Vec模型
自然语言处理深度学习资源
最后一句话:计算语言学和深度学习——论自然语言处理的重要性
对自然语言理解的分布式表示
带泪水的贝叶斯推论
国际计算语言学协会(ACL)
果壳问答网站(Quora)
Nicolas Iderhoff 已经创建了一份详尽的自然语言处理数据集列表。
基于隐马尔可夫模型(HMM)实现词性标注(POS tagging)
使用CYK算法执行上下文无关的语法解析
在文本集合中计算给定两个单词之间的语义相似度
使用朴素贝叶斯分类器来过滤垃圾邮件
根据单词之间的编辑距离执行拼写检查
实现一个马尔科夫链文本生成器
使用LDA实现主题模型
使用Word2Vec从大型文本语料库(如维基百科)生成单词嵌入