资源|100+个自然语言处理数据集大放送,再不愁找不到数据!
作者头像
  • e公司
  • 2022-06-07 14:03:26 8

以下是经过改写后的文章内容,旨在保留原文的核心信息和价值,同时确保语言风格和表达方式有所变化:


大数据文摘作品

编译:晚君、VVN、张礼俊、云舟

我们为您准备了一份精选的开源自然语言处理文本数据集列表,这份列表按照字母顺序排列,涵盖了原始未结构化的文本数据。您可以自行下载并研究这些数据集。

数据集

Apache软件基金会公开邮件档案

截至2011年7月11日,该数据集包含了Apache软件基金会的所有公开邮件档案,大小约为200GB。

博主原创语料库

该语料库包含了2004年8月从blogger.com网站收集的19,320位博主的帖子,总共有681,288个帖子和140多万字,大小约为298MB。

亚马逊美食评论[Kaggle]

该数据集包含了亚马逊用户在2012年10月前留下的568,454条美食评论,大小约为240MB。

亚马逊评论

斯坦福大学收集了3500万条亚马逊用户的评论,数据集大小约为11GB。

ArXiv论文全文和源文件

ArXiv平台提供了所有收录论文的全文(270GB)和源文件(190GB)。

ASAP自动作文评分[Kaggle]

该比赛数据集包含了8个作文集,每个作文集由一个单独的提示生成,作文长度在150到550个字之间,所有作文均经过人工评分。

ASAP简答题评分[Kaggle]

该数据集包含了由单个提示生成的回答,回答平均长度为50个字,所有回答均由10年级学生撰写,并采用双评分制。

政治社交媒体分类

该数据集按内容分类来自政客的社交媒体消息,大小约为4MB。

CLiPS文体学研究(CSI)语料库

该语料库主要用于文体学研究,每年扩展两种类型的学生写作:文章和综述,需要申请获得。

ClueWeb09 FACC

该数据集包含了带有Freebase注释的ClueWeb09数据,大小约为72GB。

ClueWeb11 FACC

该数据集包含了带有Freebase注释的ClueWeb11数据,大小约为92GB。

常见爬虫语料库

该数据集包含了超过50亿个网页的爬虫数据,大小约为541TB。

康奈尔电影对话语料库(Cornell Movie Dialog Corpus)

该数据集包含了从原始电影剧本中提取的对话集合,共涉及617部电影,10,292对人物之间的220,579次对话,大小约为9.5MB。

企业信息

该数据集涉及企业在社交媒体上发布的内容分类工作,需要志愿者将企业陈述分类为信息、对话或行动,大小约为600KB。

Crosswikis

该数据库关联了英语短语与维基百科文章,大小约为11GB。

经济新闻相关文章

该数据集用于确定新闻文章与美国经济的相关性及其基调,时间范围从1951年到2014年,大小约为12MB。

安然公司电子邮件数据

该数据集包含了安然公司1,227,255封电子邮件和493,384个附件,覆盖151位管理者,大小约为210GB。

事件注册

该数据集提供了实时访问全球100,000个媒体的新闻文章的功能,可通过API接口访问。

Examiner.com—用新闻头条钓鱼的垃圾邮件[Kaggle]

该数据集包含了从2010年到2015年发布的300万条众包新闻头条,大小约为200MB。

联邦采购数据中心的联邦合同(USASpending.gov)

该数据集包含了联邦采购数据中心所有联邦合同的数据库,大小约为180GB。

Flickr个人分类法

该数据集包含了个人标签的树结构数据,大小约为40MB。

Freebase数据库

该数据集包含了Freebase中所有当前事实和推断的数据,大小约为26GB。

Freebase简单主题库

该数据集包含了Freebase中每个主题的基本事实数据,大小约为5GB。

Freebase四元库

该数据集包含了Freebase中所有当前事实和推断的数据,大小约为35GB。

GigaOM Wordpress挑战赛[Kaggle]

该数据集包含了博客文章、元数据和用户喜好,大小约为1.5GB。

谷歌图书n元语法

该数据集包含了谷歌图书中英文单词的n元序列及其观测频率计数,大小约为2.2TB。

谷歌网页5元语法

该数据集包含了英文单词的n元序列及其观测频率计数,大小约为24GB。

Gutenberg电子书清单

该数据集包含了带注释的电子书清单,大小约为2MB。

加拿大议会文本块

该数据集包含了来自加拿大第36届议会正式记录的130万标准文本块,大小约为82MB。

哈佛图书馆

该数据集包含了哈佛图书馆超过1,200万册藏书的书目记录,大小约为4GB。

仇恨言论识别

该数据集包含了近15,000行文本,每个文本字符串有三个志愿者的判断,大小约为3MB。

希拉里克林顿的电子邮件[Kaggle]

该数据集包含了希拉里克林顿的近7,000页电子邮件,大小约为12MB。

家得宝公司产品搜索关联[Kaggle]

该数据集包含了家得宝公司网站的产品和客户搜索条款,大小约为65MB。

关键短语识别

该数据集包含了问题/答案对和文本组成,用于判断上下文文本是否与问题/答案相关,大小约为8MB。

美国电视节目‘危险’

该数据集包含了216,930个过去出现在‘危险’节目中的问题,大小约为53MB。

英语明文笑话

该数据集包含了208,000种不同来源的明文笑话,大小约为2MB。

欧洲语言机器翻译

该数据集包含了多种语言的机器翻译数据,大小约为612MB。

材料安全数据表

该数据集包含了230,000份材料安全数据表,大小约为3GB。

百万新闻头条-澳大利亚ABC[Kaggle]

该数据集包含了澳大利亚ABC新闻从2003年到2017年的130万条新闻,大小约为56MB。

MCTest

该数据集包含了660个免费使用的故事集和相关问题,用于研究文本机器理解、问答,大小约为1MB。

Negra

该数据集包含了德国报纸文本的语法标注语料库,大小约为2MB。

新闻头条-印度时报[Kaggle]

该数据集包含了印度时报从2001年到2017年的270万类新闻头条,大小约为185MB。

新闻文章/维基百科页面配对

该数据集包含了志愿者阅读短文并匹配最合适的两篇维基百科文章的任务,大小约为6MB。

2015 NIPS论文[Kaggle]

该数据集包含了所有2015年NIPS论文全文,大小约为335MB。

纽约时报脸谱网数据

该数据集包含了纽约时报在脸谱网上的所有帖子,大小约为5MB。

全球新闻一周供稿[Kaggle]

该数据集包含了2017年8月一周内在20多种语言中发布的140万篇新闻事件数据,大小约为115MB。

句子/概念对的正确性

该数据集包含了志愿者阅读关于两个概念的句子并进行评价的任务,大小约为700KB。

公开图书馆数据库

该数据集包含了公开图书馆中所有记录的修改合集,大小约为16GB。

人物语料库

该数据集包含了作者文章风格和个性预测的实验,大小约为1MB。

Reddit评论

该数据集包含了截至2015年7月的Reddit论坛所有公开评论,大小约为250GB。

Reddit评论(2015年5月)

该数据集包含了Reddit论坛的子数据集,大小约为8GB。

Reddit提交语料库

该数据集包含了2006年1月到2015年8月31日所有公开可得的Reddit提交内容,大小约为42GB。

路透社语料库

该数据集包含了路透社新闻报道的数据集,大小约为2.5GB。

SaudiNewsNet

该数据集包含了从不同沙特阿拉伯的网络报纸上摘取的标题和元数据,大小约为2MB。

垃圾短信数据集

该数据集包含了5574条被标记为合法/不合法的真实英文短信消息,大小约为200KB。

《南方公园》数据集

该数据集包含了季、集、角色和台词的剧本信息,大小约为3.6MB。

Stackoverflow

该数据集包含了730万条StackOverflow问题和问答,大小约为1.5GB。

Twitter的Cheng-Caverlee-lee用户定位数据集

该数据集包含了2009年9月到2010年1月的推文定位,大小约为400MB。

Twitter上关于新英格兰爱国者队“放气门”事件的舆情

该数据集包含了Twitter上关于“放气门”事件的舆情数据,大小约为2MB。

Twitter上关于左倾相关事件的舆情分析

该数据集包含了关于堕胎合法化、女权主义、希拉里·克林顿等各种左倾相关事件的推文,大小约为600KB。

Twitter的Sentiment140(情感分析数据集)

该数据集包含了关于品牌/关键词的推文,大小约为77MB。

Twitter上关于自动驾驶汽车的舆情分析

该数据集包含了推文中对于自动驾驶的态度分类数据,大小约为1MB。

Twitter上定位于东京的推文

该数据集包含了20万条来自东京的推文,大小约为47MB。

Twitter上定位于英国的推文

该数据集包含了17万条来自英国的推文,大小约为47MB。

Twitter上定位于美国的推文

该数据集包含了20万条来自美国的推文,大小约为45MB。

Twitter上对美国各大航空公司的态度(Kaggle数据集)

该数据集包含了对美国各大航空公司存在问题的情感分析数据,大小约为2.5MB。

基于新闻标题的美国经济表现

该数据集包含了根据新闻标题头条和摘要对新闻和美国经济相关性进行排序的数据,大小约为5MB。

城市词典(美国在线俚语词典)里的单词和定义

该数据集包含了城市词典内的所有词汇、定义、作者和投票情况,大小约为238MB。

亚马逊的Wesbury Lab Usenet语料库

该数据集包含了2005-2010的47,860个英文新闻组的邮件匿名汇编,大小约为40GB。

维基百科的Wesbury Lab语料库

该数据集包含了2010年4月维基百科英文部分中所有文章的快照,大小约为238MB。

维基百科提取(WEX)

该数据集包含了经处理后的英文版维基百科,大小约为66GB。

维基百科的XML格式数据

该数据集包含了所有维基媒体的完整复制,大小约为500GB。

雅虎问答中的综合问题与答案

该数据集包含了截至2007年10月25日的雅虎问答语料库,大小约为3.6GB。

雅虎问答中用法语提问的问题

该数据集包含了2006-2015年雅虎问答语料库的子数据集,大小约为3.8GB。

雅虎问答中的关于“如何做”的问题

该数据集包含了根据语言属性从雅虎问答语料库选出的子集,大小约为104MB。

雅虎从公开网页中提取的HTML格式页面

该数据集包含了少量复杂HTML格式的页面和267万个复杂格式的页面,大小约为50GB。

雅虎从公开网页页面中提取的元数据

该数据集包含了1亿个RDF格式数据的三元组,大小约为2GB。

雅虎的N元语法模型表示(N-Gram Representations)数据

该数据集包含了N元语法表示数据,大小约为2.6GB。

雅虎的N元语法模型数据(版本2.0)

该数据集包含了n元语法模型数据,大小约为12GB。

雅虎搜索日志的相关性判断

该数据集包含了匿名雅虎搜索日志的相关性判断,大小约为1.3GB。

雅虎的英语维基百科语义注释快照

该数据集包含了经一些公开NLP工具处理后的英文维基百科,大小约为6GB。

Yelp

该数据集包含了餐厅排名和220万条评论,大小约为1GB。

Youtube

该数据集包含了170万条YouTube视频描述,大小约为17MB。

资源

优秀的公开NLP数据集

该链接提供了更多开源NLP数据集的清单。

亚马逊公开数据集

该链接提供了亚马逊公开数据集的访问入口。

CrowdFlower数据集

该链接提供了CrowdFlower提供的各种数据集。

Kaggle数据集

该链接提供了Kaggle平台上的数据集资源。

Kaggle比赛

该链接提供了Kaggle竞赛中的数据集资源。

开放图书馆

该链接提供了开放图书馆的下载入口。

Quora

该链接提供了Quora平台上已标注好的语料库资源。

Reddit数据集

该链接提供了Reddit上的各种数据集资源。

Rs.io

该链接提供了另一个数据集清单。

Stackexchange

该链接提供了StackExchange上的公开数据资源。

斯坦福NLP组

该链接提供了斯坦福NLP组的已标注语料库和工具资源。

雅虎研究院的数据集汇总Webscope

该链接提供了雅虎研究院的数据集资源及相关论文列表。


希望这份改写后的文章能够满足您的需求。

    本文来源:图灵汇
责任编辑: : e公司
声明:本文系图灵汇原创稿件,版权属图灵汇所有,未经授权不得转载,已经协议授权的媒体下载使用时须注明"稿件来源:图灵汇",违者将依法追究责任。
    分享
自然语言数据放送再不不到处理资源100
    下一篇