以下是经过改写后的文章内容,旨在保留原文的核心信息和价值,同时确保语言风格和表达方式有所变化:
大数据文摘作品
编译:晚君、VVN、张礼俊、云舟
我们为您准备了一份精选的开源自然语言处理文本数据集列表,这份列表按照字母顺序排列,涵盖了原始未结构化的文本数据。您可以自行下载并研究这些数据集。
截至2011年7月11日,该数据集包含了Apache软件基金会的所有公开邮件档案,大小约为200GB。
该语料库包含了2004年8月从blogger.com网站收集的19,320位博主的帖子,总共有681,288个帖子和140多万字,大小约为298MB。
该数据集包含了亚马逊用户在2012年10月前留下的568,454条美食评论,大小约为240MB。
斯坦福大学收集了3500万条亚马逊用户的评论,数据集大小约为11GB。
ArXiv平台提供了所有收录论文的全文(270GB)和源文件(190GB)。
该比赛数据集包含了8个作文集,每个作文集由一个单独的提示生成,作文长度在150到550个字之间,所有作文均经过人工评分。
该数据集包含了由单个提示生成的回答,回答平均长度为50个字,所有回答均由10年级学生撰写,并采用双评分制。
该数据集按内容分类来自政客的社交媒体消息,大小约为4MB。
该语料库主要用于文体学研究,每年扩展两种类型的学生写作:文章和综述,需要申请获得。
该数据集包含了带有Freebase注释的ClueWeb09数据,大小约为72GB。
该数据集包含了带有Freebase注释的ClueWeb11数据,大小约为92GB。
该数据集包含了超过50亿个网页的爬虫数据,大小约为541TB。
该数据集包含了从原始电影剧本中提取的对话集合,共涉及617部电影,10,292对人物之间的220,579次对话,大小约为9.5MB。
该数据集涉及企业在社交媒体上发布的内容分类工作,需要志愿者将企业陈述分类为信息、对话或行动,大小约为600KB。
该数据库关联了英语短语与维基百科文章,大小约为11GB。
该数据集用于确定新闻文章与美国经济的相关性及其基调,时间范围从1951年到2014年,大小约为12MB。
该数据集包含了安然公司1,227,255封电子邮件和493,384个附件,覆盖151位管理者,大小约为210GB。
该数据集提供了实时访问全球100,000个媒体的新闻文章的功能,可通过API接口访问。
该数据集包含了从2010年到2015年发布的300万条众包新闻头条,大小约为200MB。
该数据集包含了联邦采购数据中心所有联邦合同的数据库,大小约为180GB。
该数据集包含了个人标签的树结构数据,大小约为40MB。
该数据集包含了Freebase中所有当前事实和推断的数据,大小约为26GB。
该数据集包含了Freebase中每个主题的基本事实数据,大小约为5GB。
该数据集包含了Freebase中所有当前事实和推断的数据,大小约为35GB。
该数据集包含了博客文章、元数据和用户喜好,大小约为1.5GB。
该数据集包含了谷歌图书中英文单词的n元序列及其观测频率计数,大小约为2.2TB。
该数据集包含了英文单词的n元序列及其观测频率计数,大小约为24GB。
该数据集包含了带注释的电子书清单,大小约为2MB。
该数据集包含了来自加拿大第36届议会正式记录的130万标准文本块,大小约为82MB。
该数据集包含了哈佛图书馆超过1,200万册藏书的书目记录,大小约为4GB。
该数据集包含了近15,000行文本,每个文本字符串有三个志愿者的判断,大小约为3MB。
该数据集包含了希拉里克林顿的近7,000页电子邮件,大小约为12MB。
该数据集包含了家得宝公司网站的产品和客户搜索条款,大小约为65MB。
该数据集包含了问题/答案对和文本组成,用于判断上下文文本是否与问题/答案相关,大小约为8MB。
该数据集包含了216,930个过去出现在‘危险’节目中的问题,大小约为53MB。
该数据集包含了208,000种不同来源的明文笑话,大小约为2MB。
该数据集包含了多种语言的机器翻译数据,大小约为612MB。
该数据集包含了230,000份材料安全数据表,大小约为3GB。
该数据集包含了澳大利亚ABC新闻从2003年到2017年的130万条新闻,大小约为56MB。
该数据集包含了660个免费使用的故事集和相关问题,用于研究文本机器理解、问答,大小约为1MB。
该数据集包含了德国报纸文本的语法标注语料库,大小约为2MB。
该数据集包含了印度时报从2001年到2017年的270万类新闻头条,大小约为185MB。
该数据集包含了志愿者阅读短文并匹配最合适的两篇维基百科文章的任务,大小约为6MB。
该数据集包含了所有2015年NIPS论文全文,大小约为335MB。
该数据集包含了纽约时报在脸谱网上的所有帖子,大小约为5MB。
该数据集包含了2017年8月一周内在20多种语言中发布的140万篇新闻事件数据,大小约为115MB。
该数据集包含了志愿者阅读关于两个概念的句子并进行评价的任务,大小约为700KB。
该数据集包含了公开图书馆中所有记录的修改合集,大小约为16GB。
该数据集包含了作者文章风格和个性预测的实验,大小约为1MB。
该数据集包含了截至2015年7月的Reddit论坛所有公开评论,大小约为250GB。
该数据集包含了Reddit论坛的子数据集,大小约为8GB。
该数据集包含了2006年1月到2015年8月31日所有公开可得的Reddit提交内容,大小约为42GB。
该数据集包含了路透社新闻报道的数据集,大小约为2.5GB。
该数据集包含了从不同沙特阿拉伯的网络报纸上摘取的标题和元数据,大小约为2MB。
该数据集包含了5574条被标记为合法/不合法的真实英文短信消息,大小约为200KB。
该数据集包含了季、集、角色和台词的剧本信息,大小约为3.6MB。
该数据集包含了730万条StackOverflow问题和问答,大小约为1.5GB。
该数据集包含了2009年9月到2010年1月的推文定位,大小约为400MB。
该数据集包含了Twitter上关于“放气门”事件的舆情数据,大小约为2MB。
该数据集包含了关于堕胎合法化、女权主义、希拉里·克林顿等各种左倾相关事件的推文,大小约为600KB。
该数据集包含了关于品牌/关键词的推文,大小约为77MB。
该数据集包含了推文中对于自动驾驶的态度分类数据,大小约为1MB。
该数据集包含了20万条来自东京的推文,大小约为47MB。
该数据集包含了17万条来自英国的推文,大小约为47MB。
该数据集包含了20万条来自美国的推文,大小约为45MB。
该数据集包含了对美国各大航空公司存在问题的情感分析数据,大小约为2.5MB。
该数据集包含了根据新闻标题头条和摘要对新闻和美国经济相关性进行排序的数据,大小约为5MB。
该数据集包含了城市词典内的所有词汇、定义、作者和投票情况,大小约为238MB。
该数据集包含了2005-2010的47,860个英文新闻组的邮件匿名汇编,大小约为40GB。
该数据集包含了2010年4月维基百科英文部分中所有文章的快照,大小约为238MB。
该数据集包含了经处理后的英文版维基百科,大小约为66GB。
该数据集包含了所有维基媒体的完整复制,大小约为500GB。
该数据集包含了截至2007年10月25日的雅虎问答语料库,大小约为3.6GB。
该数据集包含了2006-2015年雅虎问答语料库的子数据集,大小约为3.8GB。
该数据集包含了根据语言属性从雅虎问答语料库选出的子集,大小约为104MB。
该数据集包含了少量复杂HTML格式的页面和267万个复杂格式的页面,大小约为50GB。
该数据集包含了1亿个RDF格式数据的三元组,大小约为2GB。
该数据集包含了N元语法表示数据,大小约为2.6GB。
该数据集包含了n元语法模型数据,大小约为12GB。
该数据集包含了匿名雅虎搜索日志的相关性判断,大小约为1.3GB。
该数据集包含了经一些公开NLP工具处理后的英文维基百科,大小约为6GB。
该数据集包含了餐厅排名和220万条评论,大小约为1GB。
该数据集包含了170万条YouTube视频描述,大小约为17MB。
该链接提供了更多开源NLP数据集的清单。
该链接提供了亚马逊公开数据集的访问入口。
该链接提供了CrowdFlower提供的各种数据集。
该链接提供了Kaggle平台上的数据集资源。
该链接提供了Kaggle竞赛中的数据集资源。
该链接提供了开放图书馆的下载入口。
该链接提供了Quora平台上已标注好的语料库资源。
该链接提供了Reddit上的各种数据集资源。
该链接提供了另一个数据集清单。
该链接提供了StackExchange上的公开数据资源。
该链接提供了斯坦福NLP组的已标注语料库和工具资源。
该链接提供了雅虎研究院的数据集资源及相关论文列表。
希望这份改写后的文章能够满足您的需求。