资源整理了多种数据集,涵盖了文本分类、实体识别与词性标注、搜索匹配、推荐系统、指代消歧、百科数据、预训练词向量或模型以及中文完形填空等领域。以下是部分重要数据集和工具的详细介绍:
该数据集包含38万条新闻,分布在15个不同的分类中。数据采集时间为2018年5月,按70%、15%、15%的比例划分训练、验证和测试集。
该数据集来源于2005年至2011年间的新浪新闻RSS订阅频道。数据量为74万篇新闻文档,涵盖多个类别,如体育、财经、房产、家居、教育、科技、时尚、时政、游戏和娱乐。相关实验代码可以在GitHub上找到。
该语料库提供了大量的新闻分类数据,详情可在其官方网站查看。
此数据集来自Golden Horse项目,包含丰富的实体识别信息。
该数据集包含六种不同类型的实体,适用于多种研究场景。
该数据集包括人名、地名和组织名三种实体类型,分别在1998年和2004年收集。数据获取方式可通过提供的链接和密码进行。
该数据集包含了5万多条中文命名实体识别标注数据,涵盖地点、机构和个人等实体类型。
该数据集提供了OPPO手机搜索排序中的query-title语义匹配数据。
该数据集包括用户查询及其相关的URL列表,可用于搜索结果质量评估。
该部分内容详细介绍了多个推荐系统的数据集和应用场景,具体数据集和链接可根据需要自行查找。
维基百科定期发布语料库,可供下载和使用。
百度百科数据需要通过爬虫技术获取,相关链接和说明已在文中提供。
CoNLL 2012数据集提供了丰富的指代消歧数据,可供研究人员使用。
BERT是Google开源的一个强大的预训练模型,适用于多种自然语言处理任务。
ELMO是Allen AI研究所开发的另一个预训练模型,具有良好的上下文感知能力。
腾讯AI实验室公开的中文词向量数据集包含超过800万个词汇,每个词对应一个200维的向量。
GitHub上有上百种预训练的中文词向量可供选择。
该数据集提供了大量的中文完形填空题目,适合用于相关研究和教学。
文中还提到了多个其他数据集和工具,包括搜狗实验室、中科大自然语言处理与信息检索共享平台、维基百科数据集、THULAC、HanLP、哈工大LTP、NLPIR、Jieba分词等。
以上内容整理自多个公开资源,旨在帮助用户更好地理解和使用各种数据集和工具。