中文语义知识库,简称ChineseSemanticKB,是一个包含百万级别语义词条的大型数据库。它包含了34万个抽象语义词条、34万个反义语义词条和43万个同义语义词条,适用于多种应用场景,如句子扩展、转写、事件概括与泛化等。
该语料库由网络资源整理而成,源地址为https://github.com/liuhuanyong/ChineseSemanticKB。语料库提供收费下载服务,具体下载链接需通过个人主页“私信”并回复关键字“nbase”来获取。
项目介绍
语义知识库在自然语言处理中扮演着至关重要的角色。与学术界注重算法模型的研究不同,工业界更加依赖于底层词汇知识库和语义知识库等资源。具体来说:
实用的自然语言处理任务通常与实际业务紧密相关,业务需求往往需要解决词汇问题。缺乏基本的词库会导致项目的启动困难。
工业应用中的规则和正则表达式需要底层词汇网络的支持才能有效扩展和泛化。
当前的应用领域,如搜索、问答、舆情监控和事件分析,与标签系统的运行密切相关,这依赖于底层词汇库的支持。
自然语言处理越来越重视推理能力,即所谓的“认知”层面,认知背后的逻辑关系库是推动这种决策的重要手段。
目前,面向中文的开源词库工作虽然已经取得了一定成果,但其规模和质量仍需提升。因此,该项目从现有开源资源中提炼出12类、百万级别的语义词条,用于相关下游任务。
项目中的词库可以直接下载,但不建议二次建库共享,以尊重开源精神。
词库分类
(此处省略图片)
总结
本项目开源了一个目前可用于事件处理及工业舆情监控的12类语义词库,总计超过一百万条目。
开源的34万个抽象语义词条、34万个反义语义词条和43万个同义语义词条,在作者的实际工作中(如事件处理、事理抽取、事件推理等)发挥了重要作用。
中文常用语义词典由公开文本、人工整理和机器抽取组成,如有质量问题,欢迎提出批评和建议。
坚持中文开源事业,努力缩小自然语言处理学术界与工业界之间的差距。
收费下载地址
获取收费下载链接,请访问个人主页并通过“私信”功能回复关键字“nbase”。
往期精品内容推荐
获取更多高质量内容,请访问个人主页并通过“私信”功能回复关键字“his”。这里提供了深度学习领域的经典论文、数据集、教材、书籍和视频课程等资源。