# NERandRE **Repository Path**: lx-tju/nerandre ## Basic Information - **Project Name**: NERandRE - **Description**: No description available - **Primary Language**: 其他 - **License**: Not specified - **Default Branch**: master - **Homepage**: None - **GVP Project**: No ## Statistics - **Stars**: 0 - **Forks**: 0 - **Created**: 2020-12-22 - **Last Updated**: 2020-12-22 ## Categories & Tags **Categories**: Uncategorized **Tags**: None ## README # NERandRE 为了评测知识图谱构建的性能,应以提取句子中存在的三元组的能力作为评测指标,但遗憾的是,目前并不存在这样的数据集,因此拟采用关系抽取及实体抽取两个中间任务作为间接评测的手段。该项目为中间评测任务采用的数据集。 ## 01CLUENER 基于清华大学开源的文本分类数据集THUCNEWS,选出部分数据进行细粒度命名实体标注,并对数据进行清洗,得到一个细粒度的NER数据集。CLUENER2020 中文细粒度命名实体识别任务即从该数据集中抽取10种类别实体,分别为:地址(address),书名(book),公司(company),游戏(game),政府(government),电影(movie),姓名(name),组织机构(organization),职位(position),景点(scene)。 ## 02MSRA 给定5万多条中文命名实体识别标注数据 ## 03CCKS 评测数据主要来源于互联网网页文本,其中验证集和测试集是通过人工进行标注的,而训练集是通过远程监督(Distant Supervision)自动生成的。在本次任务中,我们重点关注人物之间的关系抽取研究。给定一组人物实体对和包含该实体对的句子,找出给定实体对在已知关系表中的关系。 ## 04SCHEMA 本任务为基于schema约束的SPO信息抽取任务,即在给定schema集合下,从自然语言文本中抽取出符合schema要求的SPO三元组知识。其中schema定义了关系P以及其对应的主体S和客体O的类别,例如(S_TYPE:人物,P:妻子,O_TYPE:人物)、(S_TYPE:公司,P:创始人,O_TYPE:人物)等。任务要求参评系统自动地对句子进行分析,输出句子中所有满足schema约束的SPO三元组知识Triples=[(S1, P1, O1), (S2, P2, O2)…]。