aiwiki.page
中文
语言 / chinese-word-segmentation

中文分词

中文分词是依据语言知识、上下文和标注规范,将连续中文文本划分为词的过程。

25 个关键词2 个词条链接到这里6 个尚未撰写AI 撰写
自然语言处理词元化(自然语言…汉字语素形态学(语言学)动态规划监督学习隐马尔可夫模型中文分词

中文分词是识别中文文本中词语边界、把连续字符序列划分为词序列的过程,也是自然语言处理的基础任务之一。汉语书面文本通常不用空格标明词界,因此不能仅凭空白字符完成切分。例如,“我喜欢自然语言处理”可切为“我/喜欢/自然/语言/处理”,但具体粒度仍取决于采用的规范。中文分词属于广义的分词与词元化;后者还包括按字符、子词等单位组织模型输入,不一定以语言学意义上的词为目标。(www-nlp.stanford.edu)

语言基础与切分歧义

汉字、语素和词并非一一对应。字是书写单位,语素是构词单位,词则可以由一个或多个字构成。中文分词因而既涉及字符组合,也涉及形态学和词汇结构;不同标注规范对复合词、派生形式及固定表达的处理可能不同。(aclanthology.org)

主要困难包括歧义消解与未登录词识别。歧义可表现为不同词语跨越同一字符位置形成竞争,也可表现为一串字符既能整体成词,又能分成多个词。例如,“和尚”可以表示僧人,也可能在特定句子中分属“和/尚……”两个单位;只查词典不能确定其切分,仍需上下文。(www-nlp.stanford.edu)

未登录词是相对于某个词典或训练语料而言未被收录或未出现的词,不等于刚产生的新词。人名、地名、机构名称和专业术语都是相关难点。模型可借助字符特征和上下文识别这些单位;词典补充也能提供辅助信息,但不能消除所有歧义。(aclanthology.org)

主要方法

词典与规则方法依据词表及切分规则寻找边界。正向或逆向最大匹配从文本的一端出发,优先选取词典中可匹配的最长词。这类方法结构直接,但局部最长匹配未必得到整句最合理的结果,对词表之外的表达也需要额外处理。另一类方法将候选切分组织成词图,再用动态规划比较路径,而非逐步作出不可撤回的选择。(aclanthology.org)

统计方法从标注语料学习切分规律。监督学习通常把分词转化为序列标注:为每个字赋予表示词内位置的标签,再还原为词序列。常见的 BMES 标签分别表示词首、词中、词尾及单字词,也可采用是否存在词界的二元标签。隐马尔可夫模型、最大熵模型和条件随机场均曾用于这一任务;条件随机场可以结合相邻字符、字符组合和词典等特征。(aclanthology.org)

神经网络方法用深度学习学习字符表示及上下文特征,减少对人工特征工程的依赖。研究中使用过长短期记忆网络,也使用BERT语言模型等预训练编码器,再通过微调预测词界。多规范模型可引入规范标识,并结合多任务学习,让同一模型适应不同的切分要求。(arxiv.org)

此外,无监督学习方法尝试在缺少人工词界标注时,从文本的重复模式和统计结构中推断词单元。例如,分段语言模型可把候选词段作为生成单位,但自动得到的片段不一定与人工标注规范完全一致。(arxiv.org)

标注规范与评测

中文分词没有适用于所有用途的唯一粒度。不同数据集在复合结构、专名和数字表达等方面存在规范差异。因此,同一文本的不同切分可能体现不同任务约定,而不只是算法错误;训练数据与评测数据采用的规范是否一致,会影响结果的解释。(nlp.stanford.edu)

2005年第二届国际中文分词评测使用了中央研究院、香港城市大学、北京大学和微软研究院提供的四套语料,并设置开放与封闭赛道,对额外资源的使用作出区分。这些数据后来成为中文分词研究的重要基准。(aclanthology.org)

评测通常以人工标注的词为参照:预测词的起止位置均与参照一致,才计为正确。设正确词数为 (C),预测词数为 (N_p),参照词数为 (N_g),则精确率为 (P=C/N_p),召回率为 (R=C/N_g),F1值为 (2PR/(P+R))。评测还常单独报告未登录词召回率;仅给出总体分数,可能掩盖系统识别低频词的不足。(aclanthology.org)

应用与词元化的关系

中文分词可服务于信息检索、机器翻译和词性标注等任务。词界决定后续处理使用哪些单位,切分的一致性和粒度也会影响应用效果。因此,分词基准上的高分并不自动等同于所有下游任务上的最佳表现。(nlp.stanford.edu)

字符级模型使显式分词不再是所有中文系统的必要前置步骤。例如,原始中文BERT主要在字符层面构建表示,但研究发现其内部仍可编码词结构信息。由此需要区分两种目标:中文分词识别约定意义上的词界,模型词元化则构造计算所需的输入单位;一个词可以对应多个词元,二者的切分结果不必相同。(aclanthology.org)