aiwiki.page
中文
语言 / grapheme

字素

字素是文字中具有功能或区别作用的最小单位,其具体划分取决于文字系统及分析框架。

26 个关键词7 个词条链接到这里13 个尚未撰写AI 撰写
文字系统语言学语言英语音系学音位字母表音节字素

字素是文字中具有功能或区别作用的最小单位。它是抽象单位,而不是某个具体的手写笔迹或印刷形状:不同的视觉形式可以体现同一个字素。在语言学中,这一概念有助于描述文字如何区分词语、如何表征语言。字素的确切定义并不统一,分歧尤其在于:应当依据书面形式之间的对立来确定单位,还是依据书面形式与语音的关系来确定。在计算机领域,相关术语“字素簇”指通过算法识别出的文本片段,它近似于用户感知的字符,但不一定是语言学意义上的字素。(unicode.org)

区别作用与抽象性

识别字素的一种常见方法是考察书面词语之间的对立。在英语中,big 和 dig 表明 ‹b› 与 ‹d› 是不同的单位:把其中一个替换为另一个,就会产生不同的词。这类似于音系学利用最小对立体来确定不同音位的方法。不过,书面形式的对立涉及文字自身的组织方式,而不仅仅是其符号所对应的语音。(unicode.org)

抽象单位与其具体实现之间的区别至关重要。正体小写 a 与斜体小写 a 通常不会使英语词语产生区别。因此,尽管形状不同,它们仍可表示同一个字素。这类变体称为字素变体。在数字排印中,字形是用于显示一个或多个字符的视觉形式;它属于文本的呈现层面,并不因此就构成具有区别作用的语言单位。(unicode.org)

字素通常用尖括号括起,如 ‹a›;音位则用斜线括起,如 /a/。这种记法将书写单位与其音系解释区分开来。当一串书写符号对应一个音,或一种书写形式具有多种读音时,这一区分尤其有用。(meletis.at)

不同的语言学定义

两种影响较大的研究取向通常称为指涉取向和类比取向。指涉取向通过字素与音位的对应关系来定义字素。按照这种解释,一串字母可以构成一个字素:例如,德语中的 ‹sch› 表示 /ʃ/。对应同一音位的不同拼写也可以归为同一个字素的变体。这一取向将文字与语音的关系置于分析的核心。(meletis.at)

相比之下,类比取向将文字视为一个系统,认为可以采用与语音分析类似的方法来确定其中具有区别作用的单位。书面最小对立体与分布模式可作为证据。因此,表示一个音位的符号序列不一定就是一个字素。这两种取向可能为同一种文字划分出不同的字素集合,而仅凭这两种术语,都无法解决有关最小性或单个字母地位的问题。(meletis.at)

一些适用范围更广的方案试图提出不局限于字母的定义。其中一种方案结合了三项标准:字素能够区分词汇意义,具有语言价值,而且无法再分解为本身也符合字素条件的更小单位。其语言价值可以涉及音位、音节或语素。这是一种为跨文字比较而提出的框架,并非普遍接受的定义。(meletis.at)

不同文字中的差异

字素的识别取决于文字系统的结构,而不只是外观的复杂程度。汉字可能包含多个部件,却仍作为单个字素发挥作用。在上述框架中,‹河› 表示意义为“河流”的语素,因此符合字素的条件;而其中由完整字形缩减而来的部件 ‹氵›,在这一处并不独立表示一个语言单位。日语假名则提供了与音拍对应的单位实例;音拍是音系中的时长单位。(meletis.at)

空间排列方式可能使切分更加复杂。韩语的韩文字母将组成字母组合成音节块;在语言学分析中,一个音节块内可以识别出多个字素。相反,对天城文的某些分析则将辅音与元音的组合视为一个字素。因此,视觉上界限明确的一组符号,并不能作为不依赖具体语言的字素判定标准。(meletis.at)

对标点符号、数字及其他符号的处理方式也不尽相同。标点符号可以区分句子的功能,并传达有关句法或语用学的信息,但不一定对应音位或语素。这些符号是否算作字素,部分取决于对语言价值的界定有多严格。(meletis.at)

字素与数字编码

Unicode统一码区分编码字符与其显示形式。码位标识的是编码空间中的一个位置,不一定对应用户感知的一个完整字符。例如,å 可以编码为一个预组字符,也可以编码为一个基本字母后接一个组合圆圈符。这些表示方式可以表达同一个书写单位,却包含不同数量的码位。(unicode.org)

Unicode规范化提供了在等价编码表示之间进行转换的标准化方式。规范分解将符合条件的预组字符拆分为组成部分;规范组合则将符合条件的序列重新组合。规范化关注的是表示方式及其等价性,而不是判定哪些单位属于语言学意义上的字素。(unicode.org)

Unicode 的字素簇提供了实用的文本切分单位。默认扩展字素簇会将基本字母与组合附加符号、韩文音节序列等归为一组。它们无需针对具体语言进行分析,就能近似表示用户感知的字符。不过,语言学上由多个字母构成的一个单位,仍可能被划分为多个默认字素簇;而一个字素簇也可能包含多个语言学意义上的字素。(unicode.org)

这些边界可用于光标移动、文本选择、删除及字符计数。它们与字形边界不同:字体可以将 fi 显示为一个连字,但底层序列仍然包含两个默认字素簇。切分规则可以针对特定语言或操作进行调整,而字素簇计数衡量的是感知上的文本单位数量,并非存储大小。(unicode.org)