语料库语言学通过系统收集的书面文本、言语转写或其他有记录的交流样本,对语言进行实证研究。这些材料集合称为语料库(英语复数为 corpora,单数为 corpus),通常以电子形式存储,并使用计算工具检索。在语言学领域,语料库研究将对反复出现的模式的定量描述,与对其语境的定性考察相结合。它为人们实际如何使用语言提供证据,补充了语法描述、个人直觉和人为编造的例句。(ucrel.lancaster.ac.uk)
发展与学术取向
计算机语料库研究的一个里程碑是布朗语料库。该语料库由 W. 纳尔逊·弗朗西斯和亨利·库切拉编制,最初于1964年发布。它收录了1961年出版、经过编辑的美国英语散文文本,共500个样本,约100万词。其系统化的抽样设计使研究者能够比较不同文本类别中的语言用法,也为以类似方式组织的其他英语变体语料库提供了范本。(varieng.helsinki.fi)
后续项目扩大了可用证据的规模与多样性。英国国家语料库于1991年至1994年间建成,收录了约1亿词的20世纪末英国英语材料。其中约90%为书面材料,10%为言语转写材料。其设计体现了在同一个语料库中涵盖多种体裁、交际情境和说话者群体的努力。(natcorp.ox.ac.uk)
语料库语言学并不依附于某一种语言理论。一个常被讨论的区分是:基于语料库的研究旨在检验或完善已有的类别和假设,而语料库驱动的研究则强调从数据中观察到的模式出发,形成语言描述。这两种取向在实践中有所交叠:语料库的选择、标注和解读不可避免地涉及分析上的预设。(lancaster.ac.uk)
语料库设计与代表性
语料库的设计以特定的研究总体为依据,例如学术写作、非正式会话或某一地区的语言变体。代表性关注样本能在多大程度上充分反映该总体的特征及其变异;平衡性则关注所选文本类型或说话者群体的分布。这两种属性都不会随着规模增大而自动获得:如果一个大型语料库的材料集中于范围狭窄的来源,它在说明更广泛的语言用法时,所能提供的证据可能仍然不足。(lancaster.ac.uk)
通用语料库涵盖多个交际领域,专门语料库则面向更为有限的场景。语料库还可以支持跨历史时期或跨语言的比较。学习者语料库记录正在习得另一种语言的人所产出的语言,使研究者能够考察语言发展的模式以及学习者群体之间的差异。适当的设计取决于研究问题,而不是一律要求纳入所有类型的语言。(lancaster.ac.uk)
元数据记录出版日期、作者、体裁或说话者特征等信息。文本标记则标明段落、话语等结构边界。这些信息层使研究者能够将语言模式与其产生的具体情境联系起来,而不是把每个词都视为可以互换的观测值。(corpora.lancs.ac.uk)
准备与标注
语料库的准备工作通常包括统一材料格式和添加语言学信息。语料库标注可以标明语法类别、句子结构、语义类别或口语表达特征。词性标注为词语标上名词、动词等类别;语法剖析则表示句法结构内部的关系。语义标注添加与语义学中的意义分析有关的分类。(ucrel.lancaster.ac.uk)
标注使检索不再局限于特定的拼写形式,也可以针对类别进行。例如,研究者可以检索由许多不同词语构成的同一种语法构式。不过,自动赋予的标签属于分析结果,并不是新增的原始话语。因此,标注系统通常将自动处理与人工核查或修正结合起来,而其采用的类别也决定了哪些区别能够被检索出来。(ucrel.lancaster.ac.uk)
主要分析方法
语境索引展示检索表达式的各次出现及其周围文本,通常采用将关键词置于上下文中的排版方式。阅读语境索引行有助于区分不同的意义、构式和交际功能,而这些区别仅凭汇总频次是无法看出的。对这些索引行进行检索、排序和筛选,将计算检索与语境解读联系起来。(corpora.lancs.ac.uk)
频次表显示词语或标注类别出现的次数。相对频率以语料库规模为基准表示出现次数,离散度指标则描述这些出现如何分布在不同文本或部分之中。总频次很高,可能只是因为某个项目在少数文献中被反复使用,而不意味着它在整个语料库中普遍出现。这些相互补充的指标有助于刻画词汇和语法的分布。(corpus-stats.lancaster.ac.uk)
搭配分析研究那些以值得关注的规律性共同出现的词语。统计关联指标结合参与搭配的各词频次和所选的语境窗口,评估其共现情况。关键词分析将目标语料库与参照语料库进行比较,以识别出现频率异常高的项目。这里的“关键词”指的是比较中表现出的突出程度,并不一定是文献的主题词。(corpus-stats.lancaster.ac.uk)
研究者还运用统计学来比较群体并评估各种模式。统计假设检验、效应量、回归和重抽样可以处理比较中的不同方面。信度分析用于评估人工编码的一致性。定量结果始终取决于得出这些结果时所采用的定义、样本和分析程序。(corpus-stats.lancaster.ac.uk)
应用与局限
语料库证据为词典编纂、语法参考书和语言教学材料提供依据。它支持社会语言学、历史语言学和语言习得领域的研究,并为自然语言处理系统的开发与评估提供资源。这些应用都关注实际观察到的语言用法,但其解释目标和实践目标各不相同。(natcorp.ox.ac.uk)
有限的语料库不可能包含所有可能的话语。因此,未能找到某个表达式,并不能证明它不可能出现;而观察到的频率,最直接适用于抽样所针对的总体。解读时还必须区分已记录的词语与未被保留下来的语境信息。语料库的建设和分发会引发知识产权问题;涉及身份可识别参与者的语料库,还会涉及数据隐私、保密和知情同意问题。这些限制会影响哪些材料能够被收集、共享和独立查验。(lancaster.ac.uk)
参考来源
- Introduction to UCRELucrel.lancaster.ac.uk
- Unit 1 Corpus linguistics: the basicslancaster.ac.uk
- CoRD: The Brown Corpus (BROWN)varieng.helsinki.fi
- About the British National Corpusnatcorp.ox.ac.uk
- Sampling and Representativenesslancaster.ac.uk
- Corpus-Based Language Studies: Contentslancaster.ac.uk
- Corpus-based Language Studies: An Advanced Resource Booklancaster.ac.uk
- Dana Gablasovalancaster.ac.uk
- Corpus Linguistics, 1lancaster.ac.uk
- Corpus Linguistics: Method, theory and practice — Corpus annotationcorpora.lancs.ac.uk
- UCREL Corpus Annotationucrel.lancaster.ac.uk
- Corpus Linguistics: Method, theory and practice — Concordancingcorpora.lancs.ac.uk