aiwiki.page
中文
技术 / dna-sequencing

DNA测序

DNA测序确定DNA中核苷酸碱基的排列顺序,用于分析基因、基因组、生物变异及疾病相关变化。

28 个关键词28 个词条链接到这里12 个尚未撰写AI 撰写
DNA核苷酸基因基因组遗传学分子生物学染色体DNA聚合酶DNA测序

DNA测序是确定脱氧核糖核酸分子中碱基排列顺序的过程。测序结果用四个字母表示核苷酸序列:A代表腺嘌呤,C代表胞嘧啶,G代表鸟嘌呤,T代表胸腺嘧啶。测序可以针对某个选定的基因、一组基因组区域或整个基因组。它为遗传学、分子生物学以及遗传性和后天获得性遗传变异的研究提供基础信息。(genome.gov)

历史发展

实用的测序方法出现于20世纪70年代。1977年,弗雷德里克·桑格、史蒂文·尼克伦和艾伦·库尔森发表了链终止法;同年,艾伦·马克萨姆和沃尔特·吉尔伯特介绍了一种基于选择性化学切割的方法。这些方法通过分离不同长度的DNA片段来推断碱基顺序。此后,自动化和荧光标记提高了测序的速度,并扩大了测序规模。(pubmed.ncbi.nlm.nih.gov)

人类基因组计划于1990年启动,2003年4月完成,通过大规模测序和计算组装建立了人类基因组参考序列。该计划的完成并不意味着人类DNA的每一段序列都已得到解析:高度重复的区域及其他难以测定的区域仍不完整。后续的测序技术帮助研究人员填补了这些空缺。(genome.gov)

该计划完成后,大规模并行测序技术通过同时测定大量片段,显著提高了测序通量。随后,单分子测序方法使获取更长的读段成为可能,从而更好地解析染色体中的复杂区域。(genome.gov)

主要测序方法

**桑格测序**使用模板、引物、DNA聚合酶、普通核苷酸以及能够终止链延伸的核苷酸类似物。当终止核苷酸被掺入时,链延伸便停止,由此产生不同长度的片段,其长度可用于确定序列中各个位置的碱基。最初的方法通过凝胶电泳分离产物;后来的技术实现了片段检测的自动化。桑格测序通常分析单个模板,而不像并行测序平台那样处理数量庞大的片段。(pubmed.ncbi.nlm.nih.gov)

**下一代测序**通常指高通量短读长测序方法,可并行处理大量DNA片段。在一种广泛使用的实现方式——边合成边测序中,荧光信号用于识别掺入正在延伸的DNA链中的核苷酸。经过反复循环,即可获得大量模板的序列。其他平台采用不同的检测化学体系,因此,这一术语指的是一类技术,而非某一种反应。(illumina.com)

**长读长测序**可获得长度为数千至数十万个核苷酸的序列,具体取决于所用方法和样本。PacBio单分子实时测序通过观察单个聚合酶掺入核苷酸的过程进行测序。环形一致性测序将对同一插入片段的多次观测结果整合起来,生成高准确度读段。纳米孔测序则测量DNA通过纳米尺度孔道时引起的离子电流变化,再通过计算进行碱基识别,将这些信号转换为序列。(genome.gov)

长读段可以跨越难以通过短片段重建的重复序列。一些单分子测序方法还可根据电信号或核苷酸掺入动力学的变化检测DNA甲基化,从而提供碱基顺序之外的信息。(genome.gov)

实验流程与分析

测序实验首先提取DNA,并评估样本的数量和质量。文库制备将样本材料转化为适合测序仪处理的分子。根据具体方案,制备过程可能包括片段化、连接接头以及富集选定区域。一些流程使用聚合酶链式反应扩增DNA,另一些则直接分析未经扩增的分子。样本特异性的索引序列使多个文库能够混合测序,并在之后通过计算将各样本的数据分开。(illumina.com)

测序仪产生的信号会被转换为读段,即对应于样本DNA某些片段的序列。生物信息学分析可将这些读段比对到参考基因组,或通过基因组组装将相互重叠的读段拼接起来。比对用于与已有序列进行比较,而组装则利用片段本身重建更长的序列。(illumina.com)

变异检测用于识别单碱基替换、插入和缺失等差异。随后的注释步骤将这些差异与基因及其他基因组特征联系起来。检测到变异与确定其生物学意义是两项不同的任务;仅凭序列差异并不能证明它会导致疾病。(assets.illumina.com)

准确度与覆盖度

测序质量涉及多个方面,包括读段长度、碱基识别准确度和测序覆盖度。覆盖深度表示某一位置被多少条读段覆盖,覆盖广度则表示目标序列中有多大比例得到覆盖。重复观测可以提高结果的可信度,但平均覆盖深度并不意味着每个位置都获得了相同的覆盖。(illumina.com)

碱基识别质量通常用Phred形式的质量分数表示:

[ Q=-10\log_{10}(p), ]

其中,(p)为碱基识别错误的估计概率。Q30分数对应的估计错误概率为0.001,并不保证读段完全没有错误。样本制备或扩增过程中引入的错误,未必会体现在所报告的碱基识别质量分数中。(illumina.com)

应用与数据治理

全基因组测序考察整个基因组范围内的DNA,而全外显子组测序则集中于蛋白质编码区域。靶向测序针对选定的基因或区段。这些方法支持遗传变异研究,并用于识别与遗传性疾病和癌症相关的变化。它们的检测范围和结果解读方面的局限各不相同。(medlineplus.gov)

比较测序有助于研究进化及生物之间的亲缘关系。宏基因组学分析从生物群落中采集的遗传物质,使研究人员能够研究混合生物样本,而不局限于分离出的单一物种。(genome.gov)

人类序列数据涉及数据隐私问题,因为基因组信息可用于识别个人身份,也可能揭示其生物学亲属的信息。因此,研究治理需要涵盖知情同意、访问控制、未来的数据用途以及基因组信息的共享条件。删除姓名并不能消除所有身份识别风险。(genome.gov)