Table of Contents
RNA测序(RNA-seq)通过实现RNA分子的全基因组量化和特征化,改变了转录基因组学。 技术自诞生以来,从大块测量到单细胞分辨率,从短读到长读,从间接检测到直接询问本地RNA。 这些发展不仅加深了我们对基因调控的理解,也为临床诊断、药物发现和个人化医学开辟了新的可能性。 文章探讨了RNA-seq技术的最新进步,包括测序平台、单细胞和空间方法、直接RNA测序、生物信息学工具和新出现的临床应用。
排序平台的进展
短读序列:高通量和准确度
下一代测序(NGS)平台,特别是来自Illumina的测序平台,继续主导着短读RNA-seq市场. Illumina NovaSeq 6000 提供了前所未有的吞吐量,使得数百个样本在单跑中进行测序,同时保持高精度和低廉的每基数成本. NovaSeq X系列的近期升级进一步提高了数据质量,缩短了周转时间,这些平台仍然是基因和异位数的差分表达分析,变异检测和记录量化的黄金标准.
长读序列: 抓取全连刻
牛津纳米波尔技术和太平洋生物科学(PacBio)的长读技术已经显著成熟,现在提供了超过10千基的读数。 Oxford Nanopore的MiniON[和Promethion平台提供了本地RNA分子的实时测序,而PacBio的HiFi读数则达到了全长CDNA的99%以上。 这些能力对于解决复杂的记录单异构物、识别聚变基因和在非模型生物中组装完整的记录仪至关重要。 短读精度与长读连续性结合,现在在许多混合测序工作流程中是标准。
单Cell和空间成像仪
单Cell RNA 序列: 重解细胞异质性
单细胞RNA测序(scRNA-seq)已经成为现代转录基因学的基石. Droplet基方法,如10x基因组 Chromium[,能够以可控成本对单个实验中的数万个细胞进行剖面分析. 最近的创新包括组合索引方法(如sci-RNA-seq),这种方法可以进一步扩大吞吐量,而不需要专门的微流装置. 这些方法揭示了罕见的细胞群,动态细胞状态,以及发育,免疫和疾病的线程轨迹.
空间文字学:添加组织背景
散装和单细胞RNA-seq失去空间信息. 空间转录技术,如10x维西安,滑翔-seq,和MERFISH,现在允许基因表达测量同时保留组织架构. Visium在幻灯片上使用条码捕捉探头从组织部分绘制RNA图,在近单细胞分辨率下,MERFISH和以下FISH+等高分辨率方法可以在细胞子局部化中解决数百个基因,这些技术正在使我们对肿瘤微观环境,脑组织,发育生物学的理解发生革命性的变化.
直接 RNA 序列和 Epitranscriptimics 学
直接RNA 序列:减少比喻
传统的RNA-seq需要反转转转录,这引入了偏差,特别是在5 ' 端和GC富含区域. 牛津纳诺波尔率先推出的直接RNA测序,不转换为cDNA而进行原生RNA分子的序列. 这种方法捕捉到真实的RNA修改,多(A)尾长,以及全长的抄录结构. 纳米孔径化学和基调算法的最新改进提高了吞吐量和精度,使得直接RNA-seq对于全转录仪的研究是实用的.
检测RNA修改
RNA分子含有超过170种已知的化学改变,如N6-甲基甲苯(m6A),伪尿素,以及5-甲基细胞素。这些改变调节了突变,稳定性和翻译。直接RNA测序可以识别由修改引起的碱性调试错误或信号转移,从而能够对修改进行全读图,而无需抗体拉动。 新的计算工具如Tombo、Nanocompore和m6Anet利用原始纳米孔信号在单基分辨率下检测m6A和其他标记。这个领域被称为“外观”的领域正在迅速发展,有望发现新的基因调控层。
用于成文分析的生物信息学工具
对齐和量化
RNA-seq数据的爆炸推动了复杂的计算工具的开发。 简而言之, 诸如STAR 和 HISAT2 等 Splice-aware 配对器提供了快速准确的映射。 沙门和Kallisto等Pseudaligners通过不完全对齐估计记录的丰度, 大大加快量化。 midmap2 和 uLTRA 等长读配对工具处理长读的突变的复杂性。 以云为基础的平台, 如 Terra 或 DNAnexus , 使研究人员能够在没有本地基础设施的情况下分析大型数据集。
不同表达和施片分析
差异表达的统计方法变得更加有力。 诸如DESeq2、 edgeR、 limma-voom 模型计数数据等工具, 并附有适当的分布、 处理批量效应、 控制假发现率。 对于差异分型和异构使用、 rMATS、 LeafCutter 和 SUPPA2 杠杆交叉计数或记录量化, 以识别其他的分型事件。 与机器学习相结合, 正在改进对与疾病相关的细微分型变化的检测。
云计算和可复制性
现代的转录模型的规模需要可扩展计算。 使用Docker、Snakemake或Nextflow的可复制工作流程现在已经是标准的工作流程。 癌症基因组图集(TCGA)和ENCODE等公共存储器提供了大量数据集进行二次分析。 集装箱化工具确保不同计算环境之间一致的结果。 RNA-seq生物信息学的未来在于自动化管道,其中包含质量控制、正常化和可视化,用户干预程度最小。
临床和翻译应用
癌症病谱学
RNA-seq在肿瘤学中被广泛用于识别聚变基因,突变变,以及指导预后和治疗的表达特征. 例如,BCR-ABL,EML4-ALK,以及TMPRSS2-ERG等基因聚变的检测在临床RNA-seq板中现在已成为常规. 单细胞RNA-seq正在发现肿瘤异性与抗性机制. 液态生物检查使用细胞无RNA的血液提供一种非侵入性的方法来监测疾病的发展和治疗反应.
罕见疾病诊断
转写基因测序可以补充诊断罕见遗传病的外观或基因组测序. 它可以识别异常突变,单烯表达,以及表达异常,以表示非编码区域病原变体. 诸如未诊断疾病网络和基因组学英格兰等大型项目证明了RNA-seq在解决先前未解病例中的效用. 结合短读和长读RNA-seq可以改善对影响记录的结构性变体的检测.
挑战与未来方向
费用和可扩展性
尽管成本大幅降低,但许多临床环境的常规RNA-seq仍然昂贵。 单细胞和空间方法对于常规大规模研究来说仍然具有成本禁令。 长读测序需要高输入RNA和专门协议。 微流、自动化和测序化学方面的持续进步有望进一步降低成本。 类似MINION这样的便携式设备在低资源环境下可以进行测序。
数据复杂性和整合
多基因组融合-将转录组学与基因组学、蛋白质组学和基因组学合并-需要先进的统计学和机器学方法。多基因组因子分析和深层学习模型等方法可以确定跨数据层的一致生物路径。 处理批量效应、缺失数据和不同的测量尺度仍然具有挑战性。 制定统一标准,如GA4GH和FAIR原则,对于可复制的研究至关重要。
人工智能和预测模型
AI越来越多地用于对转录分析. 深神经网络预测序列的分解结果,从表达剖面中将肿瘤亚型分类,并识别具有药物反应的生物标记. 适应基因组数据的变形器和大型语言模型正在出现(如DNABERT,Enformer). 这些工具有望从转录数据中获取更深的洞察力,但需要大型,精密的训练数据集和仔细的解读以避免过度匹配.
结论
RNA测序技术正在以显著的速度发展。 从改进的短读平台到单细胞和空间方法,研究人员现在拥有前所未有的工具包来询问记录仪。直接RNA测序和缩写学通过捕捉RNA的修改和原生分子增加了一个新的维度。生物信息学管道不断演化,使分析更加容易获取和可再生产。 随着成本的下降和与其他基因学的融合的改善,RNA-seq将在基础生物学和临床医学中发挥着越来越重要的作用,使得发现成为了十年前无法想象的。