计算工具的最新进步改变了基因组学,使研究人员能够以前所未有的准确度和速度组装和注释基因组。 这些改进对于解码从微生物病原体到复杂的电子生物等生命的多样化至关重要。 该领域已经从劳动密集型人工过程转向自动化的可扩展管道,可以处理测序数据的三字节。 结果,基因组组组装和注释成为个人化医学、作物改良、保护生物学和进化研究突破的基础。

基金会:基因组大会

基因组组装是从测序平台产生的零碎读数中重建原始DNA序列的计算过程。 这项任务的复杂性来自重复序列、多聚基因组以及eukaryotic基因组的庞大规模。早期组装人员依赖于Illumina技术的短读数,这些技术往往会崩溃重复并产生零碎的组件。现代工具通过复杂的算法和多种测序技术的整合来克服这些局限性。

代诺沃议会算法

脱新组装在没有参考的情况下重建基因组,使得研究没有紧密关联的参考基因组的新生物或物种至关重要. 算法使用不同的方法:

  • 重叠-排出-共识(OLC):适合长读,OLC直接读来构建凸轮. Canu[ Flye 等工具使用OLC,并对PacBio或Oxford Nanopore数据进行校正.
  • De Bruijn图: 高效的短读,这种方法会分解成k-mers并构建一个图. Velvet和SPAdes是经典的例子,现在SPAdes处理混合数据.
  • 弦图: OLC的内存高效演化,用于miniasm 和[ Raven []快速长读组装.

长读顺序及其影响

长读技术(PacBio HiFi,牛津纳诺波雷)生成的读数为数十至数百千基,这些读数跨了重复的区域,使得复杂的基因组能够完全组装。

  • Canu: Celera Assembler的叉,设计用于高噪读长,在装配前进行错误校正.
  • Flye:[]使用重复的图法,处理重复而不折叠,产生高度毗连的组装.
  • 夏斯塔:[] 优化为牛津纳诺波雷读,夏斯塔速度快,记忆力高效,适合大型基因组.
  • Hifiasm:专用于PacBio HiFi数据,生成带有haplotig分辨率的相位组件.

混合办法

混合组合将短读的精度与长读的连续性结合起来,这一策略对抛光和填充漏洞特别有用。

  1. 将长读的草稿(例如使用Flye)集合起来.
  2. 短写波兰语读音使用皮隆FreeBayes.
  3. 被放大到诸如Vertebrate基因组项目(VGP)等大型项目,其中混合方法使得数百个脊椎动物基因组的组装近乎完成.

外部资源:NCBI大会枢纽提供汇总的集合统计和下载,对于实用的教程, Galaxy平台[提供无障碍的集合工作流程.

基因组注释:解码蓝图

基因组组装后,注释会识别功能要素:蛋白质编码基因,非编码RNA,调控motifs,重复区域,假基因,结构变体. 注释可以分为结构注释(分解基因边界)和功能注释(将函数指定为预测基因). 最近的计算进步通过整合ab initio预测,tellopomic experience,以及比较基因组学,大大提高了精度.

Ab Initio 基因预测

Ab initio方法使用基因结构的统计模型来识别编码区域,它们需要一套已知基因的训练集. AUGUSTUS ,GeneMark-ES ,以及[GlimerHMM[]等工具很常见. 较新版本的杠杆机学可以提高敏感性,特别是对于非卡诺尼克斯突起点的敏感度. GeneMark-EP+,例如使用一种没有事先注释的自训练方法.

循证说明

基于证据的方法利用RNA-seq,蛋白质同位素等实验数据验证预测。这在eukaryotic基因组项目中是现在的标准。关键管道包括:

  • BRAKER1/2/3: 整合了GeneMark-ET(RNA-seq训练)和AUGUSTUS,用于全自动eukaryotic 注释. BRAKER2为没有RNA-seq的生物使用蛋白质提示.
  • MAKER2: 一种灵活的管道,它结合了从头到尾的预测,同义,和RNA-seq证据。它可以反复运行,以提高注释的质量。
  • Prokka:[ 适合亲子基因组,使用Pfam,TIGRFAMs,COGs等数据库进行快速注释.

笔记中的机器学习

深层学习已经进入基因组注释,模型可以预测促进者,spilice sites,甚至变体的功能影响. DeepGenedeepSpliice等工具使用进化神经网络,实现比传统的HMM更高的精度. EVM(Eventence Modeler) 结合了利用从数据中吸取的权重的多个预测集,经常产生最好的最终注释. FGENESH++ 对植物等复杂的基因组采用机器学习法.

比较和社区办法

比较基因组学利用进化保护来识别功能元素. ENCODE项目为人类开创了这个功能. 软件如PhyloCSF检测到保存的蛋白编码序列,而GERP++[识别受限制区域. Ensembl[ Ensembl等社区数据库为许多物种提供了自动的注释更新,为质量控制设定了标准.

综合管道和自动化

对大规模高质量基因组的需求推动了管理组装和注释的全自动管道的发展,这些系统以简化的方式处理数据处理、错误校正、组装、抛光、脚手架和注释。

  • GAAP(基因组大会和注释管道): 为细菌和真菌基因组设计,集成SPAdes,Velvet,Prokka,BUSCO等工具.
  • NextDenovo + NextPolish: 一种流行的组合,用于长读组装和抛光,常与HiFi一起读取.
  • nf-core/组装流: 下流的管道,提供模块化的组装和注释工作流程,与集装箱化环境兼容.
  • JBrowse2 / IGV:[]可视化工具,使研究人员能够手动整理注释,识别错误组装.

自动化并不能消除人工测算的需要,计算预测与专家评审相结合仍然是参考基因组的金本位.

质量评估

强质量度量衡是不可或缺的。 BUSCO 工具通过搜索保存的单拷贝正统图来评估完整性。使用NA50/N90 统计测量毗连性。诸如QUST [ Gazzali GAUSCO 等工具为基因组草案规定了要求完整和光学的标准。

未来方向

下一个十年将带来若干变革性的发展:

  • Telomere-to-telomere(T2T)组件:[] 由于超长读数和高级组装算法(如Verkko),现在完全人类基因组是可能的. T2T项目正在向模型生物扩展.
  • Graph 基泛基: 代替单一线性参考,泛基基图捕捉到不同人群的变异。像迷你图, vg,和泛基图构建器这样的工具正在引导这种转变。
  • 真实时间注释:[ 流化注释工具,在排列时处理数据,可以加速临床应用,例如在爆发时识别病原体.
  • 融合外观学:[ 注释DNA甲基化,异质标记,以及铬素的可访问性,将需要新的计算方法,将组装与功能数据结合起来.
  • AI驱动的错误校正:[]在大组验证基因组上训练的深层学习模型可以高精度预测和纠正组装错误,减少人工校正.

外部资源:NCBI Eukaryotic Genome Annotic predate展示了目前电子基因组自动注释的最佳做法.

简言之,基因组组组装和注释的计算工具已经成熟,使得大规模项目可行且具有成本效益。 长读测序、机器智能和集成管的结合降低了研究复杂基因组的障碍。 随着这些工具不断发展,它们将释放基因组学的全部潜力,从了解生命之树到提供精密医学。 研究人员必须了解最新发展,为特定生物体和问题选择最佳方法。