Los avances recientes en herramientas computacionales han transformado la genómica, permitiendo a los investigadores reunir y anotar genomas con precisión y velocidad sin precedentes. Estas mejoras son fundamentales para decodificar la vasta diversidad de vida, desde patógenos microbianos hasta organismos eucariotas complejos. El campo ha pasado de los procesos mano a los cultivos automatizados y escalables que pueden manejar terabytes de ensamblaje de datos.

La Fundación: Asamblea General

El montaje genoma es el proceso computacional de reconstruir la secuencia original del ADN de lecturas fragmentadas producidas por plataformas de secuenciación. La complejidad de esta tarea surge de secuencias repetitivas, genomas poliploides, y el tamaño de la cuna de genomas eucarísticos. Los primeros ensambladores se basaron en lecturas cortas de la tecnología Illumina, que a menudo derrrepitieron y produjeron conjuntos fragmentados.

Algoritmos de la Asamblea de Novo

De novo assembly reconstruye un genoma sin referencia, lo que hace esencial para estudiar organismos o especies novedosas sin un genoma de referencia estrechamente relacionado. Los algoritmos utilizan diferentes enfoques:

  • Overlap-layout-consensus (OLC):] Apto para lecturas largas, OLC superó las lecturas directamente para construir contigs. Herramientas como Canu y Flye] usan OLC con correcciones para Pacporeio.
  • ] Gráfico de Bruijn: Eficiente para lecturas cortas, este método se divide en k-mers y construye un gráfico. Velvet y SPAdes son ejemplos clásicos, con SPAdes ahora manejando datos híbridos.
  • Gráfico de cuerda:] Evolución de la memoria de la OLC, utilizada por mismo y Raven para una rápida asamblea de larga duración.

La secuencia de larga duración y su impacto

Las tecnologías de lectura larga (PacBio HiFi, Oxford Nanopore) generan lecturas de decenas a cientos de kilobases de largo. Estas lecturas abarcan regiones repetitivas, permitiendo la completa asamblea de genomas complejos.

  • Canu:] Un tenedor del Assembler Celera, diseñado para lecturas largas de alto ruido. Realiza corrección de error antes de la asamblea.
  • Flye:] Usa un enfoque gráfico repetido que maneja repite sin descolgarlos, produciendo asambleas altamente contiguas.
  • Shasta:] Optimizado para Oxford Nanopore lee, Shasta es rápido y eficiente en memoria, adecuado para grandes genomas.
  • Hifiasm:] Especializado para los datos PacBio HiFi, produciendo asambleas graduales con resolución haplotig.

Enfoques híbridos

El montaje híbrido combina la precisión de lecturas cortas con la contigüidad de lecturas largas. Esta estrategia es especialmente útil para pulir y rellenar brechas.

  1. Envuelve un borrador con lecturas largas (por ejemplo, usando Flye).
  2. Polaco con lecturas cortas utilizando Pilon o FreeBayes].
  3. Escalada a grandes proyectos como el Proyecto Vertebrate Genomes (VGP), donde los enfoques híbridos han permitido a conjuntos casi completos de cientos de genomas vertebrados.

Recursos externos: El ]Centro de la Asamblea Nacional] proporciona estadísticas y descargas de montaje agregadas. Para tutoriales prácticos, la plataforma Galaxy ofrece flujos de trabajo de montaje accesibles.

Anotación genoma: Decodificación de la huella

Una vez que se monta un genoma, la anotación identifica elementos funcionales: genes de codificación de proteínas, ARN no codificadores, motivos regulatorios, regiones repetidas, pseudogenes y variantes estructurales. La anotación puede dividirse en anotación estructural (delineación de límites genéticos) y anotación funcional (asignación de funciones para genes predicho).

Ab Initio Gene Prediction

Los métodos de Ab initio utilizan modelos estadísticos de estructura genética para identificar regiones de codificación. Requieren un conjunto de formación de genes conocidos. Herramientas como AUGUSTUS, GeneMark-ES], y GlimmerHMM sptrain] son comunes.

Anotación basada en pruebas

Los enfoques basados en pruebas utilizan RNA-seq, homología de proteínas y otros datos experimentales para validar las predicciones. Esto es ahora estándar en los proyectos de genoma eucarístico.

  • BRAKER1/2/3: Integra GeneMark-ET (RNA-seq trained) y AUGUSTUS para la anotación eucariota totalmente automatizada. BRAKER2 utiliza indirectas de proteína para organismos sin RNA-seq.
  • MAKER2: Un oleoducto flexible que combina predicciones de ab initio, homología y evidencia de ARN-seq. Puede ser dirigido iterativamente para mejorar la calidad de anotación.
  • Prokka:] Alineado para genomas procariotas, utilizando bases de datos como Pfam, TIGRFAMs y COGs para una anotación rápida.

Aprendizaje de máquina en anotación

El aprendizaje profundo ha entrado en la anotación del genoma, con modelos que pueden predecir promotores, sitios de empalmes e incluso impacto funcional de las variantes. Herramientas como DeepGene y DeepSplice utilizan redes neuronales convocionales para lograr mayor precisión que las plantas tradicionales de HMM.

Comparative and Community Approaches

La genómica comparada aprovecha la conservación evolutiva para identificar elementos funcionales. El proyecto ENCODE lo pionió para humanos. Software como PhyloCSF detecta secuencias de codificación de proteínas conservadas, mientras que GERP++ identifican muchas regiones limitadas.

Pipelines y automatización integrados

La demanda de genomas de alta calidad a escala ha impulsado el desarrollo de tuberías totalmente automatizadas que gestionan tanto el montaje como la anotación. Estos sistemas manejan el preprocesamiento de datos, corrección de errores, montaje, pulido, andamiaje y anotación de una manera simplificada.

  • GAAP (Asamblea de Genoma y Anotación Pipeline):] Diseñado para genomas bacterianos y hongos, integra herramientas como SPAdes, Velvet, Prokka y BUSCO.
  • SiguienteDenovo + NextPolish: Una combinación popular para el montaje y el pulido de larga duración, a menudo utilizado con lecturas de HiFi.
  • nf-core/assembflow: Un oleoducto basado en Nextflow que ofrece flujos de trabajo modulares para montaje y anotación, compatibles con entornos containerizzatos.
  • JBrowse2 / IGV:] Herramientas de visualización que permiten a los investigadores comisariar manualmente anotaciones e identificar conjuntos erróneos.

La automatización no elimina la necesidad de curación manual. La combinación de predicciones computacionales con revisión experta sigue siendo el estándar de oro para genomas de referencia.

Evaluación de la calidad

[LT] [LT] La herramienta de medición de calidad es esencial. La herramienta BUSCO evalúa la integridad buscando ortodología de una copia conservada. ]N50/N90 estadística mide la contigüidad.

Future Directions

La próxima década traerá varios desarrollos transformadores:

  • Conjuntos de telomere-to-telomere (T2T): Los genomas humanos completos son ahora posibles gracias a los algoritmos de lectura y montaje avanzados de ultralong (por ejemplo, Verkko). Los proyectos T2T se están expandiendo a los organismos modelo.
  • Pangenomes basados en gráficos: En lugar de una sola referencia lineal, los gráficos pangenomo capturan la variación entre las poblaciones. Herramientas como minigraph, vg y PanGenome Graph Builder están liderando este cambio.
  • Anotación de tiempo real: La transmisión de herramientas de anotación que procesan datos según se secuencian podría acelerar aplicaciones clínicas, como la identificación de patógenos en un brote.
  • Integración de la epigenomía: Anotar la metilación del ADN, las marcas de piedra y la accesibilidad de la cromatina requerirá nuevos enfoques computacionales que combinen el montaje con datos funcionales.
  • Corrección de error impulsada por AI: Los modelos de aprendizaje profundo formados en grandes conjuntos de genomas validados pueden predecir y corregir errores de montaje con alta precisión, reduciendo la curación manual.

Recursos externos: El gasoducto de anotación de genomas Eukaryotic muestra las mejores prácticas actuales para la anotación automatizada de los genomas eucarísticos.

En resumen, las herramientas computacionales para el montaje del genoma y la anotación han alcanzado una madurez que hace factible y rentables proyectos a gran escala. La combinación de secuencias de lectura larga, inteligencia de la máquina y tuberías integradas ha reducido las barreras para estudiar genomas complejos. A medida que estas herramientas continúan evolucionando, desbloquearán todo el potencial de la genómica, desde la comprensión del árbol de la vida hasta la medicina de precisión.