Les progrès récents dans les outils informatiques ont transformé la génomique, permettant aux chercheurs de rassembler et d'annoter des génomes avec une précision et une rapidité sans précédent.Ces améliorations sont essentielles pour décoder la grande diversité de la vie, des pathogènes microbiens aux organismes eucaryotiques complexes. Le champ est passé de processus manuels à forte intensité de main-d'oeuvre à des pipelines automatisés et évolutives qui peuvent traiter des téraoctets de données de séquençage.

La Fondation : Assemblée du génome

L'assemblage génomique est le processus de calcul de la reconstruction de la séquence originale de l'ADN à partir de lectures fragmentées produites par les plates-formes de séquençage. La complexité de cette tâche provient de séquences répétitives, de génomes polyploïdes et de la taille pure des génomes eucaryotes.

Algorithmes de l'Assemblée de Novo

L'assemblage de novo reconstitue un génome sans référence, ce qui le rend essentiel pour étudier de nouveaux organismes ou espèces sans génome de référence étroitement apparenté.

  • ]]]]]]][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FLT:][FX][FX][FX
  • De Bruijn graph: Efficace pour les lectures courtes, cette méthode se divise en k-mers et construit un graphique. Velvet et SPAdes sont des exemples classiques, avec SPAdes manipulant maintenant des données hybrides.
  • Graphique de bord:[ Une évolution de la CLO, efficace sur le plan de la mémoire, utilisée par miniasm et Raven pour un assemblage rapide à longue lecture.

Séquence longue lecture et son impact

Les technologies à lecture longue (PacBio HiFi, Oxford Nanopore) génèrent des dizaines à des centaines de kilobases de longueur. Ces lectures couvrent des régions répétitives, permettant le montage complet de génomes complexes.

  • Canu: Une fourche de l'assemblage Celera, conçue pour les lectures longues à forte bruit. Elle effectue la correction d'erreur avant l'assemblage.
  • Flye:[ Utilise une approche graphe répétée qui gère les répétitions sans les effondrements, produisant des assemblages très contigus.
  • Shasta: Optimisé pour les lectures de Nanopore d'Oxford, Shasta est rapide et efficace en mémoire, adapté aux grands génomes.
  • Hifiasm: Spécialisé pour les données PacBio HiFi, produisant des assemblages échelonnés avec résolution haplotig.

Approches hybrides

L'assemblage hybride combine la précision des lectures courtes et la continuité des lectures longues. Cette stratégie est particulièrement utile pour le polissage et le remplissage des trous.

  1. Assembler un brouillon avec des lectures longues (p. ex., en utilisant du flyé).
  2. Polonais avec des lectures courtes utilisant Pilon ou FreeBaye.
  3. Échelle à de grands projets comme le Projet de génomes vertébrés (VGP), où les approches hybrides ont permis des assemblages presque complets de centaines de génomes vertébrés.

Ressources externes : Le hub NCBI Assembly fournit des statistiques et des téléchargements agrégés de montage. Pour des tutoriels pratiques, la plateforme Galaxy offre des flux de travail de montage accessibles.

Annotation Génome : Décoder le Plan directeur

Une fois qu'un génome est assemblé, l'annotation identifie les éléments fonctionnels : gènes de codage des protéines, ARN non codant, motifs réglementaires, régions répétées, pseudogenes et variantes structurelles. L'annotation peut être divisée en annotation structurelle (délimiter les limites des gènes) et en annotation fonctionnelle (attribuer des fonctions aux gènes prédits).

Prédiction de l'ab initio Gene

Les méthodes Ab initio utilisent des modèles statistiques de structure génique pour identifier les régions de codage.Elles nécessitent un ensemble de formations de gènes connus. Des outils comme AUGUSUS, GeneMark-ES et GlimmerHMM[ sont communs.

Annotation fondée sur des données probantes

Les approches fondées sur des données probantes utilisent le séquençage de l'ARN, l'homologie des protéines et d'autres données expérimentales pour valider les prédictions.

  • BRAKER1/2/3: Intégrate GeneMark-ET (ARN-seq formé) et AUGUSTUS pour l'annotation eucaryotique entièrement automatisée. BRAKER2 utilise des indices protéiques pour les organismes sans ARN-seq.
  • MAKER2: Un pipeline flexible qui combine les prédictions ab initio, l'homologie et les preuves RNA-seq. Il peut être exécuté de façon itérative pour améliorer la qualité de l'annotation.
  • Prokka: Personnalisé pour les génomes procaryotiques, utilisant des bases de données comme Pfam, TIGRFAMs et COG pour une annotation rapide.

L'apprentissage automatique en annotation

Des outils comme DeepGene et DeepSplice[ utilisent des réseaux neuronaux convolutionnels pour obtenir une précision supérieure à celle des HMM traditionnels. EVM (Evidence Modeler) combine plusieurs ensembles de prédictions en utilisant des poids tirés des données, produisant souvent la meilleure annotation finale. FGENESH++ utilise une approche basée sur l'apprentissage automatique pour des génomes complexes comme les plantes.

Approches comparées et communautaires

La génomique comparée tire parti de la conservation évolutive pour identifier les éléments fonctionnels.Le projet ENCODE a été le pionnier de cette approche pour l'humain. Des logiciels comme PhyloCSF détecte des séquences de codage de protéines conservées, tandis que GERP++ identifie des régions limitées.

Pipelines intégrées et automatisation

La demande de génomes de haute qualité à l'échelle a entraîné le développement de pipelines entièrement automatisés qui gèrent à la fois le montage et l'annotation. Ces systèmes traitent le prétraitement des données, la correction des erreurs, le montage, le polissage, l'échafaudage et l'annotation de façon simplifiée.

  • GAAP (Genome Assembly and Annotation Pipeline): Conçu pour les génomes bactériens et fongiques, il intègre des outils tels que SPAdes, Velvet, Prokka et BUSCO.
  • SuivantDenovo + NextPoland: Une combinaison populaire pour l'assemblage à longue lecture et le polissage, souvent utilisé avec HiFi lit.
  • nf-core/assembflow:[ Un pipeline basé sur Nextflow qui offre des flux de travail modulaires pour l'assemblage et l'annotation, compatibles avec les environnements containerizzato.
  • JBrowse2 / IGV:[ Outils de visualisation qui permettent aux chercheurs de guérir manuellement les annotations et d'identifier les erreurs d'assemblage.

L'automatisation n'élimine pas la nécessité de la guérison manuelle. La combinaison des prédictions computationnelles et de l'examen par des experts demeure la norme d'or pour les génomes de référence.

Évaluation de la qualité

L'outil BUSCO évalue l'exhaustivité en recherchant des orthologs à une seule copie conservés. L'outil NA50/N90 mesure la contiguïté. Des outils comme QUAST et gazzali[ fournissent des rapports détaillés de montage. Pour l'annotation, CEGMA[ et OMA[] sont utilisés. Le Projet de biogénome de la Terre a défini des normes exigeant l'exhaustivité de >90% BUSCO pour les génomes en projet.

Orientations futures

La prochaine décennie apportera plusieurs évolutions transformatrices:

  • Les assemblages télomériques (T2T) :[ Les génomes humains complets sont maintenant possibles grâce à des lectures ultra longues et des algorithmes de montage avancés (p. ex. Verkko). Les projets T2T s'étendent aux organismes modèles.
  • Pangénomes à base de granules:[ Au lieu d'une seule référence linéaire, les graphiques de pangenomes capturent la variation entre les populations. Des outils comme le minigraphe, vg et le concepteur de graphiques PanGenome dirigent ce changement.
  • Annotation en temps réel:[ La diffusion d'outils d'annotation qui traitent les données dans leur séquence pourrait accélérer les applications cliniques, comme l'identification des agents pathogènes dans une éclosion.
  • L'intégration de l'épigénomique: L'annotation de la méthylation de l'ADN, des marques d'histones et de l'accessibilité à la chromatine nécessitera de nouvelles approches computationnelles qui combinent assemblage et données fonctionnelles.
  • Correction d'erreurs par l'IA:[ Des modèles d'apprentissage approfondi formés sur de grands ensembles de génomes validés peuvent prédire et corriger les erreurs de montage avec une grande précision, réduisant la guérison manuelle.

Ressources externes : Le pipeline NCBI Eukaryotic Genome Annotation présente les meilleures pratiques actuelles pour l'annotation automatisée des génomes eucaryotes.

En résumé, les outils informatiques pour l'assemblage et l'annotation du génome ont atteint une maturité qui rend les projets à grande échelle faisables et rentables. La combinaison de séquençage à longue distance, d'intelligence machine et de pipelines intégrés a réduit les obstacles à l'étude des génomes complexes. Au fur et à mesure que ces outils continueront d'évoluer, ils permettront de libérer tout le potentiel de la génomique, de la compréhension de l'arbre de vie à la médecine de précision.